警示
IBM Cloud Logs 警示可讓您及時偵測異常、主動事件回應、改善平均解決時間 (MTTR)、減少手動監視工作、自訂作業及彈性。 採用機器學習技術,警示會主動通知團隊潛在問題,使事件產生關聯,並提供主要原因分析。
警示如何運作
警示遵循一般工作流程,以瞭解如何產生、觸發及遞送給使用者。
-
設定警示規則
管理者、開發人員或 DevOps 會在觀察平台內定義警示規則。 這些規則指定觸發警示的條件。 例如,他們可以設定規則,以在日誌中出現特定錯誤訊息時警示。
-
資料收集和分析
IBM Cloud Logs 會持續從系統收集資料,包括日誌和度量值。 它會根據已定義的警示規則來處理及分析此資料。
-
警示觸發
當受監視資料符合警示規則中指定的條件時,會觸發警示。 觸發可能是錯誤率突然激增、高延遲、低資源可用性或任何其他預先定義異常的結果。
-
警示聚集和刪除重複資料
警示系統可能會將多個類似警示聚集成單一通知,以防止大量使用者使用冗餘通知。 此外,它可以刪除重複警示,以避免傳送使用者重複資訊。
-
通知及呈報
觸發並處理警示之後,系統會將通知傳送給指定的使用者或團隊。 通知可以透過各種通道遞送,例如電子郵件、Slack、SMS 或整合事件管理平台。 如果狀況仍未解決,則可以將警示呈報給高階團隊或個人。
-
警示解決及確認
警示的收件者會確認警示,並採取適當的動作來解決此問題。 解決問題之後,他們會將警示標示為「完成」。
-
監視及報告
在整個警示處理程序中,IBM Cloud Logs 會持續監視系統的狀態。 它可以追蹤確認狀態、解決時間及其他度量值,以產生報告並協助進行發生事件後分析及改善。
警示類型
IBM Cloud Logs 提供 6 種您可以配置的警示類型。
有關如何配置警報的更多信息,請參閱配置警報。
標準警示
標準警示是日誌變更所觸發的警示。 透過跨越特定日誌的設定數量臨界值來觸發,此特性可讓您監視系統效能、在發生變更時收到通知,以及精確找出潛在原因。 當嘗試測量特定事件的發生次數時,這些警示非常有用。
使用標準警示特性,您可以:
-
即時監視系統效能。 根據您選擇的準則取得即時洞察。
-
針對您的特定需求建構查詢。 定義查詢來擷取您要檢查的日誌,並依應用程式、子系統和嚴重性來過濾,使查詢更具體。 然後,選取觸發警示的條件範圍。 例如,您可以設定在特定時間範圍內收到超過 10 個日誌時觸發警示。
-
使用機器學習型方法。 IBM Cloud Logs 會使用此設定來側寫您的資料,並自動偵測異常行為。
-
接收個人化通知。 接收即時推送通知至您偏好的通訊通道。
標準警示是 IBM Cloud Logs提供的最簡單警示。 這些可用來涵蓋您最明顯的使用案例,作為觀察系統的基礎。
時間相對警示
使用時間相對警示來自動偵測系統中的異常行為。 當固定比例達到與過去時間範圍相比較的設定臨界值時,會觸發警示。
使用時間相對警示來執行下列動作:
-
接收系統安全、作業或商業行為在一段時間內發生變更的自動警示。
-
比較不同時段之間的行為。 例如,
- 安全
- 接收自動警示,以比較可疑行為。 例如,比較跨日或週的 NX 網域名稱回應或管理者登入次數。
- Operations
- 接收關於應用程式中錯誤率及頁面載入時間的自動警示。 例如,比較過去一天或一小時的錯誤率及頁面載入時間。
- 事業
- 當發生銷售或使用者註冊中的輪班時,接收自動警示。 例如,比較上週同一天的購買數,或使用者在上個月的註冊數。
唯一計數警示
隨著資料量增長,以及日誌、度量值及安全系統所產生的警示數目呈指數增長,其中一個最強大的警示重要性指標是受警示影響的元素數目。 範例包括: 呼叫 API 時發生 5XX 錯誤的使用者數目、傳回錯誤的 Kafka 消費者群組數目、目前正在載入您網站超過 3 秒的 CDN 位置數目,或單一使用者嘗試登入雲端服務主控台的不同密碼數目。
大部分警示的問題是它們說明問題。 不過,若要瞭解問題的嚴重性或廣泛程度,使用者需要深入探查資料或依賴儀表板。
「唯一計數」警示會針對符合特定搜尋準則之所選索引鍵內的唯一值數目觸發。 亦即,符合搜尋之特定索引鍵的基數。
比例警示
您可以計算兩個日誌查詢之間的比例,並在比例達到設定臨界值時觸發警示。
使用此比例警示來監視:
-
作業性能: 監視送入要求的送出回應數,或特定錯誤碼與整體錯誤數的比例。
-
行銷: 監視區域行銷活動之後來自特定區域的資料流量與整體資料流量之間的比例。
-
安全: 監視拒絕要求、特定管理作業或來自已封鎖網域的要求與所有要求的比例。
新值警示
在時間間隔內第一次出現新值會觸發新值警示。 所有值都會針對在警示作用中時動態建立的清單進行測試。 警示是由特定查詢所設定,可識別日誌子集 (必要的話),並以索引鍵來定義,以追蹤所需間隔內的新值。
此警示可協助您自動偵測系統內可能的異常行為。
此警示類型的用法範例包括:
-
安全: 新的網域連線可以觸發警示。 因為 IBM Cloud Logs 安全會記載所有網路資料流量的所有安全資訊,所以新的網域連線可能會導致欄位
security.highest_registered_domain具有新值。 新的網域連線可以指向可能的安全攻擊。 -
監視: 新的應用程式錯誤碼可以觸發警示。 許多應用程式都會傳送
error_code欄位。 此欄位的新值可以指出應用程式的新問題。
流程警示
流程警示設計為在定義的時間範圍內以特定順序發生任何警示事件組合時通知您。
例如,若要收到高 CPU 使用率導致 HTTP 錯誤率增加的通知,可以將流程警示配置為在定義的時間範圍內,在高 CPU 使用率警示後面接著高 HTTP 錯誤率警示時觸發。
以下是使用流程警示的部分好處:
-
綜合性資料關聯: 使用流程警示,您可以將日誌、度量值及安全事件上的警示產生關聯。 此方法提供系統效能的整體視圖,而非隔離的資訊片段。 相關資訊可協助您擁有做出明智決策所需的所有資料。
-
進階主要原因分析: 流程警示可以配置為識別問題的主要原因。 您可以定義警示來精確指出問題的主要原因,因此可以立即回應問題,從而減少系統關閉時間並加強作業效率。
-
減少警示疲勞: 傳統監視系統通常會讓使用者大量使用冗餘警示,導致警示疲勞及可能忽略重要問題。 流程警示可以套用已排序且有時限的準則過濾器,以減少虛假警示。 這表示當符合所有設定的條件時,會向您發出警示,以減少不必要的通知雜訊。
-
可自訂的警示順序: 使用此流程警示唯一特性,您可以使用簡式拖放介面來定義警示順序。 建立只有在訂單和時間符合所有準則時才會觸發的流程。
-
有效率的疑難排解: 藉由在畫布上視覺化警示序列的能力,疑難排解變得更有效率。 您可以輕鬆識別型樣,瞭解導致警示的事件鏈,並快速採取行動來更正問題。
-
最佳化資源使用率: 透過減少錯誤警示並啟用主要原因識別,您將節省時間和資源。 透過最佳化,您的團隊可以專注於更具策略性的作業,而不是被持續的假警報串流所佔用。
IBM Cloud Logs 提供流程建置器工具,以視覺化方式將觸發流程警示的使用者定義警示鏈結在一起。 流程警示的基本建置區塊是階段和群組。
群組代表個別使用者定義警示的邏輯組合。 群組支援 OR、AND 及 NOT 邏輯運算子,以結合多個個別警示。
階段代表需要在指定時間範圍內觸發的警示群組。 一個階段中可以呈現多個群組。
流程警示具有下列限制:
- 流程警示必須至少有 2 個階段。
- 流程警示的第一個階段只能包含 1 個群組。
- 所有階段中的時間範圍持續時間不能超過 36 小時。
- 您最多可以將 30 個警示結合至單一流程警示。
- 下列流程警示警示類型不支援 NOT 邏輯運算子:
- 新值警示
- 唯一計數警示
- 立即通知
- 標準警示