臨界值警示
您可以使用表單或 PromQL 在警報編輯器中定義 IBM Cloud Monitoring 閾值警報(以前稱為指標警報)。
如需配置警示的相關資訊,請參閱 使用警示編輯器來配置警示。
指定觸發閾值警報時的條件
在警示編輯器中,於 度量值與條件 區段中指定下列項目。
- 範圍
- 依預設,警示會設為套用至團隊範圍的 整個基礎架構。 不過,您可以依特定標籤 (例如
container_name或kube_namespace_name) 來過濾,以限制警示範圍。 - 度量
- 選取您要監視的度量值,並配置您要如何聚集資料。 然後,您可以選擇最適合您需要的聚集方法。 例如,如果您想要瞭解整個叢集的平均延遲時間,則可以使用平均聚集。 或者,如果您想要識別具有最高延遲的節點,則可以使用聚集上限。
- 依客群分組
- 透過依標籤 (例如
container_name) 將度量值分組,會為每一個容器產生唯一區段。 這可讓您快速偵測特定儲存器是否負責效能提升。 - 時間聚集
- 警報規則的時間聚合也稱為範圍,它決定聚合所選指標的時間視窗。 例如,如果您選擇
avg聚合為cassandra_read_latency具有指定範圍的指標,它計算平均值cassandra_read_latency該時間窗口內的指標。 此範圍定義了度量值被考慮用於時間聚合的時間早期的時間。 - 持續時間
- 持續時間定義了觸發警報之前必須連續滿足警報條件的時間。 例如,持續時間 10m 意味著必須滿足連續10分鐘的條件。 如果在此期間的任何時間未滿足警報條件,則 10 分鐘計時器將重置,並且必須再次滿足完整、不間斷的 10 分鐘。 設定較長的持續時間可以防止因短暫的閾值違規而觸發警報,從而減少誤報。
時間聚合和持續時間
警報查詢的時間聚合定義了評估相關指標資料的時間段。 不應將其與警報規則的持續時間混淆,後者是指在觸發警報之前必須滿足警報條件的時間長度。
臨界值
定義用於評量警示條件的臨界值和時間範圍。
| 聚集 | 說明 |
|---|---|
| average | 整個時間段內檢索到的指標值的平均值。 |
| sum | 已評估時段內的度量總和。 |
| maximum | 時段內擷取的度量值上限。 |
| minimum | 時段內擷取的度量值下限。 |
閾值警報通知中的影像
轉發到 Slack 或電子郵件的閾值警報通知包括觸發時間序列資料的快照。 對於 Slack 通知頻道,可以在通知頻道設定內啟用或停用 Snapshot。 當通道配置為 解決時通知時,也會在通知中提供解決警示之時間序列資料的 Snapshot。
配置多個臨界值
除了警示臨界值之外,還可以配置警告臨界值。 警告臨界值及警示臨界值可以與不同的通知通道相關聯。 在下列範例中,使用者可能想要將警告及警示通知傳送至 Slack,但如果符合警示臨界值,也會在 PagerDuty 上呼叫待命團隊。
如果警告及警示臨界值都與相同的通知通道相關聯,則立即超出警示臨界值的度量將忽略警告臨界值,且只會觸發警示臨界值。
沒有度量資料時警示
當度量值停止報告資料時,無法評估使用那些度量值的警示。 若要確保您知道何時發生此情況,您可以透過將 設定 區段中的 無資料 選項配置為忽略或通知,來配置要在 無資料 時通知的警示。
將警示配置轉換為 PromQL
您可以自動從表單轉換為 PromQL,以利用 PromQL的彈性和功能。 使用 轉換為 PromQL 選項可讓您配置複式查詢。
例如,下列查詢會查看主機上可用記憶體的百分比。
sysdig_host_memory_available_bytes / sysdig_host_memory_total_bytes * 100
臨界值與查詢分開配置,可讓使用者同時指定警示臨界值及警告臨界值。