臨界值警示

您可以使用表單或 PromQL 在警報編輯器中定義 IBM Cloud Monitoring 閾值警報(以前稱為指標警報)。

如需配置警示的相關資訊,請參閱 使用警示編輯器來配置警示

指定觸發閾值警報時的條件

在警示編輯器中,於 度量值與條件 區段中指定下列項目。

範圍
依預設,警示會設為套用至團隊範圍的 整個基礎架構。 不過,您可以依特定標籤 (例如 container_namekube_namespace_name) 來過濾,以限制警示範圍。
度量
選取您要監視的度量值,並配置您要如何聚集資料。 然後,您可以選擇最適合您需要的聚集方法。 例如,如果您想要瞭解整個叢集的平均延遲時間,則可以使用平均聚集。 或者,如果您想要識別具有最高延遲的節點,則可以使用聚集上限。
依客群分組
透過依標籤 (例如 container_name) 將度量值分組,會為每一個容器產生唯一區段。 這可讓您快速偵測特定儲存器是否負責效能提升。
時間聚集
警報規則的時間聚合也稱為範圍,它決定聚合所選指標的時間視窗。 例如,如果您選擇 avg 聚合為 cassandra_read_latency 具有指定範圍的指標,它計算平均值 cassandra_read_latency 該時間窗口內的指標。 此範圍定義了度量值被考慮用於時間聚合的時間早期的時間。
持續時間
持續時間定義了觸發警報之前必須連續滿足警報條件的時間。 例如,持續時間 10m 意味著必須滿足連續10分鐘的條件。 如果在此期間的任何時間未滿足警報條件,則 10 分鐘計時器將重置,並且必須再次滿足完整、不間斷的 10 分鐘。 設定較長的持續時間可以防止因短暫的閾值違規而觸發警報,從而減少誤報。

時間聚合和持續時間

警報查詢的時間聚合定義了評估相關指標資料的時間段。 不應將其與警報規則的持續時間混淆,後者是指在觸發警報之前必須滿足警報條件的時間長度。

臨界值

定義用於評量警示條件的臨界值和時間範圍。

聚集方法
聚集 說明
average 整個時間段內檢索到的指標值的平均值。
sum 已評估時段內的度量總和。
maximum 時段內擷取的度量值上限。
minimum 時段內擷取的度量值下限。

閾值警報通知中的影像

轉發到 Slack 或電子郵件的閾值警報通知包括觸發時間序列資料的快照。 對於 Slack 通知頻道,可以在通知頻道設定內啟用或停用 Snapshot。 當通道配置為 解決時通知時,也會在通知中提供解決警示之時間序列資料的 Snapshot。

配置多個臨界值

除了警示臨界值之外,還可以配置警告臨界值。 警告臨界值及警示臨界值可以與不同的通知通道相關聯。 在下列範例中,使用者可能想要將警告及警示通知傳送至 Slack,但如果符合警示臨界值,也會在 PagerDuty 上呼叫待命團隊。

如果警告及警示臨界值都與相同的通知通道相關聯,則立即超出警示臨界值的度量將忽略警告臨界值,且只會觸發警示臨界值。

沒有度量資料時警示

當度量值停止報告資料時,無法評估使用那些度量值的警示。 若要確保您知道何時發生此情況,您可以透過將 設定 區段中的 無資料 選項配置為忽略或通知,來配置要在 無資料 時通知的警示。

將警示配置轉換為 PromQL

您可以自動從表單轉換為 PromQL,以利用 PromQL的彈性和功能。 使用 轉換為 PromQL 選項可讓您配置複式查詢。

例如,下列查詢會查看主機上可用記憶體的百分比。

sysdig_host_memory_available_bytes / sysdig_host_memory_total_bytes * 100

臨界值與查詢分開配置,可讓使用者同時指定警示臨界值及警告臨界值。