ダウン時間アラート

フォームを使用して、アラート・エディターで IBM Cloud Monitoring ダウン時間アラートを定義できます。

IBM Cloud Monitoring は、インフラストラクチャー内のさまざまなタイプのエンティティー (ホスト、コンテナー、プロセスなど) を継続的にモニターし、モニター対象エンティティーが使用不可または応答不可の場合に通知を送信します。 ダウンタイム・アラートは、主に、インフラストラクチャー内のプログラム、コンテナー、およびホストの予定外のダウンタイムに焦点を当てています。

エンティティーのダウン時間をモニターするために、 sysdig_host_up、 sysdig_container_up、および sysdig_program_up の各メトリックが使用されます。 これらは、エージェントがコレクターと通信できるかどうかを示します。 値 1 は、エンティティーが稼働しており、エージェントがこの情報をコレクターに送信していることを表します。 値 0 は、エンティティーがダウンしていることを表します。これは、エージェントからコレクターへのエンティティーに関する通信がないことを意味します。

アラートが ab up メトリックに基づいて構成されている場合、アラート・チェック中に 2 つのデータ API 照会が実行されます。 一方の照会では現行値が取得され、もう一方の照会では前のアラート・チェック間隔から値が取得されます。 前の間隔に存在し、現在の間隔には存在しないエンティティーについては、メトリックに 0 のマークが付けられます。

up メトリックの集約値が、アラート・エディターのダッシュボードに 0 から 1 までの値で表示されます。

ダウン時間アラートの定義

ダウン時間アラートを構成する際には、以下の点を考慮してください。

  • 受信者がアラートを容易に識別できるように、分かりやすい名前と説明を設定します。
  • アラートの重大度レベルを設定します。 「アラートの重大度」 (High、 Medium、 Low、および Info) が「アラート」リストに反映されます。 重大度でアラートをソートできます。 アラートの作成時に、重大度を基準として使用できます。 例えば、重大度が 10 を超えるイベントがある場合にアラートを受け取りたいとします。
  • 複数のセグメントを指定します。 単一のセグメントを選択しても、問題のトラブルシューティングに十分な情報が常に提供されるとは限りません。 追加の関連セグメントを追加することにより、選択したエンティティーを関連情報で強化します。 階層エンティティーを入力して、何がどこで問題が発生したかを理解できるようにします。 例えば、 Kubernetes クラスターのみを指定しても、トラブルシューティングに必要なコンテキストは提供されません。 この問題を絞り込むには、 Kubernetes 名前空間、 Kubernetes デプロイメントなどのコンテキスト情報をさらに追加します。

ダウンタイム状態

いくつかの条件に基づいてダウン時間アラートを構成できます。

スコープ

アラートが適用される環境をフィルターに掛けることができます。 例えば、エージェント 197288 に関連付けられているコンテナーが停止すると、アラートが送信されます。 コンテナー名とエージェント ID ごとにアラートがトリガーされます。

in 演算子または contain 演算子を使用して、複数の異なる可能な値を突き合わせることができます。

値の一部が分かっている場合は、 contain 演算子と not contain 演算子を使用して値を取得することができます。 例えば、 us は、「us」で始まるストリング ( “us-east-1b”、 “us-west-2b”など) を含む値を取得します。

in 演算子と not in 演算子を使用すると、複数の値をフィルターに掛けることができます。

「探索」 および 「ダッシュボード」 から直接アラートを作成して、スコープに自動的にデータを取り込むこともできます。

メトリック

ダウン時間をモニターするエンティティーに関連付けられているアップタイム・メトリックを選択します。 host、 container、または program のいずれかのエンティティーを選択できます。

エンティティー

「次のいずれかの場合にアラート」 オプションを使用して、追加のセグメントを指定します。

指定されたエンティティーは、プレビュー上だけでなく、デフォルトの通知テンプレートによってもセグメント化され、通知されます。

トリガー

アラート条件を評価するためのしきい値および時間枠を定義します。 サポートされている時間スケールは minute、hour 、 または day。 例えば、モニター対象プログラムが使用不可であるか、過去 1 分間に応答しなかった場合、アラート受信者に通知されます。

パーセンテージ (%) には任意の値を設定でき、時間枠には 1 より大きい値を設定できます。 例えば、100% ではなく 50% を選択した場合、選択した 10 分間の時間枠でエンティティーが 5 分間ダウンすると、通知がトリガーされます。

ユース・ケースの例

ダウン時間アラートの使用を検討するユース・ケースには、以下のようなものがあります。

  • e-コマース Web サイトが、ブラック・フライデー、クリスマス、または新年のピーク時にダウンした場合。
  • データ・センターの実動サーバーで重大な障害が発生した場合。
  • MySQL データベースに到達できない場合。
  • ファイルのアップロードがマーケティング Web サイトで機能しない場合。