Ausfallzeitalerts
Sie können IBM Cloud Monitoring-Ausfallzeitalerts im Alerteditor mithilfe eines Formulars definieren.
IBM Cloud Monitoring überwacht kontinuierlich verschiedene Typen von Entitäten in Ihrer Infrastruktur, wie z. B. einen Host, einen Container oder einen Prozess, und sendet Benachrichtigungen, wenn die überwachte Entität nicht verfügbar ist oder nicht antwortet. Ausfallzeitalerts konzentrieren sich hauptsächlich auf ungeplante Ausfallzeiten von Programmen, Containern und Hosts in Ihrer Infrastruktur.
Zum Überwachen der Ausfallzeit der Entitäten werden die folgenden Metriken verwendet: sysdig_host_up, sysdig_container_up und sysdig_program_up. Sie geben an, ob der Agent mit dem Collector kommunizieren
kann. Der Wert 1 stellt dar, dass die Entität aktiv ist und der Agent diese Informationen an den Collector sendet. Der Wert 0 stellt dar, dass die Entität inaktiv ist, impliziert keine Kommunikation zwischen dem Agenten und dem Collector über
die Entität.
Wenn ein Alert basierend auf der Metrik ab up konfiguriert wird, werden während der Alertprüfung zwei Daten-API-Abfragen ausgeführt. Eine Abfrage ruft die aktuellen Werte ab und die andere Abfrage ruft die Werte aus dem vorherigen
Alertprüfintervall ab. Für jede Entität, die im vorherigen Intervall vorhanden war und im aktuellen Intervall nicht vorhanden ist, wird die Metrik als 0 markiert.
Ein aggregierter Wert des Messwerts up wird im Dashboard im Alerteditor mit einem Wert zwischen 0 und 1 angezeigt.
Ausfallzeitalert definieren
Beachten Sie beim Konfigurieren eines Ausfallzeitalerts Folgendes:
- Legen Sie einen aussagekräftigen Namen und eine aussagekräftige Beschreibung fest, damit die Empfänger den Alert leicht identifizieren können.
- Legen Sie eine Wertigkeit für Ihren Alert fest. Die Alertwertigkeit (
High,Medium,LowundInfo) wird in der Alertliste wiedergegeben. Sie können Alerts nach Wertigkeit sortieren. Sie können den Schweregrad als Kriterium beim Erstellen von Alerts verwenden. Beispiel: Sie möchten benachrichtigt werden, wenn mehr als 10 Ereignisse mit hoher Wertigkeit vorhanden sind. - Geben Sie mehrere Segmente an. Die Auswahl eines einzelnen Segments liefert möglicherweise nicht immer genügend Informationen, um das Problem zu beheben. Erweitern Sie die ausgewählte Entität mit zugehörigen Informationen, indem Sie weitere zugehörige Segmente hinzufügen. Geben Sie hierarchische Entitäten ein, damit Sie verstehen, was falsch gelaufen ist und wo. Wenn Sie beispielsweise nur einen Kubernetes-Cluster angeben, wird nicht der Kontext bereitgestellt, der für die Fehlerbehebung erforderlich ist. Um das Problem einzugrenzen, fügen Sie weitere Kontextinformationen wie Kubernetes, Kubernetes usw. hinzu.
Stillstandsbedingungen
Sie können Ihren Ausfallzeitalert auf der Basis einer Reihe von Bedingungen konfigurieren.
Bereich
Sie können die Umgebung filtern, in der der Alert angewendet wird. Beispiel: Ein Alert wird gesendet, wenn ein Container, der dem Agenten 197288 zugeordnet ist, ausfällt. Der Alert wird für jeden Containernamen und jede Agenten-ID ausgelöst.
Verwenden Sie die Operatoren in oder contain, um mehrere verschiedene mögliche Werte abzugleichen.
Mit den Operatoren contain und not contain können Sie Werte abrufen, wenn Sie einen Teil der Werte kennen. Beispiel: us ruft Werte ab, die Zeichenfolgen enthalten, die mit "us" beginnen, wie
z. B. “us-east-1b”, “us-west-2b”usw.
Mit den Operatoren in und not in können Sie mehrere Werte filtern.
Sie können Alerts auch direkt über Explore und Dashboards erstellen, um den Bereich automatisch zu füllen.
Metrik
Wählen Sie einen Betriebszeitmesswert für die Entität aus, deren Ausfallzeit Sie überwachen möchten. Sie können eine der folgenden Entitäten auswählen: host, container oder program.
Entität
Geben Sie zusätzliche Segmente an, indem Sie die Option Alert if any of verwenden.
Die angegebenen Entitäten werden segmentiert und mit der Standardbenachrichtigungsschablone sowie in der Vorschau benachrichtigt.
Auslöser
Definieren Sie den Schwellenwert und das Zeitfenster für die Bewertung der Alertbedingung. Unterstützte Zeitskalen sind minute, hour oder day. Wenn das überwachte Programm beispielsweise während der letzten
Minute nicht verfügbar ist oder nicht antwortet, werden Alertempfänger benachrichtigt.
Sie können einen beliebigen Wert für den Prozentsatz (%) und einen Wert größer als 1 für das Zeitfenster festlegen. Wenn Sie beispielsweise 50% anstelle von 100% auswählen, wird eine Benachrichtigung ausgelöst, wenn die Entität im ausgewählten Zeitfenster von 10 Minuten inaktiv ist.
Beispielanwendungsfälle
Im Folgenden sind einige Anwendungsfälle aufgeführt, bei denen Sie die Verwendung eines Ausfallzeitalerts in Betracht ziehen können:
- Wenn Ihre E-Commerce-Website ist während der Stoßzeiten der Black Friday, Weihnachten oder Silvester.
- Wenn Produktionsserver Ihres Rechenzentrums einen kritischen Ausfall erleben.
- Wenn eine MySQL-Datenbank nicht erreichbar ist.
- Wenn ein Dateiupload auf Ihrer Marketing-Website nicht funktioniert.