Alertes d'indisponibilité

Vous pouvez définir des alertes d'indisponibilité IBM Cloud Monitoring dans l'éditeur d'alerte à l'aide d'un formulaire.

IBM Cloud Monitoring surveille en permanence différents types d'entités de votre infrastructure, tels qu'un hôte, un conteneur, un processus, et envoie des notifications lorsque l'entité surveillée n'est pas disponible ou ne répond pas. Les alertes d'indisponibilité se concentrent principalement sur les temps d'indisponibilité non planifiés des programmes, des conteneurs et des hôtes de votre infrastructure.

Pour surveiller le temps d'indisponibilité des entités, les métriques suivantes sont utilisées: sysdig_host_up, sysdig_container_up et sysdig_program_up. Ils indiquent si l'agent peut communiquer avec le collecteur. La valeur 1 représente l'entité en cours et l'agent envoie ces informations au collecteur. La valeur 0 représente que l'entité est arrêtée, ce qui implique qu'aucune communication n'est établie entre l'agent et le collecteur à propos de l'entité.

Lorsqu'une alerte est configurée en fonction de la métrique ab up, deux requêtes d'API de données sont exécutées lors de la vérification d'alerte. Une requête extrait les valeurs en cours et l'autre extrait les valeurs de l'intervalle de vérification d'alerte précédent. Pour toute entité qui était présente dans l'intervalle précédent et qui n'est pas présente dans l'intervalle en cours, la métrique est marquée comme 0.

Une valeur agrégée de l'indicateur up est affichée dans le tableau de bord de l'éditeur d'alerte avec une valeur comprise entre 0 et 1.

Définition d'une alerte de temps d'arrêt

Tenez compte des points suivants lors de la configuration d'une alerte d'indisponibilité:

  • Définissez un nom et une description significatifs qui aident les destinataires à identifier facilement l'alerte.
  • Définissez un niveau de gravité pour votre alerte. La gravité de l'alerte (High, Medium, Low et Info) est reflétée dans la liste des alertes. Vous pouvez trier les alertes par gravité. Vous pouvez utiliser la gravité comme critère lors de la création d'alertes. Par exemple, vous souhaitez être alerté s'il existe plus de 10 événements de gravité élevée.
  • Spécifiez plusieurs segments. La sélection d'un seul segment peut ne pas toujours fournir suffisamment d'informations pour identifier et résoudre le problème. Enrichissez l'entité sélectionnée avec des informations connexes en ajoutant des segments connexes supplémentaires. Entrez des entités hiérarchiques pour comprendre ce qui s'est passé et où. Par exemple, la spécification d'un cluster Kubernetes seul ne fournit pas le contexte nécessaire au traitement des incidents. Pour réduire le problème, ajoutez des informations contextuelles supplémentaires, telles que l'espace de nom Kubernetes, le déploiement Kubernetes, etc.

Conditions d'indisponibilité

Vous pouvez configurer votre alerte d'indisponibilité en fonction d'un certain nombre de conditions.

Portée

Vous pouvez filtrer l'environnement dans lequel l'alerte s'appliquera. Par exemple, une alerte est envoyée lorsqu'un conteneur associé à l'agent 197288 tombe en panne. L'alerte est déclenchée pour chaque nom de conteneur et ID d'agent.

Vous pouvez utiliser des opérateurs in ou contain pour faire correspondre plusieurs valeurs possibles.

Les opérateurs contain et not contain vous aident à extraire des valeurs si vous connaissez une partie de ces valeurs. Par exemple, us extrait les valeurs qui contiennent des chaînes commençant par "us", telles que “us-east-1b”, “us-west-2b”, etc.

Les opérateurs in et not in vous permettent de filtrer plusieurs valeurs.

Vous pouvez également créer des alertes directement depuis Explorer et Tableaux de bord pour remplir automatiquement la portée.

Métrique

Sélectionnez une métrique de temps de disponibilité associée à l'entité dont vous souhaitez surveiller le temps d'indisponibilité. Vous pouvez sélectionner l'une des entités suivantes: host, container ou program.

Entité

Spécifiez des segments supplémentaires à l'aide de l'option Alerter si l'une des options.

Les entités spécifiées sont segmentées et notifiées avec le modèle de notification par défaut ainsi que dans l'aperçu.

Déclencheur

Définissez le seuil et la fenêtre de temps pour l'évaluation de la condition d'alerte. Les échelles de temps prises en charge sont minute,hour, ou day. Par exemple, si le programme surveillé n'est pas disponible ou ne répond pas pendant la dernière minute, les destinataires de l'alerte seront avertis.

Vous pouvez définir n'importe quelle valeur pour le pourcentage (%) et une valeur supérieure à 1 pour la fenêtre de temps. Par exemple, si vous choisissez 50% au lieu de 100%, une notification est déclenchée lorsque l'entité est arrêtée pendant 5 minutes dans la fenêtre de temps sélectionnée de 10 minutes.

Exemples de cas d'utilisation

Voici quelques cas d'utilisation où vous pouvez envisager d'utiliser une alerte d'indisponibilité:

  • Lorsque votre site Web de commerce électronique est en panne pendant les heures de pointe du vendredi noir, de Noël ou de la saison du Nouvel An.
  • Lorsque les serveurs de production de votre centre de données sont confrontés à une indisponibilité critique.
  • Lorsqu'une base de données MySQL est inaccessible.
  • Lorsqu'un téléchargement de fichier ne fonctionne pas sur votre site Web marketing.