Alertes de seuil

Vous pouvez définir des IBM Cloud Monitoring (anciennement appelées alertes métriques) dans l'éditeur d'alertes à l'aide d'un formulaire ou de PromQL.

Pour plus d'informations sur la configuration des alertes, voir Configuration d'une alerte à l'aide de l'éditeur d'alerte.

Spécifier les conditions de déclenchement d'une alerte de seuil

Dans l'éditeur d'alerte, spécifiez les éléments suivants dans la section Métrique et conditions.

Portée
L'alerte est définie pour s'appliquer par défaut à l' ensemble de l'infrastructure de la portée de votre équipe. Toutefois, vous pouvez restreindre la portée de l'alerte en filtrant par des libellés spécifiques, tels que container_name ou kube_namespace_name.
Métrique
Sélectionnez la métrique à surveiller et configurez le mode d'agrégation des données. Ensuite, vous pouvez choisir la méthode d'agrégation qui convient le mieux à vos besoins. Par exemple, si vous souhaitez comprendre le temps d'attente moyen sur l'ensemble du cluster, vous pouvez utiliser l'agrégation moyenne. Sinon, si vous souhaitez identifier les noeuds dont le temps d'attente est le plus élevé, vous pouvez utiliser l'agrégation maximale.
Regrouper par segment
En regroupant les métriques par des libellés tels que container_name, un segment unique est généré pour chaque conteneur. Cela vous permet de détecter rapidement si un conteneur particulier est responsable de la performance de la dégraissage.
Agrégation de temps
Également appelée plage, l'agrégation temporelle d'une règle d'alerte détermine la fenêtre temporelle sur laquelle la mesure sélectionnée est agrégée. Par exemple, si vous sélectionnez l'agrégation avg pour la métrique cassandra_read_latency avec une plage spécifiée, elle calcule la valeur moyenne de la métrique cassandra_read_latency sur cette fenêtre temporelle. Cette plage définit jusqu'à quand les valeurs métriques sont prises en compte pour l'agrégation temporelle.
Durée
La durée définit le temps pendant lequel une condition d'alerte doit être satisfaite en permanence avant de déclencher une alerte. Par exemple, une durée de 10m signifie que la condition doit être remplie pendant 10 minutes continues. Si la condition d'alerte n'est pas remplie à tout moment au cours de cette période, la minuterie de 10 minutes se réinitialise et doit être remplie à nouveau pendant 10 minutes complètes et ininterrompues. La définition d'une durée plus longue permet de réduire les faux positifs en évitant que des alertes ne soient déclenchées par des dépassements de seuil de courte durée.

Agrégation et durée du temps

L'agrégation temporelle d'une requête d'alerte définit la période sur laquelle les données métriques pertinentes sont évaluées. Elle ne doit pas être confondue avec la durée d'une règle d'alerte, qui correspond à la durée pendant laquelle une condition d'alerte doit être remplie avant de déclencher une alerte.

Seuils

Définissez le seuil et la plage de temps pour l'évaluation de la condition d'alerte.

Méthodes d'agrégation
Agrégation Description
moyenne La moyenne des valeurs métriques récupérées au cours de la période de temps.
sum Somme de l'indicateur sur la période évaluée.
maximal Nombre maximal de valeurs de métrique extraites au cours de la période.
minimum Minimum des valeurs de métrique extraites sur la période.

Images dans les notifications d'alerte de seuil

Les notifications d'alerte de seuil transmises à Slack ou par courriel comprennent un instantané des données de la série temporelle qui a déclenché l'alerte. Pour les canaux de notification Slack, l'instantané peut être activé ou désactivé dans les paramètres de canal de notification. Lorsque le canal est configuré sur Notifier lors de la résolution, un instantané des données de série temporelle qui résout l'alerte est également fourni dans la notification.

Configuration de plusieurs seuils

En plus d'un seuil d'alerte, un seuil d'avertissement peut être configuré. Des seuils d'avertissement et des seuils d'alerte peuvent être associés à différents canaux de notification. Dans l'exemple suivant, un utilisateur peut souhaiter envoyer une notification d'avertissement et d'alerte à Slack, mais également envoyer une page à l'équipe de garde sur PagerDuty si un seuil d'alerte est atteint.

Si les seuils d'avertissement et d'alerte sont associés au même canal de notification, une mesure dépassant immédiatement le seuil d'alerte ignore le seuil d'avertissement et déclenche uniquement le seuil d'alerte.

Alerte en cas d'absence de données de mesure

Lorsqu'un indicateur arrête de générer des rapports sur les données, les alertes qui utilisent ces indicateurs ne peuvent pas être évaluées. Pour vous assurer que vous savez quand cela se produit, vous pouvez configurer des alertes pour la notification Aucune donnée en configurant l'option Aucune donnée dans la section Paramètres pour ignorer ou notifier.

Conversion d'une configuration d'alerte en PromQL

Vous pouvez effectuer une conversion automatique du formulaire en PromQL afin de tirer parti de la flexibilité et de la puissance de PromQL. L'option Translate to PromQL permet de configurer des requêtes complexes.

Par exemple, la requête suivante examine le pourcentage de mémoire disponible sur un hôte.

sysdig_host_memory_available_bytes / sysdig_host_memory_total_bytes * 100

Les seuils sont configurés séparément de la requête, ce qui permet à l'utilisateur de spécifier à la fois un seuil d'alerte et un seuil d'avertissement.