Alertes de seuil
Vous pouvez définir des IBM Cloud Monitoring (anciennement appelées alertes métriques) dans l'éditeur d'alertes à l'aide d'un formulaire ou de PromQL.
Pour plus d'informations sur la configuration des alertes, voir Configuration d'une alerte à l'aide de l'éditeur d'alerte.
Spécifier les conditions de déclenchement d'une alerte de seuil
Dans l'éditeur d'alerte, spécifiez les éléments suivants dans la section Métrique et conditions.
- Portée
- L'alerte est définie pour s'appliquer par défaut à l' ensemble de l'infrastructure de la portée de votre équipe. Toutefois, vous pouvez restreindre la portée de l'alerte en filtrant par des libellés spécifiques, tels que
container_nameoukube_namespace_name. - Métrique
- Sélectionnez la métrique à surveiller et configurez le mode d'agrégation des données. Ensuite, vous pouvez choisir la méthode d'agrégation qui convient le mieux à vos besoins. Par exemple, si vous souhaitez comprendre le temps d'attente moyen sur l'ensemble du cluster, vous pouvez utiliser l'agrégation moyenne. Sinon, si vous souhaitez identifier les noeuds dont le temps d'attente est le plus élevé, vous pouvez utiliser l'agrégation maximale.
- Regrouper par segment
- En regroupant les métriques par des libellés tels que
container_name, un segment unique est généré pour chaque conteneur. Cela vous permet de détecter rapidement si un conteneur particulier est responsable de la performance de la dégraissage. - Agrégation de temps
- Également appelée plage, l'agrégation temporelle d'une règle d'alerte détermine la fenêtre temporelle sur laquelle la mesure sélectionnée est agrégée. Par exemple, si vous sélectionnez l'agrégation
avgpour la métriquecassandra_read_latencyavec une plage spécifiée, elle calcule la valeur moyenne de la métriquecassandra_read_latencysur cette fenêtre temporelle. Cette plage définit jusqu'à quand les valeurs métriques sont prises en compte pour l'agrégation temporelle. - Durée
- La durée définit le temps pendant lequel une condition d'alerte doit être satisfaite en permanence avant de déclencher une alerte. Par exemple, une durée de 10m signifie que la condition doit être remplie pendant 10 minutes continues. Si la condition d'alerte n'est pas remplie à tout moment au cours de cette période, la minuterie de 10 minutes se réinitialise et doit être remplie à nouveau pendant 10 minutes complètes et ininterrompues. La définition d'une durée plus longue permet de réduire les faux positifs en évitant que des alertes ne soient déclenchées par des dépassements de seuil de courte durée.
Agrégation et durée du temps
L'agrégation temporelle d'une requête d'alerte définit la période sur laquelle les données métriques pertinentes sont évaluées. Elle ne doit pas être confondue avec la durée d'une règle d'alerte, qui correspond à la durée pendant laquelle une condition d'alerte doit être remplie avant de déclencher une alerte.
Seuils
Définissez le seuil et la plage de temps pour l'évaluation de la condition d'alerte.
| Agrégation | Description |
|---|---|
| moyenne | La moyenne des valeurs métriques récupérées au cours de la période de temps. |
| sum | Somme de l'indicateur sur la période évaluée. |
| maximal | Nombre maximal de valeurs de métrique extraites au cours de la période. |
| minimum | Minimum des valeurs de métrique extraites sur la période. |
Images dans les notifications d'alerte de seuil
Les notifications d'alerte de seuil transmises à Slack ou par courriel comprennent un instantané des données de la série temporelle qui a déclenché l'alerte. Pour les canaux de notification Slack, l'instantané peut être activé ou désactivé dans les paramètres de canal de notification. Lorsque le canal est configuré sur Notifier lors de la résolution, un instantané des données de série temporelle qui résout l'alerte est également fourni dans la notification.
Configuration de plusieurs seuils
En plus d'un seuil d'alerte, un seuil d'avertissement peut être configuré. Des seuils d'avertissement et des seuils d'alerte peuvent être associés à différents canaux de notification. Dans l'exemple suivant, un utilisateur peut souhaiter envoyer une notification d'avertissement et d'alerte à Slack, mais également envoyer une page à l'équipe de garde sur PagerDuty si un seuil d'alerte est atteint.
Si les seuils d'avertissement et d'alerte sont associés au même canal de notification, une mesure dépassant immédiatement le seuil d'alerte ignore le seuil d'avertissement et déclenche uniquement le seuil d'alerte.
Alerte en cas d'absence de données de mesure
Lorsqu'un indicateur arrête de générer des rapports sur les données, les alertes qui utilisent ces indicateurs ne peuvent pas être évaluées. Pour vous assurer que vous savez quand cela se produit, vous pouvez configurer des alertes pour la notification Aucune donnée en configurant l'option Aucune donnée dans la section Paramètres pour ignorer ou notifier.
Conversion d'une configuration d'alerte en PromQL
Vous pouvez effectuer une conversion automatique du formulaire en PromQL afin de tirer parti de la flexibilité et de la puissance de PromQL. L'option Translate to PromQL permet de configurer des requêtes complexes.
Par exemple, la requête suivante examine le pourcentage de mémoire disponible sur un hôte.
sysdig_host_memory_available_bytes / sysdig_host_memory_total_bytes * 100
Les seuils sont configurés séparément de la requête, ce qui permet à l'utilisateur de spécifier à la fois un seuil d'alerte et un seuil d'avertissement.