Configuration des alertes métriques
Les alertes métriques sont des alertes basées sur des calculs de métriques enregistrés par IBM® Cloud Logs à l'aide de Event2Metrics.
Les alertes métriques sont des notifications déclenchées par l'atteinte ou le dépassement de seuils prédéfinis pour des mesures spécifiques dans votre tableau de bord IBM Cloud Logs.
Les alertes métriques sont conçues pour surveiller les indicateurs de performance critiques concernant l'infrastructure et d'autres paramètres. Lorsque des seuils ou des conditions spécifiques sont dépassés, ces alertes agissent comme un système d'alerte précoce, notifiant aux équipes les problèmes potentiels nécessitant une attention immédiate. Par exemple, ils aident à surveiller l'utilisation du processeur du serveur, les temps de réponse, les taux d'erreur et l'utilisation des ressources dans les environnements en nuage.
Configuration requise
- Pour en savoir plus sur les alertes, consultez IBM Cloud Logs Pour plus d'informations, voir Alerting.
- Vérifiez que vous disposez d'une instanceEvent Notifications dans le même compte que votre instance IBM Cloud Logs et des permissions pour configurer les ressources dans l'instance Event Notifications.
- Vérifier que l'intégration sortante entre l'instance IBM Cloud Logs et l'instance Event Notifications est configurée. Pour plus d'informations, voir Configuration de la connexion d'une intégration sortante.
Lancer la gestion des alertes
Procédez comme suit :
- Dans la console, cliquez sur l'icône Menu de navigation
> Liste des ressources.
- Sélectionnez votre instance IBM Cloud Logs.
- Dans la navigation IBM Cloud Logs, cliquez sur l'icône Alertes
> Gestion des alertes.
- Cliquez sur Nouvelle alerte.
Choisissez le type d'alerte à configurer
Procédez comme suit :
-
Choisissez le type d'alerte. Pour plus d'informations, voir les types d'alerte.
-
Dans la section Détails, effectuez les étapes suivantes :
-
Entrez un nom.
- La longueur maximale du nom est de 4096 caractères.
-
[Facultatif] Saisir une description.
- La longueur maximale de la description est de 4096 caractères.
-
[Facultatif] Ajouter une ou plusieurs étiquettes.
Les étiquettes sont des paires clé/valeur que vous pouvez utiliser ultérieurement pour une recherche rapide.
-
Spécifier une requête de métriques
À l'aide de PromQL,, saisissez une requête sur les métriques stockées dans votre instance IBM® Cloud Logs.
Lorsque vous saisissez votre requête sur PromQL, vous obtenez des suggestions automatiques.
Agréger les mesures en utilisant la valeur de votre choix, par exemple : application, sous-système, identifiant de la machine ou autres données. Par exemple, vous pourriez vouloir suivre le nombre total d'exceptions à l'aide d'une seule mesure
pour toutes les applications et ajouter des étiquettes de mesure pour représenter les nouveaux domaines de code. Si le compteur d'exceptions s'appelle application_error_count et qu'il couvre la zone de code x, vous
pouvez ajouter une étiquette métrique correspondante.
application_error_count{area="x"}
Utilisez l'opérateur d'agrégation by pour choisir les dimensions (étiquettes métriques) à utiliser pour l'agrégation et la manière de diviser vos groupes de notification d'alerte. Par exemple, la requête sum by(instance) (node_filesystem_size_bytes) renvoie le total de node_filesystem_size_bytes pour chaque instance.
Spécifier la condition de déclenchement
Spécifiez la condition de déclenchement qui est évaluée par rapport aux données renvoyées par votre requête.
-
Pour Est, indiquez quand vous souhaitez que l'alerte se déclenche. Par exemple, si l'interrogation métrique est plus fréquente que d'habitude.
-
Pour Valeur spécifier le nombre de fois où la requête renvoie une correspondance qui déclenchera l'alerte.
-
Pour Pour plus spécifier un pourcentage de temps où la requête correspond dans le temps spécifié dans De.
Les données peuvent parfois comporter des valeurs manquantes. Si vous ne remplacez pas les valeurs manquantes par zéro et que vous les laissez vides, les données dont vous disposez sont considérées comme étant 100% des données.
Supposons que vous demandiez une période de 10 minutes. 6 points de données ont des valeurs et 4 points de données n'ont pas de valeurs. Si vous n'avez pas remplacé les valeurs manquantes par 0, les 6 minutes avec des valeurs seront considérées comme 100% de la période. Cela peut conduire à des déclenchements erronés.
Vous pouvez remplacer les valeurs manquantes par 0 dans les paramètres avancés.
Vous pouvez régler la sensibilité du déclenchement de l'alerte en ajustant le pourcentage de l'intervalle de temps. Au moins % de l'intervalle de temps doit avoir des valeurs pour que cette alerte se déclenche dans les paramètres avancés.
-
Le paramètre des valeurs en pourcentage est conçu pour désactiver l'alerte lorsqu'il n'y a pas suffisamment de points de données pour que l'alerte soit considérée comme fiable. Lorsque la quantité de données est inférieure au pourcentage défini, l'alerte ne se déclenche pas, quelle que soit la valeur métrique réelle et qu'elle soit supérieure ou inférieure à un seuil.
-
Si le pourcentage est fixé à 0 et que la requête franchit une fois le seuil, une alerte est déclenchée.
-
Si le pourcentage est fixé à 100, cela signifie que toutes les valeurs de la fenêtre temporelle doivent franchir le seuil. Si, à un moment donné, une valeur n'est pas atteinte, une alerte est déclenchée.
Le réglage de la valeur en pourcentage n'est pas affiché lorsque l'option Remplacer les valeurs manquantes par des zéros est sélectionnée. Une fois que les valeurs manquantes sont remplacées par zéro, il est garanti que 100 % des données existent.
Si vous utilisez la condition Inférieur au seuil, vous aurez la possibilité de gérer les valeurs non détectées.
Les valeurs non détectées se produisent lorsqu'une permutation d'une alerte "Moins que" cesse d'être envoyée, entraînant de multiples déclenchements de l'alerte (pour chaque période au cours de laquelle elle n'a pas été envoyée).
Lorsque vous consultez une alerte contenant des valeurs non détectées, vous avez la possibilité de retirer ces valeurs manuellement ou de sélectionner une période après laquelle les valeurs non détectées seront automatiquement retirées. Vous pouvez également désactiver le déclenchement sur les valeurs non détectées pour arrêter immédiatement l'envoi d'alertes lorsqu'une valeur non détectée se produit.
Personnalisation de la détection des anomalies
La détection des anomalies analyse les données entrantes. En utilisant les données des 24 heures précédentes, IBM Cloud Logs prévoit le comportement attendu pour les 24 heures à venir. Le modèle prédictif établit des seuils supérieurs et inférieurs de comportement attendu, en fixant ces seuils comme des limites. Lorsque les données franchissent ces seuils, une alerte est déclenchée. Une ligne de base est calculée entre le comportement moyen et chaque seuil. Vous pouvez spécifier un pourcentage d'écart par rapport à cette ligne de base pour ajuster la sensibilité du déclenchement de l'alerte.
Lorsque vous définissez une condition Plus que d'habitude ou Moins que d'habitude, vous pouvez configurer un paramètre avancé afin d'être alerté uniquement lorsque l'écart en pourcentage est dépassé de ce pourcentage.
Par exemple, si la ligne de base est de 50, que le seuil supérieur est de 150 et que l'écart en pourcentage est de 10 %, l'alerte ne sera déclenchée que si la valeur dépasse 155.
Exemples
Par exemple, vous pouvez choisir si votre alerte sera déclenchée si elle est inférieure, inférieure ou égale, supérieure, supérieure ou égale à une certaine valeur, ou supérieure à la normale ou inférieure à la normale pour un seuil minimum. Lorsque la requête dépasse la valeur ou le seuil fixé pour les conditions, l'alerte est déclenchée.
En spécifiant un pourcentage (pour plus de x % ) et une période (des x dernières minutes ), vous déterminez la partie de la période où le seuil doit être franchi pour que l'alerte se déclenche. Sélectionnez le pourcentage (au moins x % ) de la période de temps qui nécessite des valeurs pour que l'alerte se déclenche.
Par exemple, vous déterminez que plus de 50 % de ma période de 10 minutes doit avoir la valeur définie pour que l'alerte se déclenche. Si j'atteins la valeur pour 5 des 10 points de données, cela ne suffira pas à déclencher une alerte, car elle n'est pas supérieure à 50 %. Si la valeur est atteinte pour 6 des 10 points de données, une alerte sera déclenchée.
Dans Group By, vous pouvez configurer jusqu'à 2 champs JSON dont les valeurs sont agrégées et déterminent le déclenchement d'une alerte.
-
Une alerte est déclenchée lorsque l'une des valeurs agrégées dépasse le seuil configuré dans la section des conditions de filtrage dans le délai spécifié.
-
Une alerte est déclenchée lorsque le seuil de condition est atteint pour une valeur agrégée spécifique dans le délai spécifié.
-
Si vous configurez 2 valeurs, les journaux correspondants seront d'abord agrégés par le champ parent, puis par le champ enfant. Une alerte est déclenchée lorsque le seuil atteint la combinaison unique du parent et de l'enfant.
Configurer les détails de la notification
Procédez comme suit :
-
Configurez Notify every pour définir la fréquence à laquelle vous souhaitez recevoir un événement une fois l'alerte déclenchée. La valeur par défaut est de 0 heure et 10 minutes.
-
Activez l'option Résoudre automatiquement pour obtenir un événement lorsque l'événement a été résolu.
Lorsque la condition de l'alerte ne déclenche plus d'événements, l'événement initialement déclenché est marqué comme résolu.
-
Activer Activer le mode fantôme pour indiquer que cette alerte est une alerte fantôme.
Une alerte fantôme sert d'élément de base pour les alertes de flux.
Une alerte fantôme ne déclenche pas de notifications d'événements indépendants.
Lorsque vous activez cette option, la section Notifications est supprimée de la définition de l'alerte.
-
Ajouter une intégration.
Vous devez avoir défini une intégration sortante pour pouvoir ajouter une intégration. Pour plus d'informations, voir Configuration de l'intégration avec le service de Event Notifications
Établir un calendrier et déterminer le contenu du journal à inclure
Procédez comme suit :
-
Dans la section Calendrier, définissez un calendrier pour contrôler le moment où cette alerte est activée. Vous pouvez choisir des jours et des heures spécifiques.
-
Dans la section Contenu de la notification, indiquez si vous souhaitez inclure un exemple de ligne de journal ou seulement certains champs dans l'événement déclenché.
Choisissez des clés JSON spécifiques à inclure dans la notification d'alerte, ou laissez ce champ vide pour inclure le texte complet du journal dans le message d'alerte :
-
Option 1 : Laisser vide pour inclure une ligne de journal qui correspond aux conditions de filtrage de l'alerte.
-
Option 2 : Spécifier des clés JSON pour inclure les champs sélectionnés dans le format des paires clé/valeur. Notez que pour pouvoir ajouter des champs, vos enregistrements doivent être au format JSON.
Les clés JSON contenant un
.dans leur nom ne peuvent pas être utilisées comme champs sélectionnés. -
Option 3 : Spécifier un chemin JSON comme filtre.
-
Lorsqu'une alerte est déclenchée, la quantité de données incluses dans l'événement est limitée. Pour plus d'informations sur ces limitations, voir Taille des données.
Sauvegarder la configuration de l'alerte
Procédez comme suit :
-
Vérifier l'alerte.
Cliquez sur Vérifier pour évaluer les données et savoir combien de fois l'alerte a correspondu aux critères au cours des dernières 24 heures.
Verify évalue uniquement les données du pipeline Informations de priorité Si votre alerte est configurée pour se déclencher sur des données disponibles dans le pipeline Analyser et alerter, vous remarquerez que cette fonctionnalité n'est pas disponible.
-
Cliquez sur Créer une alerte.
Vérification de l'alerte
Déclencher une alerte. Une fois qu'une alerte est déclenchée et traitée, le système envoie des notifications aux utilisateurs ou aux équipes désignés par le biais de différents canaux tels que le courrier électronique, Slack, les SMS ou les plateformes intégrées de gestion des incidents. Vous pouvez ensuite accéder à la page Incidents pour obtenir des informations sur les alertes déclenchées. Pour plus d'informations, voir Gestion des alertes déclenchées dans IBM Cloud Logs
Limites d'alertes dynamiques
Une alerte dynamique est une alerte dont la condition est Plus que d'habitude ou Moins que d'habitude. Chaque alerte dynamique se voit attribuer 500 permutations, avec un maximum de 10 000 permutations autorisées pour toute instance IBM Cloud Logs.
La limite de permutation signifie qu'un maximum de 20 alertes dynamiques peut être configuré pour une instance IBM Cloud Logs.
Vous pouvez encore créer d'autres alertes non dynamiques lorsque vous avez atteint la limite de 20 alertes dynamiques.