Alertes

Les alertes IBM Cloud Logs permettent la détection rapide des anomalies, la réponse proactive aux incidents, l'amélioration du temps moyen de résolution (MTTR), la réduction de l'effort de surveillance manuelle, la personnalisation et la flexibilité. Optimisé par l'apprentissage automatique, l'alerte avertit de manière proactive les équipes des problèmes potentiels, corrèle les incidents et fournit une analyse de la cause première.

Fonctionnement des alertes

Les alertes suivent un flux de travaux général sur la façon dont elles sont générées, déclenchées et distribuées aux utilisateurs.

Alerting in IBM Cloud Logs
Alerting in IBM Cloud Logs

  1. Définir des règles d'alerte

    Les administrateurs, les développeurs ou DevOps définissent des règles d'alerte au sein de la plateforme d'observabilité. Ces règles spécifient les conditions dans lesquelles une alerte est déclenchée. Par exemple, ils peuvent définir une règle pour alerter lorsque des messages d'erreur spécifiques apparaissent dans les journaux.

  2. Collecte et analyse des données

    IBM Cloud Logs collecte en continu les données du système, y compris les journaux et les métriques. Il traite et analyse ces données par rapport aux règles d'alerte définies.

  3. Déclenchement d'alertes

    Lorsque les données surveillées remplissent les conditions spécifiées dans les règles d'alerte, une alerte est déclenchée. Le déclenchement peut être dû à un pic soudain de taux d'erreur, à un temps d'attente élevé, à une faible disponibilité des ressources ou à toute autre anomalie prédéfinie.

  4. Agrégation et dédoublonnage des alertes

    Le système d'alerte peut regrouper plusieurs alertes similaires en une seule notification afin d'éviter qu'un grand nombre d'utilisateurs reçoivent des notifications redondantes. En outre, il peut dédoublonner les alertes afin d'éviter l'envoi d'informations répétitives aux utilisateurs.

  5. Notification et escalade

    Une fois qu'une alerte est déclenchée et traitée, le système envoie des notifications aux utilisateurs ou aux équipes désignés. Les notifications peuvent être envoyées via divers canaux tels que le courrier électronique, Slack, SMS ou des plateformes de gestion des incidents intégrées. Si la situation reste non résolue, l'alerte peut être transférée à des équipes ou des individus de niveau supérieur.

  6. Résolution d'alerte et accusé de réception

    Les destinataires de l'alerte accusent réception de l'alerte et prennent les mesures appropriées pour résoudre le problème. Une fois le problème résolu, ils marquent l'alerte comme "Terminé".

  7. Surveillance et génération de rapports

    Tout au long du processus d'alerte, IBM Cloud Logs surveille en permanence le statut du système. Il peut assurer le suivi du statut d'accusé de réception, du temps de résolution et d'autres indicateurs pour générer des rapports et aider à l'analyse et à l'amélioration post-incident.

Types d'alerte

IBM Cloud Logs fournit 6 types d'alertes que vous pouvez configurer.

Pour plus d'informations sur la configuration des alertes, voir l'icône Alertes Configuration des alertes.

Alertes standard

Les alertes standard sont des alertes déclenchées par des modifications apportées à vos journaux. Déclenchée par le franchissement d'un seuil de quantité défini pour des journaux spécifiques, cette fonction vous permet de surveiller les performances du système, d'être averti lorsque des modifications se produisent et d'identifier les causes potentielles. Ces alertes sont utiles lorsque vous tentez de mesurer le nombre d'occurrences d'un incident particulier.

Avec la fonction d'alertes standard, vous pouvez:

  • Surveillez les performances du système en temps réel. Obtenez des informations en temps réel en fonction des critères de votre choix.

  • Construisez les requêtes pour vos besoins spécifiques. Définissez une requête qui capture les journaux que vous souhaitez inspecter et rendez la requête plus spécifique en la filtrant par application, sous-système et gravité. Sélectionnez ensuite la plage de conditions pour déclencher une alerte. Par exemple, vous pouvez définir le déclenchement d'une alerte lorsque plus de 10 journaux sont reçus au cours d'une période spécifique.

  • Utilisez une approche basée sur l'apprentissage automatique. A l'aide de ce paramètre, IBM Cloud Logs analyse vos données et détecte automatiquement un comportement anormal.

  • Recevez des notifications personnalisées. Recevez des notifications push en temps réel sur votre canal de communication préféré.

Les alertes standard sont les alertes les plus simples qui sont proposées par IBM Cloud Logs. Ils peuvent être utilisés pour couvrir vos cas d'utilisation les plus évidents comme base de votre système d'observabilité.

Alertes temporelles relatives

Détectez automatiquement les comportements anormaux dans votre système en utilisant les alertes relatives au temps. Les alertes sont déclenchées lorsqu'un rapport fixe atteint un seuil défini par rapport à une période passée.

Utiliser les alertes relatives au temps pour:

  • Recevez des alertes automatiques sur les modifications apportées à la sécurité, aux opérations ou aux comportements métier de votre système au fil du temps.

  • Comparez les comportements sur des périodes différentes. Par exemple :

    Sécurité
    Recevez des alertes automatiques qui comparent les comportements suspects. Comparez, par exemple, le nombre de réponses de nom de domaine NX ou de connexions d'administrateur sur plusieurs jours ou semaines.
    Opérations
    Recevez des alertes automatiques sur les taux d'erreur et les temps de chargement des pages dans vos applications. Comparez, par exemple, les taux d'erreur et les temps de chargement des pages au cours de la dernière journée ou de la dernière heure.
    Professionnel
    Recevez des alertes automatiques en cas de changement de ventes ou d'inscription d'utilisateur. Comparez, par exemple, le nombre d'achats effectués le même jour la semaine dernière ou le nombre d'inscriptions de l'utilisateur au cours du dernier mois.

Alertes de comptage uniques

A mesure que les volumes de données augmentent et que le nombre d'alertes générées par les journaux, les métriques et les systèmes de sécurité augmente de manière exponentielle, l'un des indicateurs les plus puissants d'importance des alertes est le nombre d'éléments affectés par l'alerte. Exemples: le nombre d'utilisateurs qui ont rencontré une erreur 5XX lors de l'appel d'une API, le nombre de groupes de consommateurs Kafka qui ont renvoyé des erreurs, le nombre d'emplacements CDN qui chargent actuellement votre site pendant plus de 3 secondes ou le nombre de mots de passe différents avec lesquels un utilisateur tente de se connecter à votre console de service de cloud.

Le problème avec la plupart des alertes est qu'elles décrivent le problème. Toutefois, pour comprendre la gravité ou l'étendue du problème, les utilisateurs doivent explorer les données ou s'appuyer sur des tableaux de bord.

Les alertes de nombre unique se déclenchent sur le nombre de valeurs uniques dans une clé sélectionnée qui correspond à un critère de recherche spécifique. C'est-à-dire la cardinalité d'une clé spécifique correspondant à une recherche.

Alertes de ratio

Vous pouvez calculer un rapport entre deux requêtes de journal et déclencher une alerte lorsque le rapport atteint un seuil défini.

Utilisez ces alertes de rapport pour surveiller:

  • Santé opérationnelle: surveillez le nombre de réponses sortantes aux demandes entrantes ou le rapport entre des codes d'erreur spécifiques et le nombre total d'erreurs.

  • Marketing: surveillez le rapport entre le trafic provenant de régions spécifiques et le trafic global qui suit les campagnes régionales.

  • Sécurité: surveillez le taux de demandes refusées, d'opérations d'administration spécifiques ou de demandes provenant de domaines de réseau bloqués par rapport à toutes les demandes.

Nouvelles alertes de valeur

L'alerte de nouvelle valeur est déclenchée par la première occurrence d'une nouvelle valeur dans un intervalle de temps. Toutes les valeurs sont testées par rapport à une liste créée dynamiquement alors que l'alerte est active. L'alerte est définie par une requête spécifique qui identifie un sous-ensemble de journaux (si nécessaire) et est définie avec une clé pour suivre les nouvelles valeurs dans l'intervalle souhaité.

Cette alerte peut vous aider à détecter automatiquement un comportement anormal possible au sein de votre système.

Voici un exemple d'utilisation de ce type d'alerte:

  • Sécurité: une alerte peut être déclenchée par une nouvelle connexion de domaine. Etant donné que la sécurité IBM Cloud Logs consigne toutes les informations de sécurité sur l'ensemble du trafic réseau, une nouvelle connexion de domaine peut générer une nouvelle valeur pour la zone security.highest_registered_domain. Une nouvelle connexion de domaine peut pointer vers une attaque de sécurité possible.

  • Surveillance: une alerte peut être déclenchée par un nouveau code d'erreur d'application. De nombreuses applications envoient une zone error_code. Une nouvelle valeur pour cette zone peut indiquer un nouveau problème avec l'application.

Alertes de flux

Une alerte de flux est conçue pour vous avertir lorsqu'une combinaison d'événements d'alerte se produit dans une séquence spécifique au cours d'une période définie.

Par exemple, pour être averti d'une augmentation du taux d'erreur HTTP causée par une utilisation élevée de l'UC, une alerte de flux peut être configurée pour se déclencher lorsqu'une alerte d'utilisation élevée de l'UC est suivie d'une alerte de taux d'erreur HTTP élevé dans un délai défini.

Voici quelques avantages liés à l'utilisation des alertes de flux:

  • Corrélation complète des données: avec les alertes de flux, vous pouvez corréler les alertes sur les journaux, les métriques et les événements de sécurité. Cette approche offre une vue globale des performances de votre système, et non des éléments d'information isolés. Les informations corrélées vous permettent de disposer de toutes les données dont vous avez besoin pour prendre des décisions éclairées.

  • Analyse avancée de la cause première: les alertes de flux peuvent être configurées pour identifier la cause première d'un problème. Avec la possibilité de définir une alerte qui identifie la cause première du problème, vous pouvez répondre rapidement aux problèmes, réduisant ainsi le temps d'indisponibilité du système et améliorant l'efficacité opérationnelle.

  • Fatigue d'alerte réduite: les systèmes de surveillance traditionnels inondent souvent les utilisateurs d'alertes redondantes, ce qui entraîne une fatigue d'alerte et la possibilité de négliger les problèmes critiques. Les alertes de flux peuvent réduire les fausses alertes en appliquant un filtre de critères de limite de temps ordonné. Cela signifie que vous êtes alerté lorsque toutes les conditions définies sont remplies, ce qui réduit le bruit de notification inutile.

  • Séquences d'alertes personnalisables: grâce à cette fonction unique d'alertes de flux, vous pouvez définir votre séquence d'alertes à l'aide d'une simple interface de glisser-déposer. Créez un flux qui se déclenche uniquement si tous les critères sont satisfaits par ordre et heure.

  • Traitement des incidents efficace: Avec la possibilité de visualiser la séquence d'alertes sur un canevas, le traitement des incidents devient plus efficace. Vous pouvez facilement identifier des modèles, comprendre la chaîne d'événements qui mène à une alerte et agir rapidement pour corriger le problème.

  • Utilisation optimisée des ressources: en réduisant les fausses alertes et en activant l'identification de la cause première, vous gagnez du temps et des ressources. Avec l'optimisation, votre équipe peut se concentrer sur des tâches plus stratégiques, plutôt que d'être occupée par un flux constant de fausses alertes.

IBM Cloud Logs fournit un outil de génération de flux pour combiner visuellement, puis chaîner ensemble les alertes définies par l'utilisateur qui déclenchent une alerte de flux. Les blocs de construction de base de l'alerte de flux sont des étapes et des groupes.

Un groupe représente une combinaison logique d'alertes individuelles définies par l'utilisateur. Le groupe prend en charge les opérateurs logiques OR, AND et NOT pour combiner plusieurs alertes individuelles.

Une étape représente les groupes d'alertes qui doivent se déclencher dans un délai spécifié. Plusieurs groupes peuvent être présents dans une étape.

Les alertes de flux présentent les limitations suivantes:

  • L'alerte de flux doit comporter au moins deux étapes.
  • La première étape d'une alerte de flux ne peut contenir qu'un seul groupe.
  • La durée de l'intervalle de temps dans toutes les étapes ne peut pas dépasser 36 heures.
  • Vous pouvez combiner un maximum de 30 alertes en une seule alerte de flux.
  • Les types d'alerte d'alerte de flux suivants ne prennent pas en charge l'opérateur logique NOT:
    • Nouvelles alertes de valeur
    • Alertes de comptage uniques
    • Notifier immédiatement
    • Alertes standard