Avvisi

Gli avvisi IBM Cloud Logs consentono il rilevamento tempestivo di anomalie, la risposta proattiva agli incidenti, il miglioramento del tempo di risoluzione (MTTR), la riduzione dello sforzo di monitoraggio manuale, la personalizzazione e la flessibilità. Basato sull'apprendimento automatico, l'avviso notifica in modo proattivo i team di potenziali problemi, mette in correlazione gli incidenti e fornisce l'analisi della causa principale.

Come funziona la creazione di avvisi

Gli avvisi seguono un flusso di lavoro generale per come vengono generati, attivati e consegnati agli utenti.

Alerting in IBM Cloud Logs
Alerting in IBM Cloud Logs

  1. Imposta regole di avviso

    Gli amministratori, gli sviluppatori o DevOps definiscono le regole di avviso all'interno della piattaforma di osservabilità. Queste regole specificano le condizioni in cui viene attivato un avviso. Ad esempio, potrebbero impostare una regola per avvisare quando vengono visualizzati specifici messaggi di errore nei log.

  2. Raccolta e analisi dei dati

    IBM Cloud Logs raccoglie continuamente i dati dal sistema, inclusi log e metriche. Elabora e analizza questi dati rispetto alle regole di avviso definite.

  3. Attivazione avviso

    Quando i dati monitorati soddisfano le condizioni specificate nelle regole di avviso, viene attivato un avviso. L'attivazione può essere il risultato di un improvviso picco nella frequenza di errori, un'elevata latenza, una bassa disponibilità di risorse o qualsiasi altra anomalia predefinita.

  4. Aggregazione e deduplicazione degli avvisi

    Il sistema di creazione di avvisi potrebbe aggregare più avvisi simili in una singola notifica per evitare che gli utenti sovraccaricino con notifiche ridondanti. Inoltre, può deduplicare gli avvisi per evitare l'invio di informazioni ripetitive agli utenti.

  5. Notifica ed escalation

    Una volta attivato ed elaborato un avviso, il sistema invia notifiche agli utenti o ai team designati. Le notifiche possono essere inviate tramite vari canali, come email, Slack, SMS o piattaforme di gestione degli incidenti integrate. Se la situazione rimane irrisolta, l'avviso può essere inoltrato a team o individui di livello superiore.

  6. Risoluzione e riconoscimento degli avvisi

    I destinatari dell'avviso riconoscono l'avviso e adottano le azioni appropriate per risolvere il problema. Una volta risolto il problema, contrassegnano l'avviso come "Fatto".

  7. Monitoraggio e rendicontazione

    Nel processo di creazione di avvisi, IBM Cloud Logs monitora continuamente lo stato del sistema. È in grado di tenere traccia dello stato di riconoscimento, del tempo di risoluzione e di altre metriche per generare report e semplificare l'analisi e il miglioramento post - incidente.

Tipi di avviso

IBM Cloud Logs fornisce 6 tipi di avvisi che puoi configurare.

Per ulteriori informazioni su come configurare gli avvisi, vedere Icona degli avvisi Configurazione degli avvisi.

Avvisi standard

Gli avvisi standard sono avvisi che vengono attivati dalle modifiche ai log. Attivata attraversando una soglia di quantità impostata di log specifici, questa funzione consente di monitorare le prestazioni del sistema, ricevere notifiche quando si verificano le modifiche e individuare le cause potenziali. Questi avvisi sono utili quando si tenta di misurare il numero di ricorrenze di uno specifico incidente.

Con la funzionalità degli avvisi standard, è possibile:

  • Monitorare le prestazioni del sistema in tempo reale. Ottieni informazioni dettagliate in tempo reale in base ai criteri di tua scelta.

  • Costruire le interrogazioni per le proprie esigenze specifiche. Definire una query che acquisisca i log che si desidera esaminare e rendere la query più specifica filtrando per applicazione, sottosistema e severità. Quindi, selezionare l'intervallo di condizioni per attivare un avviso. Ad esempio, è possibile impostare l'attivazione di un avviso quando vengono ricevuti più di 10 log in un determinato intervallo di tempo.

  • Utilizzare un approccio basato sul machine learning. Utilizzando questa impostazione, IBM Cloud Logs crea un profilo dei tuoi dati e rileva automaticamente un comportamento anomalo.

  • Ricevere notifiche personalizzate. Ricevi notifiche push in tempo reale sul tuo canale di comunicazione preferito.

Gli avvisi standard sono gli avvisi più semplici offerti da IBM Cloud Logs. Questi possono essere utilizzati per coprire i tuoi casi d'uso più ovvi come base per il tuo sistema di osservabilità.

Avvisi relativi al tempo

Rileva automaticamente il comportamento anomalo nel proprio sistema utilizzando gli avvisi relativi al tempo. Gli avvisi vengono attivati quando un rapporto fisso raggiunge una soglia impostata rispetto a un periodo di tempo passato.

Utilizza avvisi relativi al tempo per:

  • Ricevere avvisi automatici relativi alle modifiche nella sicurezza del sistema, nelle operazioni o nei comportamenti di business nel tempo.

  • Confrontare i comportamenti in periodi di tempo differenti. Ad esempio,

    Sicurezza
    Ricevere avvisi automatici che confrontano il comportamento sospetto. Confronta, ad esempio, il numero di risposte di nomi di dominio NX o di accessi admin in giorni o settimane.
    Operazioni
    Ricevere avvisi automatici sulle frequenze di errore e sui tempi di caricamento delle pagine nelle applicazioni. Confrontare, ad esempio, le frequenze degli errori e le ore di caricamento della pagina nel giorno o nell'ora precedenti.
    Business
    Ricevere avvisi automatici quando si verifica un cambiamento nelle vendite o nelle registrazioni utente. Confronta, ad esempio, il numero di acquisti nello stesso giorno della settimana scorsa o le iscrizioni dell'utente nell'ultimo mese.

Avvisi di conteggio univoci

Man mano che i volumi di dati aumentano e il numero di avvisi generati da log, metriche e sistemi di sicurezza aumenta in modo esponenziale, uno degli indicatori più potenti di importanza degli avvisi è il numero di elementi interessati dall'avviso. Gli esempi possono includere: il numero di utenti che hanno rilevato un errore 5XX durante la chiamata di un'API, il numero di gruppi di consumatori Kafka che hanno restituito errori, il numero di ubicazioni CDN che stanno attualmente caricando il tuo sito per più di 3 secondi o il numero di password differenti con cui un singolo utente tenta di accedere alla tua console del servizio cloud.

Il problema con la maggior parte degli avvisi è che descrivono il problema. Tuttavia, per comprendere la gravità o l'ampiezza del problema, gli utenti devono eseguire il drill nei dati o affidarsi ai dashboard.

Gli avvisi di conteggio univoco vengono attivati in base al numero di valori univoci all'interno di una chiave selezionata che corrisponde a uno specifico criterio di ricerca. Vale a dire, la cardinalità di una chiave specifica corrispondente a una ricerca.

Avvisi rapporto

È possibile calcolare un rapporto tra due query di log e attivare un avviso quando il rapporto raggiunge una soglia impostata.

Utilizzare questo rapporto avvisi per monitorare:

  • Stato operativo: monitorare il numero di risposte in entrata alle richieste in entrata o il rapporto tra codici di errore specifici e il numero complessivo di errori.

  • Marketing: monitorare il rapporto tra il traffico da regioni specifiche e il traffico complessivo che segue le campagne regionali.

  • Sicurezza: monitorare il rapporto tra le richieste negate, le operazioni di amministrazione specifiche o le richieste che hanno origine da domini di rete bloccati rispetto a tutte le richieste.

Nuovi avvisi valore

L'avviso del nuovo valore viene attivato dalla prima ricorrenza di un nuovo valore entro un intervallo di tempo. Tutti i valori vengono verificati rispetto a un elenco creato in modo dinamico mentre l'avviso è attivo. L'avviso viene impostato da una query specifica che identifica una sottoserie di log (se necessario) ed è definita con una chiave per tenere traccia dei nuovi valori nell'intervallo desiderato.

Questo avviso può aiutare a rilevare automaticamente un possibile comportamento anomalo all'interno del sistema.

Un esempio di utilizzo per questo tipo di avviso include:

  • Sicurezza: un avviso può essere attivato da una nuova connessione di dominio. Poiché la sicurezza IBM Cloud Logs registra tutte le informazioni di sicurezza in tutto il traffico di rete, una nuova connessione di dominio può risultare con il campo security.highest_registered_domain che ha un nuovo valore. Una nuova connessione di dominio può puntare a un possibile attacco di sicurezza.

  • Monitoraggio: un avviso può essere attivato da un nuovo codice di errore dell'applicazione. Molte applicazioni inviano un campo error_code. Un nuovo valore per questo campo può indicare un nuovo problema con l'applicazione.

Avvisi di flusso

Un avviso di flusso è progettato per avvisare l'utente quando una combinazione di eventi di avviso si verifica in una sequenza specifica all'interno di un periodo di tempo definito.

Ad esempio, per essere informati di un aumento della frequenza di errore HTTP causato da un utilizzo elevato della CPU, è possibile configurare un avviso di flusso da attivare quando un avviso di utilizzo elevato della CPU è seguito da un avviso di frequenza di errore HTTP elevato in un intervallo di tempo definito.

Di seguito sono riportati alcuni vantaggi dell'utilizzo degli avvisi di flusso:

  • Correlazione dati completa: con gli avvisi di flusso, è possibile correlare gli avvisi su log, metriche ed eventi di sicurezza. Questo approccio fornisce una vista olistica delle prestazioni del proprio sistema, non informazioni isolate. Le informazioni correlate consentono di disporre di tutti i dati necessari per prendere decisioni informate.

  • Analisi della causa principale avanzata: gli avvisi del flusso possono essere configurati per identificare la causa principale di un problema. Con la possibilità di definire un avviso che individua la causa principale del problema, è possibile rispondere prontamente ai problemi, riducendo i tempi di fermo del sistema e migliorando l'efficienza operativa.

  • Riduzione dell'affaticamento degli avvisi: i sistemi di monitoraggio tradizionali spesso inondano gli utenti con avvisi ridondanti, portando all'affaticamento degli avvisi e al potenziale di trascurare i problemi critici. Gli avvisi di flusso possono ridurre i falsi avvisi applicando un filtro di criteri ordinato e con limite di tempo. Ciò significa che si viene avvisati quando vengono soddisfatte tutte le condizioni impostate, riducendo il rumore di notifica non necessario.

  • Sequenze di avvisi personalizzabili: con questa funzionalità unica di avvisi di flusso è possibile definire la sequenza di avvisi con una semplice interfaccia di trascinamento e rilascio. Creare un flusso che si attiva solo se tutti i criteri sono soddisfatti dall'ordine e dall'ora.

  • Risoluzione dei problemi efficiente: con la possibilità di visualizzare la sequenza di avvisi su un canvas, la risoluzione dei problemi diventa più efficiente. È possibile identificare facilmente i pattern, comprendere la catena di eventi che portano a un avviso e agire rapidamente per risolvere il problema.

  • Utilizzo ottimizzato delle risorse: riducendo i falsi avvisi e abilitando l'identificazione della causa principale, risparmierai tempo e risorse. Con l'ottimizzazione, il tuo team può concentrarsi su attività più strategiche, piuttosto che essere occupato con un flusso costante di falsi avvisi.

IBM Cloud Logs fornisce uno strumento di creazione di flussi per combinare visivamente, e quindi concatenare insieme, gli avvisi definiti dall'utente che attivano un avviso di flusso. I blocchi di creazione di base dell'avviso del flusso sono fasi e gruppi.

Un gruppo rappresenta una combinazione logica di singoli avvisi definiti dall'utente. Il gruppo supporta operatori logici OR, AND e NOT per combinare più singoli avvisi.

Uno stage rappresenta i gruppi avvisi che devono essere attivati entro un periodo di tempo specificato. Più gruppi possono essere presenti in una fase.

Gli avvisi di flusso presentano le seguenti limitazioni:

  • L'avviso di flusso deve avere almeno 2 fasi.
  • La prima fase di un avviso di flusso può contenere solo 1 gruppo.
  • La durata dell'intervallo di tempo in tutte le fasi non può superare 36 ore.
  • Puoi combinare un massimo di 30 avvisi in un singolo avviso di flusso.
  • I seguenti tipi di avvisi di flusso non supportano l'operatore logico NOT:
    • Nuovi avvisi valore
    • Avvisi di conteggio univoci
    • Notifica immediatamente
    • Avvisi standard