Alerta
Os alertas do IBM Cloud Logs permitem a detecção oportuna de anomalias, resposta proativa a incidentes, tempo médio para resolução (MTTR) melhorado, esforço de monitoramento manual reduzido, customização e flexibilidade. Desenvolvido com machine learning, o alerta notifica proativamente as equipes de possíveis problemas, correlaciona incidentes e fornece análise de causa raiz.
Como funciona o alerta
Alertas seguem um fluxo de trabalho geral para como eles são gerados, acionados e entregues aos usuários.
-
Configurar regras de alerta
Administradores, desenvolvedores ou DevOps definem regras de alerta na plataforma de observabilidade. Essas regras especificam as condições sob as quais um alerta é acionado Por exemplo, eles podem configurar uma regra para alertar quando mensagens de erro específicas aparecerem nos logs
-
Coleta e análise de dados
O IBM Cloud Logs coleta continuamente dados do sistema, incluindo logs e métricas. Ele processa e analisa esses dados com relação às regras de alerta definidas
-
Acionamento de alerta
Quando os dados monitorados atendem às condições especificadas nas regras de alerta, um alerta é acionado. O acionamento pode ser um resultado de um aumento repentino nas taxas de erros, alta latência, baixa disponibilidade do recurso, ou qualquer outra anomalia predefinida
-
Agregação e deduplicação de alerta
O sistema de alerta pode agregar vários alertas semelhantes em uma única notificação para evitar sobrecarregar os usuários com notificações redundantes. Além disso, ele pode deduplicar alertas para evitar enviar informações repetitivas aos usuários.
-
Notificação e escalação
Depois que um alerta é acionado e processado, o sistema envia notificações para os usuários ou equipes designados As notificações podem ser entregues por vários canais, como e-mail, Slack, SMS ou plataformas integradas de gerenciamento de incidentes. Se a situação permanecer não resolvida, o alerta poderá ser escalado para equipes ou indivíduos de nível superior..
-
Resolução e confirmação de alerta
Os destinatários do alerta reconhecem o alerta e tomam as ações apropriadas para resolver o problema Quando o problema é resolvido, eles marcam o alerta como "Pronto".
-
Monitoramento e relatórios
Durante o processo de alerta, o IBM Cloud Logs monitora continuamente o status do sistema. Ele pode controlar o status de confirmação, o tempo de resolução e outras métricas para gerar relatórios e ajudar na análise e melhoria pós-incidente.
Tipos de alerta
IBM Cloud Logs fornece 6 tipos de alertas que podem ser configurados.
Para obter mais informações sobre como configurar alertas, consulte Configurando alertas.
Alertas padrão
Os alertas padrão são alertas que são acionados por mudanças em seus logs Acionado cruzando um limite de quantidade definido de logs específicos, esse recurso permite monitorar o desempenho do sistema, ser notificado quando ocorrem mudanças, e identificar possíveis causas. Estes alertas são úteis ao tentar medir o número de ocorrências de um incidente específico.
Com recurso de alertas padrão, é possível:
-
Monitore o desempenho do sistema em tempo real Obtenha insights em tempo real com base nos critérios de sua escolha
-
Construa as consultas para as suas necessidades específicas Defina uma consulta que capture os logs que você deseja inspecionar e torne a consulta mais específica filtrando por aplicativo, subsistema e gravidade.. Em seguida, selecione o intervalo de condições para acionar um alerta Por exemplo, você pode configurar para acionar um alerta quando mais de 10 logs forem recebidos em um prazo específico.
-
Use uma abordagem baseada em aprendizado de máquina Usando essa configuração, o IBM Cloud Logs perfis seus dados e detecta automaticamente o comportamento anormal.
-
Receber notificações personalizadas. Receba notificações push em tempo real para o seu canal de comunicação preferido.
Os alertas padrão são os alertas mais simples oferecidos pelo IBM Cloud Logs. Eles podem ser usados para cobrir seus casos de uso mais óbvios como base para seu sistema de observabilidade.
Alertas relativos ao tempo
Detecte automaticamente o comportamento anormal em seu sistema usando os alertas relativos de tempo. Os alertas são acionados quando uma proporção fixa atinge um limite configurado em comparação com um prazo passado.
Use alertas relativos ao tempo para:
-
Receba alertas automáticos sobre mudanças na segurança, operações ou comportamentos de negócios de seu sistema ao longo do tempo.
-
Compare entre os comportamentos em diferentes períodos de tempo Por exemplo,
- Segurança
- Receba alertas automáticos que comparam o comportamento suspeito. Compare, por exemplo, o número de respostas de nome de domínio NX ou logins de administrador em dias ou semanas.
- Operações
- Receba alertas automáticos sobre taxas de erro e tempos de carregamento de página em seus aplicativos. Compare, por exemplo, taxas de erros e horários de carregamento de página no último dia ou hora.
- Negócios
- Receba alertas automáticos quando ocorrer uma mudança nas vendas ou nas inscrições do usuário Compare, por exemplo, o número de compras no mesmo dia da semana passada ou as inscrições do usuário durante o último mês.
Alertas de contagem exclusivos
Conforme os volumes de dados crescem e o número de alertas que são gerados por logs, métricas e sistemas de segurança aumenta exponencialmente, um dos indicadores mais poderosos de importância de alerta é o número de elementos afetados pelo alerta. Os exemplos podem incluir: o número de usuários que encontraram um erro 5XX ao chamarem uma API, o número de grupos de consumidores do Kafka que retornaram erros, o número de locais do CDN que estão atualmente carregando seu site por mais de 3 segundos ou o número de senhas diferentes com as quais um único usuário tenta efetuar login no seu console de serviço de nuvem
O problema com a maioria dos alertas é que eles descrevem o problema. No entanto, para entender a gravidade ou a amplitude do problema, os usuários precisam fazer drill down nos dados ou confiar em painéis..
Alertas de Contagem Exclusiva acionam o número de valores exclusivos dentro de uma chave selecionada que corresponde a um critério de procura específico. Ou seja, a cardinalidade de uma chave específica correspondida a uma procura
Alertas de proporção.
É possível calcular uma razão entre duas consultas de log e acionar um alerta quando a razão atingir um limite configurado..
Use esses alertas de proporção para monitorar:
-
Funcionamento operacional: Monitore o número de respostas de saída para solicitações recebidas ou a proporção de códigos de erro específicos para o número geral de erros...
-
Marketing: Monitore a proporção entre o tráfego de regiões específicas e o tráfego geral que segue as campanhas regionais
-
Segurança: Monitore a proporção de solicitações negadas, operações de administração específicas ou solicitações originadas de domínios de rede bloqueados em comparação com todas as solicitações
Novos alertas de valor
O novo alerta de valor é acionado pela primeira ocorrência de um novo valor em um intervalo de tempo. Todos os valores são testados com relação a uma lista criada dinamicamente enquanto o alerta está ativo. O alerta é configurado por uma consulta específica que identifica um subconjunto de logs (se necessário) e é definido com uma chave para controlar novos valores no intervalo desejado.
Esse alerta pode ajudá-lo a detectar automaticamente um possível comportamento anormal no sistema.
Um exemplo usado para esse tipo de alerta inclui:
-
Segurança: Um alerta pode ser acionado por uma nova conexão de domínio.. Como a segurança IBM Cloud Logs registra todas as informações de segurança em todo o tráfego de rede, uma nova conexão de domínio pode fazer com que o campo
security.highest_registered_domaintenha um novo valor. Uma nova conexão de domínio pode apontar para um possível ataque de segurança. -
Monitoramento: um alerta pode ser acionado por um novo código de erro do aplicativo... Muitas requisições enviam um campo
error_code. Um novo valor para esse campo pode indicar um novo problema com a requisição.
Alertas de fluxo.
Um alerta de fluxo é projetado para notificar quando qualquer combinação de eventos de alerta ocorre em uma sequência específica dentro de um prazo definido.
Por exemplo, para ser notificado de um aumento na taxa de erro de HTTP causado pela alta utilização de CPU, um alerta de fluxo pode ser configurado para ser acionado quando um alerta de utilização de CPU alta é seguido por um alerta de taxa de erro de HTTP alta dentro de um prazo definido.
A seguir estão alguns benefícios de usar alertas de fluxos:
-
Correlação de dados abrangente: com alertas de fluxo, é possível correlacionar alertas em logs, métricas e eventos de segurança. Essa abordagem fornece uma visão holística do desempenho do sistema, não partes isoladas de informações. As informações correlacionadas ajudam você a ter todos os dados necessários para tomar decisões informadas.
-
Análise de causa raiz avançada: alertas de fluxo podem ser configurados para identificar a causa raiz de um problema. Com a capacidade de definir um alerta que identifique a causa raiz do problema, é possível responder prontamente aos problemas, reduzindo assim o tempo de inatividade do sistema e aprimorando a eficiência operacional.
-
Fadiga de alerta reduzida: os sistemas de monitoramento tradicionais geralmente inundam os usuários com alertas redundantes, levando à fadiga de alerta e ao potencial de negligenciar problemas críticos.. Os alertas de fluxo podem reduzir alertas falsos aplicando um filtro de critérios ordenados e de tempo limite. Isto significa que você é alertado quando todas as condições definidas são atendidas, reduzindo o ruído de notificação desnecessário..
-
Sequências de alertas customizáveis: com esse recurso exclusivo de alertas de fluxo, você pode definir sua sequência de alertas com uma interface simples de arrastar e soltar.. Crie um fluxo que seja acionado apenas se todos os critérios forem atendidos por ordem e horário
-
Resolução eficiente de problemas: com a capacidade de visualizar a sequência de alertas em uma tela, a resolução de problemas se torna mais eficiente.. É possível identificar padrões, entender a cadeia de eventos que levam a um alerta e agir rapidamente para corrigir o problema.
-
Utilização de recurso otimizado: ao reduzir alertas falsos e permitir a identificação de causa raiz, você economizará tempo e recursos.. Com a otimização, sua equipe pode focar em tarefas mais estratégicas, em vez de estar ocupada com um fluxo constante de alertas falsos.
IBM Cloud Logs fornece uma ferramenta do construtor de fluxo para combinar visualmente e, em seguida, encadear juntos os alertas definidos pelo usuário que acionam um alerta de fluxo. Os blocos de construção básicos do alerta de fluxo são estágios e grupos.
Um grupo representa uma combinação lógica de alertas individuais definidos pelo usuário O grupo suporta os operadores lógicos OR, AND e NOT para combinar vários alertas individuais
Um estágio representa grupos de alertas que precisam ser acionados dentro de um prazo especificado. Vários grupos podem estar presentes em um estágio.
Os alertas de fluxo têm as limitações a seguir:
- O alerta de fluxo deve ter no mínimo dois estágios.
- O primeiro estágio de um alerta de fluxo pode conter apenas 1 grupo.
- A duração do prazo em todos os estágios não pode exceder 36 horas.
- É possível combinar um máximo de 30 alertas em um único alerta de fluxo.
- Os tipos de alerta de alerta de fluxo a seguir não suportam o operador lógico NOT:
- Novos alertas de valor
- Alertas de contagem exclusivos
- Notificar imediatamente
- Alertas padrão