Alertas de limite
Você pode definir IBM Cloud Monitoring (anteriormente denominados Metric Alerts) no editor de alertas usando um formulário ou PromQL.
Para obter mais informações sobre a configuração de alertas, consulte Configurando um alerta usando o editor de alerta
Especificação das condições em que um alerta Threshold é acionado
No editor de alerta, especifique o seguinte na seção Métrica e Condições
- Scope
- O alerta é configurado para ser aplicado por padrão à Infraestrutura inteira do escopo da equipe. No entanto, é possível restringir o escopo de alerta filtrando por rótulos específicos, como
container_nameoukube_namespace_name. - Métrica
- Selecione a métrica que deseja monitorar e configure como deseja que os dados sejam agregados. Em seguida, é possível escolher o método de agregação que melhor atende às suas necessidades. Por exemplo, se você deseja entender a latência média em todo o cluster, é possível usar a agregação média. Como alternativa, se você deseja identificar nós com a latência mais alta, é possível usar a agregação máxima.
- Agrupar por Segmento
- Ao agrupar métricas por rótulos como
container_name, um segmento exclusivo é gerado para cada contêiner. Isso permite detectar rapidamente se um contêiner específico é responsável pelo desengorduramento de desempenho - Agregação de tempo
- Também conhecida como Intervalo, a Agregação de tempo de uma regra de alerta determina a janela de tempo sobre a qual a métrica selecionada é agregada. Por exemplo, se você selecionar a agregação
avgpara a métricacassandra_read_latencycom um intervalo especificado, ele calculará o valor médio da métricacassandra_read_latencydurante essa janela de tempo. Esse intervalo define o intervalo de tempo em que os valores de métrica são considerados para a agregação de tempo. - Duração
- A duração define o tempo em que uma condição de alerta deve ser satisfeita continuamente antes de acionar um alerta. Por exemplo, uma duração de 10m significa que a condição deve ser atendida por 10 minutos contínuos. Se a condição de alerta não for atendida em nenhum momento dentro desse período, o cronômetro de 10 minutos será reiniciado e deverá ser atendido novamente por 10 minutos completos e ininterruptos. A definição de uma duração mais longa reduz os falsos positivos, evitando que os alertas sejam acionados por violações de limites de curta duração.
Agregação de tempo e duração
A agregação de tempo de uma consulta de alerta define o período de tempo no qual os dados métricos relevantes são avaliados. Não deve ser confundida com a Duração de uma regra de alerta, que se refere ao período de tempo em que uma condição de alerta deve ser atendida antes de acionar um alerta.
Limites
Defina o limite e o intervalo de tempo para avaliar a condição de alerta
| Agregação | Descrição |
|---|---|
| average | A média dos valores de métrica recuperados durante o período de tempo. |
| sum | A soma da métrica no período de tempo avaliado. |
| máximo | O máximo dos valores de métrica recuperados no período de tempo. |
| mínimo | O mínimo dos valores da métrica recuperados no período. |
Imagens nas notificações de alerta do Threshold
As notificações de alerta de limite encaminhadas para o Slack ou para o e-mail incluem um instantâneo dos dados da série temporal de acionamento. Para canais de notificação do Slack, a captura instantânea pode ser ativada ou desativada nas configurações do canal de notificação. Quando o canal é configurado como Notify when Resolved, uma captura instantânea dos dados de série temporal que resolve o alerta também é fornecida na notificação.
Configurando diversos limites.
Além de um limite de alerta, um limite de aviso pode ser configurado. Os limites de aviso e de alerta podem ser associados a diferentes canais de notificação. No exemplo a seguir, um usuário pode desejar enviar uma notificação de aviso e alerta para o Slack, mas também paginar a equipe de plantão no Pagerduty se um limite de alerta for atendido.
Se ambos os limites de aviso e de alerta estiverem associados ao mesmo canal de notificação, uma métrica que exceder imediatamente o limite de alerta ignorará o limite de aviso e acionará apenas o limite de alerta...
Alertando quando não há dados de métrica
Quando uma métrica para de relatar dados, os alertas que usam essas métricas não podem ser avaliados. Para assegurar que você esteja ciente de quando isso ocorrer, é possível configurar alertas para notificar sobre Nenhum dado configurando a opção Nenhum dado na seção Configurações para ignorar ou notificar.
Convertendo uma configuração de alerta em PromQL
É possível converter automaticamente do formulário para PromQL para obter vantagem da flexibilidade e poder do PromQL. O uso da opção Traduzir para PromQL permite configurar consultas complexas
Por exemplo, a consulta a seguir examina a porcentagem de memória disponível em um host
sysdig_host_memory_available_bytes / sysdig_host_memory_total_bytes * 100
Os limites são configurados separadamente da consulta, permitindo que o usuário especifique um limite de alerta e um limite de aviso.