Creación de alertas

Las alertas de IBM Cloud Logs permiten la detección puntual de anomalías, respuesta proactiva a incidencias, mejora del tiempo medio de resolución (MTTR), reducción del esfuerzo de supervisión manual, personalización y flexibilidad. Basado en machine learning, la alerta notifica de forma proactiva a los equipos de problemas potenciales, correlaciona incidencias y proporciona análisis de causa raíz.

Cómo funciona la alerta

Las alertas siguen un flujo de trabajo general sobre cómo se generan, desencadenan y entregan a los usuarios.

Alerting in IBM Cloud Logs
Alerting in IBM Cloud Logs

  1. Establecer reglas de alerta

    Los administradores, desarrolladores o DevOps definen reglas de alerta dentro de la plataforma de observabilidad. Estas reglas especifican las condiciones en las que se desencadena una alerta. Por ejemplo, pueden establecer una regla para alertar cuando aparecen mensajes de error específicos en los registros.

  2. Recopilación y análisis de datos

    IBM Cloud Logs recopila continuamente datos del sistema, incluidos registros y métricas. Procesa y analiza estos datos con respecto a las reglas de alerta definidas.

  3. Desencadenamiento de alertas

    Cuando los datos supervisados cumplen las condiciones especificadas en las reglas de alerta, se desencadena una alerta. El desencadenamiento puede ser el resultado de un pico repentino de tasas de error, una latencia alta, una baja disponibilidad de recursos o cualquier otra anomalía predefinida.

  4. Agregación y deduplicación de alertas

    El sistema de alertas puede agregar varias alertas similares en una única notificación para evitar que los usuarios superen las notificaciones redundantes. Además, puede eliminar duplicados de las alertas para evitar el envío de información repetitiva a los usuarios.

  5. Notificación y escalabilidad

    Una vez que se desencadena y procesa una alerta, el sistema envía notificaciones a los usuarios o equipos designados. Las notificaciones se pueden entregar a través de varios canales como, por ejemplo, correo electrónico, Slack, SMS o plataformas integradas de gestión de incidencias. Si la situación permanece sin resolver, la alerta se puede escalar a equipos o personas de nivel superior.

  6. Resolución y acuse de recibo de alerta

    Los destinatarios de la alerta reconocen la alerta y realizan las acciones adecuadas para resolver el problema. Una vez resuelto el problema, marcan la alerta como "Terminado".

  7. Supervisión e informes

    A lo largo del proceso de alerta, IBM Cloud Logs supervisa continuamente el estado del sistema. Puede realizar un seguimiento del estado de reconocimiento, el tiempo de resolución y otras métricas para generar informes y ayudar con el análisis y la mejora posteriores a la incidencia.

Tipos de alerta

IBM Cloud Logs proporciona 6 tipos de alertas que puede configurar.

Para obtener más información sobre cómo configurar alertas, consulte el icono Alertas Configuración de alertas.

Alertas estándar

Las alertas estándar son alertas desencadenadas por cambios en los registros. Desencadenada cruzando un umbral de cantidad establecido de registros específicos, esta característica le permite supervisar el rendimiento del sistema, recibir notificaciones cuando se produzcan cambios y determinar las causas potenciales. Estas alertas son útiles cuando se intenta medir el número de apariciones de una incidencia determinada.

Con la característica de alertas estándar, puede:

  • Supervise el rendimiento del sistema en tiempo real. Obtenga información de valor en tiempo real en función de los criterios que elija.

  • Construya las consultas para sus necesidades específicas. Defina una consulta que capture los registros que desea inspeccionar y haga que la consulta sea más específica filtrando por aplicación, subsistema y gravedad. A continuación, seleccione el rango de condiciones para desencadenar una alerta. Por ejemplo, puede establecer que se desencadene una alerta cuando se reciban más de 10 registros durante un periodo de tiempo específico.

  • Utilice un enfoque basado en aprendizaje automático. Utilizando este valor, IBM Cloud Logs perfila los datos y detecta automáticamente un comportamiento anómalo.

  • Recibir notificaciones personalizadas. Reciba notificaciones push en tiempo real a su canal de comunicación preferido.

Las alertas estándar son las alertas más simples que ofrece IBM Cloud Logs. Estos se pueden utilizar para cubrir los casos de uso más obvios como base para el sistema de observabilidad.

Alertas relativas de tiempo

Detecte automáticamente un comportamiento anormal en el sistema utilizando las alertas de tiempo relativo. Las alertas se desencadenan cuando una proporción fija alcanza un umbral establecido en comparación con un marco de tiempo pasado.

Utilizar alertas relativas de tiempo para:

  • Reciba alertas automáticas sobre los cambios en la seguridad, las operaciones o los comportamientos empresariales del sistema a lo largo del tiempo.

  • Comparar entre comportamientos en distintos periodos de tiempo. Por ejemplo:

    Seguridad
    Recibe alertas automáticas que comparan el comportamiento sospechoso. Compare, por ejemplo, el número de respuestas de nombre de dominio NX o inicios de sesión de administrador entre días o semanas.
    Operaciones
    Reciba alertas automáticas sobre tasas de error y tiempos de carga de página en las aplicaciones. Compare, por ejemplo, las tasas de error y las horas de carga de página en el último día u hora.
    Empresa
    Recibir alertas automáticas cuando se produzca un cambio en las ventas o en las inscripciones de los usuarios. Compare, por ejemplo, el número de compras realizadas el mismo día de la semana pasada o el número de registros del usuario durante el último mes.

Alertas de recuento exclusivo

A medida que crecen los volúmenes de datos y el número de alertas generadas por registros, métricas y sistemas de seguridad aumenta exponencialmente, uno de los indicadores más potentes de importancia de alerta es el número de elementos afectados por la alerta. Los ejemplos pueden incluir: el número de usuarios que han encontrado un error 5XX al llamar a una API, el número de grupos de consumidores Kafka que han devuelto errores, el número de ubicaciones de CDN que están cargando actualmente el sitio durante más de 3 segundos o el número de contraseñas diferentes con las que un único usuario intenta iniciar sesión en la consola del servicio de nube.

El problema con la mayoría de las alertas es que describen el problema. Sin embargo, para comprender la gravedad o amplitud del problema, los usuarios deben profundizar en los datos o confiar en los paneles de control.

Las alertas de recuento exclusivo desencadenan el número de valores exclusivos dentro de una clave seleccionada que coincide con un criterio de búsqueda específico. Es decir, la cardinalidad de una clave específica coincidía con una búsqueda.

Alertas de proporción

Puede calcular una proporción entre dos consultas de registro y desencadenar una alerta cuando la proporción alcanza un umbral establecido.

Utilice esta proporción de alertas para supervisar:

  • Estado operativo: Supervisar el número de respuestas de salida a las solicitudes de entrada o la proporción de códigos de error específicos respecto al número global de errores.

  • Marketing: Supervisar la proporción entre el tráfico de regiones específicas y el tráfico global que sigue a las campañas regionales.

  • Seguridad: Supervisar la proporción de solicitudes denegadas, operaciones de administración específicas o solicitudes procedentes de dominios de red bloqueados en comparación con todas las solicitudes.

Alertas de valor nuevo

La alerta de valor nuevo se desencadena por la primera aparición de un valor nuevo dentro de un intervalo de tiempo. Todos los valores se prueban en una lista que se crea dinámicamente mientras la alerta está activa. La alerta se establece mediante una consulta específica que identifica un subconjunto de registros (si es necesario) y se define con una clave para realizar un seguimiento de los nuevos valores dentro del intervalo deseado.

Esta alerta puede ayudarle a detectar automáticamente un posible comportamiento anormal en el sistema.

Un ejemplo de usos para este tipo de alerta incluye:

  • Seguridad: Una nueva conexión de dominio puede desencadenar una alerta. Puesto que la seguridad de IBM Cloud Logs registra toda la información de seguridad en todo el tráfico de red, una nueva conexión de dominio puede dar como resultado que el campo security.highest_registered_domain tenga un nuevo valor. Una nueva conexión de dominio puede apuntar a un posible ataque de seguridad.

  • Supervisión: Una alerta puede ser desencadenada por un nuevo código de error de aplicación. Muchas aplicaciones envían un campo error_code. Un valor nuevo para este campo puede indicar un problema nuevo con la aplicación.

Alertas de flujo

Una alerta de flujo está diseñada para notificarle cuando se produce una combinación de sucesos de alerta en una secuencia específica dentro de un marco de tiempo definido.

Por ejemplo, para que se le notifique de un aumento en el índice de errores HTTP causado por una utilización de CPU alta, se puede configurar una alerta de flujo para que se desencadene cuando una alerta de utilización de CPU alta vaya seguida de una alerta de índice de errores HTTP alta dentro de un intervalo de tiempo definido.

Las siguientes son algunas de las ventajas de utilizar alertas de flujo:

  • Correlación de datos completa: con las alertas de flujo, puede correlacionar alertas en registros, métricas y sucesos de seguridad. Este enfoque proporciona una visión holística del rendimiento del sistema, no información aislada. La información correlacionada le ayuda a tener todos los datos que necesita para tomar decisiones informadas.

  • Análisis de causa raíz avanzado: las alertas de flujo se pueden configurar para identificar la causa raíz de un problema. Con la capacidad de definir una alerta que señale la causa raíz del problema, puede responder rápidamente a los problemas, reduciendo así el tiempo de inactividad del sistema y mejorando la eficiencia operativa.

  • Reducción de la fatiga de alerta: Los sistemas de supervisión tradicionales a menudo inundan a los usuarios con alertas redundantes, lo que conduce a la fatiga de alerta y al potencial de pasar por alto los problemas críticos. Las alertas de flujo pueden reducir las alertas falsas aplicando un filtro de criterios ordenado y de límite de tiempo. Esto significa que se le avisa cuando se cumplen todas las condiciones establecidas, lo que reduce el ruido de notificación innecesario.

  • Secuencias de alertas personalizables: con esta característica exclusiva de alertas de flujo, puede definir la secuencia de alertas con una sencilla interfaz de arrastrar y soltar. Cree un flujo que se desencadene sólo si se cumplen todos los criterios por orden y hora.

  • Resolución de problemas eficiente: Con la capacidad de visualizar la secuencia de alertas en un lienzo, la resolución de problemas se vuelve más eficiente. Puede identificar fácilmente patrones, comprender la cadena de sucesos que conducen a una alerta y actuar rápidamente para rectificar el problema.

  • Utilización de recursos optimizada: al reducir las alertas falsas y habilitar la identificación de causa raíz, ahorrará tiempo y recursos. Con la optimización, su equipo puede centrarse en tareas más estratégicas, en lugar de estar ocupado con una corriente constante de alertas falsas.

IBM Cloud Logs proporciona una herramienta de creador de flujos para combinar visualmente y, a continuación, encadenar las alertas definidas por el usuario que desencadenan una alerta de flujo. Los componentes básicos de la alerta de flujo son etapas y grupos.

Un grupo representa una combinación lógica de alertas individuales definidas por el usuario. El grupo admite operadores lógicos OR, AND y NOT para combinar varias alertas individuales.

Una etapa representa grupos de alertas que deben desencadenarse dentro de un intervalo de tiempo especificado. Varios grupos pueden estar presentes en una etapa.

Las alertas de flujo tienen las limitaciones siguientes:

  • La alerta de flujo debe tener un mínimo de 2 etapas.
  • La primera etapa de una alerta de flujo sólo puede contener 1 grupo.
  • La duración del intervalo de tiempo en todas las etapas no puede exceder de 36 horas.
  • Puede combinar un máximo de 30 alertas en una única alerta de flujo.
  • Los siguientes tipos de alerta de flujo no dan soporte al operador lógico NOT:
    • Alertas de valor nuevo
    • Alertas de recuento exclusivo
    • Notificar inmediatamente
    • Alertas estándar