Alertas de tiempo de inactividad

Puede definir alertas de tiempo de inactividad de IBM Cloud Monitoring en el editor de alertas utilizando un formulario.

IBM Cloud Monitoring supervisa continuamente distintos tipos de entidades en la infraestructura, como un host, un contenedor, un proceso y envía notificaciones cuando la entidad supervisada no está disponible o no responde. Las alertas de tiempo de inactividad se centran principalmente en el tiempo de inactividad no planificado de programas, contenedores y hosts de la infraestructura.

Para supervisar el tiempo de inactividad de las entidades, se utilizan las métricas siguientes: sysdig_host_up, sysdig_container_up y sysdig_program_up. Indican si el agente puede comunicarse con el recopilador. El valor 1 representa que la entidad está en activo y que el agente está enviando esta información al recopilador. El valor 0 representa que la entidad está inactiva, lo que implica que no hay comunicación entre el agente y el recopilador sobre la entidad.

Cuando se configura una alerta basándose en la métrica ab up, se ejecutan dos consultas de API de datos durante la comprobación de alerta. Una consulta recuperará los valores actuales y la otra recuperará los valores del intervalo de comprobación de alerta anterior. Para cualquier entidad que estuviera presente en el intervalo anterior y no esté presente en el intervalo actual, la métrica se marca como 0.

Se visualiza un valor agregado de la métrica up en el panel de control del Editor de alertas con un valor entre 0 y 1.

Definición de una alerta de tiempo de inactividad

Tenga en cuenta lo siguiente al configurar una alerta de tiempo de inactividad:

  • Establezca un nombre significativo y una descripción que ayuden a los destinatarios a identificar fácilmente la alerta.
  • Establezca un nivel de gravedad para la alerta. La Gravedad de alerta (High, Medium, Low y Info) se refleja en la lista de alertas. Puede ordenar las alertas por gravedad. Puede utilizar la gravedad como criterio al crear alertas. Por ejemplo, desea que se le avise si hay más de 10 sucesos de gravedad alta.
  • Especifique varios segmentos. Es posible que la selección de un único segmento no siempre proporcione suficiente información para resolver el problema. Enriquecer la entidad seleccionada con información relacionada añadiendo segmentos relacionados adicionales. Entre entidades jerárquicas para que pueda tener una comprensión de lo que ha ido mal y dónde. Por ejemplo, la especificación de un clúster Kubernetes por sí solo no proporciona el contexto necesario para la resolución de problemas. Para limitar el problema, añada más información contextual, como por ejemplo Kubernetes, Kubernetes, etc.

Condiciones de tiempo de inactividad

Puede configurar la alerta de tiempo de inactividad basándose en una serie de condiciones.

Ámbito

Puede filtrar el entorno donde se aplicará la alerta. Por ejemplo, se enviará una alerta cuando un contenedor asociado con el agente 197288 se desactiva. La alerta se desencadenará para cada nombre de contenedor e ID de agente.

Puede utilizar los operadores in o contain para que coincidan con varios valores posibles diferentes.

Los operadores contain y not contain le ayudan a recuperar valores si conoce parte de los valores. Por ejemplo, us recupera valores que contienen series que empiezan por "us", como por ejemplo “us-east-1b”, “us-west-2b”, etc.

Los operadores in y not in le permiten filtrar varios valores.

También puede crear alertas directamente desde Explorar y Paneles de control para rellenar automáticamente el ámbito.

Métrica

Seleccione una métrica de tiempo de actividad asociada con la entidad cuyo tiempo de inactividad desea supervisar. Puede seleccionar una de las entidades siguientes: host, container o program.

Entidad

Especifique segmentos adicionales utilizando la opción Alert if any of.

Las entidades especificadas se segmentan en, y se notifican con, la plantilla de notificación predeterminada, así como en la vista previa.

Desencadenante

Defina el umbral y el intervalo de tiempo para evaluar la condición de alerta. Las escalas de tiempo admitidas son minute,hour, o day. Por ejemplo, si el programa supervisado no está disponible o no responde durante el último minuto, se notificará a los destinatarios de la alerta.

Puede establecer cualquier valor para el porcentaje (%) y un valor mayor que 1 para la ventana de tiempo. Por ejemplo, si elige el 50% en lugar del 100%, se desencadenará una notificación cuando la entidad esté inactiva durante 5 minutos en la ventana de tiempo seleccionada de 10 minutos.

Casos de uso de ejemplo

Algunos casos de uso en los que puede considerar utilizar una alerta de tiempo de inactividad son:

  • Cuando su sitio web de comercio electrónico está inactivo durante las horas pico del Viernes Negro, Navidad, o temporada de Año Nuevo.
  • Cuando los servidores de producción de su centro de datos experimentan una parada crítica.
  • Cuando no se puede acceder a una base de datos MySQL.
  • Cuando una carga de archivo no funciona en su sitio web de marketing.