告警

IBM Cloud Logs 警报允许及时检测异常,主动事件响应,缩短平均解决时间 (MTTR),减少手动监视工作,定制和灵活性。 由机器学习提供支持,主动发出警报,通知团队潜在问题,关联事件,并提供根本原因分析。

警报工作方式

警报遵循常规工作流程,以了解如何生成,触发和传递给用户。

Alerting in IBM Cloud Logs
Alerting in IBM Cloud Logs

  1. 设置警报规则

    管理员,开发者或 DevOps 在可观察性平台中定义警报规则。 这些规则指定触发警报的条件。 例如,他们可以设置规则以在日志中出现特定错误消息时发出警报。

  2. 数据收集和分析

    IBM Cloud Logs 持续从系统收集数据,包括日志和度量值。 它根据定义的警报规则来处理和分析此数据。

  3. 警报触发

    当受监视数据满足警报规则中指定的条件时,将触发警报。 触发可能是由于错误率突然激增,高延迟,低资源可用性或任何其他预定义异常所致。

  4. 警报聚集和重复数据删除

    警报系统可能会将多个类似警报聚集到单个通知中,以防止用户收到冗余通知。 此外,它还可以删除重复警报,以避免向用户发送重复信息。

  5. 通知和上报

    一旦触发并处理警报,系统就会向指定的用户或团队发送通知。 可以通过各种渠道 (例如,电子邮件,Slack,SMS 或集成事件管理平台) 交付通知。 如果情境仍未解决,那么可以将警报升级到更高级别的团队或个人。

  6. 警报解决和确认

    警报的收件人确认警报并采取相应的操作来解决该问题。 问题解决后,他们会将警报标记为“已完成”。

  7. 监视和报告

    在整个警报过程中,IBM Cloud Logs 持续监视系统的状态。 它可以跟踪确认状态,解决时间和其他度量值,以生成报告并帮助进行事件后分析和改进。

警报类型

IBM Cloud Logs 提供 6 类型的警报,您可以配置这些警报。

有关如何配置警报的更多信息,请参阅警报图标 配置警报

标准警报

标准警报是由日志更改触发的警报。 通过跨越特定日志的设置数量阈值而触发,此功能允许您监视系统性能,在发生更改时接收通知,并确定潜在原因。 尝试测量特定事件的出现次数时,这些警报很有用。

通过标准警报功能,您可以:

  • 实时监控系统性能。 根据您选择的条件获取实时洞察。

  • 针对您的特定需求构造查询。 定义用于捕获要检查的日志的查询,并通过按应用程序,子系统和严重性进行过滤来使查询更具体。 然后,选择要触发警报的条件范围。 例如,您可以设置为在特定时间范围内接收到超过 10 个日志时触发警报。

  • 使用基于机器学习的方法。 通过使用此设置,IBM Cloud Logs 将对数据进行概要分析并自动检测异常行为。

  • 接收个性化通知。 接收到您首选的通信信道的实时推送通知。

标准警报是 IBM Cloud Logs提供的最简单的警报。 这些可用来覆盖最明显的用例,作为可观察性系统的基础。

时间相对警报

使用时间相对警报自动检测系统中的异常行为。 当固定比率与过去的时间范围相比达到设置的阈值时,将触发警报。

使用时间相对警报:

  • 接收有关系统的安全性,操作或业务行为随时间变化的自动警报。

  • 在不同时间段内的行为之间进行比较。 例如

    安全性
    接收比较可疑行为的自动警报。 例如,比较几天或几周内的 NX 域名响应或管理登录数。
    操作
    接收有关应用程序中的错误率和页面装入时间的自动警报。 例如,比较过去一天或一小时内的错误率和页面装入时间。
    业务
    当发生销售或用户注册的轮班时,接收自动警报。 例如,比较上周同一天的购买次数或上个月的用户注册数。

唯一计数警报

随着数据量的增长以及日志,度量和安全系统生成的警报数量呈指数级增长,警报重要性的最强大指标之一是受警报影响的元素数量。 示例可以包括: 调用 API 时迂到 5XX 错误的用户数,返回错误的 Kafka 使用者组数,当前正在装入站点超过 3 秒的 CDN 位置数,或者单个用户尝试登录到云服务控制台的不同密码数。

大多数警报的问题在于它们描述了问题。 但是,要了解问题的严重性或广泛性,用户需要深入数据或依赖于仪表板。

“唯一计数”警报根据所选键中与特定搜索条件匹配的唯一值的数目触发。 即,与搜索匹配的特定键的基数。

比率警报

您可以计算两个日志查询之间的比率,并在比率达到设置的阈值时触发警报。

使用此比率警报来监视:

  • 操作运行状况: 监视传入请求的传出响应数或特定错误代码与错误总数的比率。

  • 市场营销: 监视来自特定区域的流量与区域营销活动之后的总体流量之间的比率。

  • 安全性: 监视来自被阻止网络域的被拒绝请求,特定管理操作或请求与所有请求的比率。

新建值警报

新值警报由时间间隔内首次出现的新值触发。 针对在警报处于活动状态时动态创建的列表测试所有值。 警报由特定查询设置,该查询标识日志的子集 (如果需要),并使用键进行定义,以在所需时间间隔内跟踪新值。

此警报可帮助您自动检测系统中可能的异常行为。

用于此警报类型的示例包括:

  • 安全性: 警报可以由新的域连接触发。 由于 IBM Cloud Logs 安全性会记录所有网络流量中的所有安全信息,因此新的域连接可能导致字段 security.highest_registered_domain 具有新值。 新的域连接可能指向可能的安全攻击。

  • 监视: 可通过新的应用程序错误代码触发警报。 许多应用程序发送 error_code 字段。 此字段的新值可以指示应用程序的新问题。

流警报

流警报设计为在定义的时间范围内按特定顺序发生任何警报事件组合时通知您。

例如,要收到由高 CPU 利用率导致 HTTP 错误率增加的通知,可以将流警报配置为在高 CPU 利用率警报后跟定义的时间范围内的高 HTTP 错误率警报时触发。

以下是使用流警报的一些优点:

  • 全面的数据关联: 通过流警报,您可以关联有关日志,度量和安全事件的警报。 此方法提供系统性能的整体视图,而不是孤立的信息片段。 相关信息可帮助您拥有做出明智决策所需的所有数据。

  • 高级根本原因分析: 可以配置流警报以确定问题的根本原因。 通过定义用于确定问题根本原因的警报,您可以及时响应问题,从而减少系统停机时间并提高操作效率。

  • 减少警报疲劳: 传统监控系统通常会向用户发送冗余警报,从而导致警报疲劳和忽略关键问题的可能性。 流警报可以通过应用有时间限制的有序条件过滤器来减少错误警报。 这意味着在满足所有设置的条件时将向您发出警报,从而减少不必要的通知噪声。

  • 可定制的警报序列: 使用此流警报的唯一功能,您可以使用简单的拖放界面来定义警报序列。 创建仅当按顺序和时间满足所有条件时才会触发的流。

  • 高效故障诊断: 通过在画布上可视化警报序列的功能,故障诊断变得更高效。 您可以轻松识别模式,了解导致警报的事件链,并快速采取行动纠正问题。

  • 优化的资源利用率: 通过减少错误警报并启用根本原因标识,您将节省时间和资源。 通过优化,您的团队可以专注于更战略性的任务,而不是被不断涌现的错误警报所占用。

IBM Cloud Logs 提供了一个流构建器工具,用于直观地组合触发流警报的用户定义的警报,然后将这些警报链接在一起。 流警报的基本构建块是阶段和组。

组表示单个用户定义的警报的逻辑组合。 该组支持 OR,AND 和 NOT 逻辑运算符以组合多个单独的警报。

阶段表示需要在指定时间范围内触发的警报组。 一个阶段中可以存在多个组。

流警报具有以下限制:

  • 流警报必须至少具有 2 个阶段。
  • 流警报的第一阶段只能包含 1 组。
  • 所有阶段的时间范围的持续时间不能超过 36 小时。
  • 最多可以将 30 个警报组合到单个流警报中。
  • 以下流警报警报类型不支持 NOT 逻辑运算符:
    • 新建值警报
    • 唯一计数警报
    • 立即通知
    • 标准警报