경보 및 이벤트에 대한 작업

IBM Cloud Monitoring 서비스에서는 단일 경보 및 다중 조건 경보를 구성하여 주의가 필요할 수 있는 문제점에 대해 알릴 수 있습니다. 경보가 트리거되면 하나 이상의 알림 채널을 통해 알림을 받을 수 있습니다. 경보 정의는 다중 채널 알림을 생성할 수 있습니다.

경보는 주의를 요하는 상황에 대해 경고하는 데 사용할 수 있는 알림 이벤트입니다. 각 경보에는 심각도 상태가 있습니다. 이 상태는 보고되는 정보의 심각도에 대해 알려줍니다.

경보를 정의할 때 알림을 트리거하는 조건 및 알림을 받을 하나 이상의 알림 채널을 정의해야 합니다. 또한 경보의 심각도 및 경보의 유형도 정의해야 합니다. 경보를 구성하는 방법에 대한 자세한 정보는 경보 구성의 내용을 참조하십시오.

기본적으로 심각도는 경고로 설정됩니다. 경보의 심각도를 다음 값으로 설정할 수 있습니다. 긴급, 경보, 심각, 오류, 경고, 알림, 정보, 디버그*

모니터하려는 이벤트 또는 문제를 알리기 위해 단일 메트릭 또는 메트릭 세트에 대한 경보를 정의할 수 있습니다.

  • 단일 조건 경보를 정의할 수 있습니다.
  • 다중 조건 경보를 정의할 수 있습니다. 경보 임계값은 복합 조건을 사용하여 구성됩니다.
  • 데이터 집계 방식을 정의할 수 있습니다.
  • 부울 로직을 사용하여 여러 메트릭에 대해 보고하는 경보를 정의할 수 있습니다.
  • 경보 조건이 충족되면 알림을 받게 됩니다.
  • 경보별로 다중 알림 채널을 구성할 수 있습니다.
  • 경보는 수신 후 1분 이내에 실행되며 트리거 대기 시간을 시간별 또는 일별로 구성할 수 있는 옵션이 있습니다.
  • PromQL 경보의 경우에만 선택적으로 0분 대기 시간을 구성할 수 있습니다.

웹 UI 및 IBM Cloud Monitoring API에서 사전 정의된 경보를 사용으로 설정하고 경보를 수정하며 사용자 정의 경보를 작성할 수 있습니다.

사용자는 웹 UI의 경보 보기에서 경보를 관리합니다. 또한 경보 보기에 표시되는 테이블 열을 구성할 수 있습니다. 유효한 열 옵션은 이름, 범위, 알림 시기, 세그먼트 기준, 알림, 사용, 수정, 캡처, 채널, 생성됨, 설명, 이메일 수신자, 최소한, OpsGenie, PagerDuty, 심각도, Slack, WebHook, 유형VictorOps.

경보 유형

IBM Cloud Monitoring 서비스에는 사용으로 설정할 수 있는 사전 정의된 경보가 포함되어 있습니다. 또한 대시보드의 패널, REST API 또는 웹 UI의 경보 섹션에서 사용자 정의 경보를 구성할 수 있습니다.

IBM Cloud Monitoring 서비스에서는 다음 유형의 경보를 정의할 수 있습니다.

  • 작동 중단: 이 유형의 경보는 소스를 모니터하여 소스(예: 베어메탈)가 작동 중단될 경우 경보를 전송합니다.

  • 메트릭: 이 유형의 경보는 time-series 메트릭을 모니터하여 이 메트릭이 정의된 임계값에 도달할 경우 경보를 전송합니다.

  • PromQL: 이 유형의 메트릭은 PromQL 조회를 사용하여 메트릭을 모니터합니다.

  • 이벤트: 이 유형의 경보는 특정 이벤트의 발생을 모니터하여 해당 이벤트가 정의된 임계값에 도달할 경우 경보를 전송합니다. 예를 들어 이 경보를 사용하여 많은 무단 액세스 요청이 보고되는 시기를 모니터할 수 있습니다.

  • 이상 항목 발견: 이 유형의 경보는 동작 히스토리를 기준으로 호스트를 모니터하여 호스트가 예상 패턴에서 벗어날 경우 경보를 전송합니다.

    이 유형의 알림은 더 이상 사용되지 않습니다. 이 유형의 기존 알림만 관리할 수 있습니다.

  • 그룹 아웃라이어(outlier): 이 유형의 경보는 호스트를 모니터하여 1이 나머지와 다르게 작동할 경우 사용자에게 알립니다.

    이 유형의 알림은 더 이상 사용되지 않습니다. 이 유형의 기존 알림만 관리할 수 있습니다.

알림 채널

알림 채널은 경보가 트리거될 때 정보를 수신할 위치를 정의합니다.

경보를 구성할 때 하나 이상의 알림 채널을 지정할 수 있습니다.

기본적으로 경보가 트리거되면 이벤트 섹션에서 알림을 받게 됩니다.

다음 알림 채널을 구성할 수 있습니다.

  • 이메일
  • IBM Event Notifications
  • Microsoft Teams
  • OpsGenie
  • PagerDuty
  • Slack
  • 팀 이메일
  • VictorOps
  • WebHook

이벤트

이벤트는 Monitoring 인스턴스에 데이터를 전달하는 노드에서 발생하는 사항에 대해 알리는 알림입니다. 이벤트를 사용하여 문제를 검토, 추적 및 해결할 수 있습니다.

다음 목록에는 여러 가지 유형의 이벤트가 설명되어 있습니다.

  • 경보 이벤트는 사용자 구성된 경보에 의해 트리거되는 이벤트입니다.
  • 인프라 기반 이벤트는 Docker 및 Kubernetes 노드에서 수집된 이벤트입니다. 기본적으로 모니터링 에이전트는 선택한 이벤트 그룹에서 데이터를 자동으로 검색하고 수집합니다. 에이전트 구성 파일을 편집하여 추가 이벤트를 사용으로 설정할 수 있습니다.
  • Slackbot, 사전 빌드된 Python 스크립트, 사용자 정의 사용자 작성된 Python 스크립트 또는 cURL 요청 등의 통합을 통해 구성하는 사용자 정의 이벤트.

기본적으로 이벤트의 상태는 다음과 같습니다.

  • 활성: 이 상태는 이벤트를 트리거한 상황이 계속 유지됨을 표시합니다(예: 노드가 계속 작동 중지 상태임).
  • 정상: 이 상태는 상황이 다시 정상으로 돌아왔음을 표시합니다(예: 노드가 시작되어 실행 중임).

웹 UI의 이벤트 섹션에서 이벤트를 관리할 수 있습니다.

  • 경보 이벤트 탭을 통해 경보 이벤트를 볼 수 있습니다.
  • 사용자 정의 이벤트 탭을 통해 인프라 기반 이벤트를 볼 수 있습니다.
  • 사용자 정의 이벤트 탭을 통해 사용자 정의 이벤트를 볼 수 있습니다.
  • 팀에 대한 API 토큰을 사용하여 해당 팀에 사용자 정의 이벤트를 전송할 수 있습니다. 자세한 내용은 다음을 참조하세요.맞춤 이벤트).
  • 상태가 정상으로 설정될 때까지 대기하는 대신 이벤트를 해결됨으로 설정하여 다른 사용자에게 문제가 해결되었음을 알릴 수 있습니다.