경보 및 이벤트에 대한 작업
IBM Cloud Monitoring 서비스에서는 단일 경보 및 다중 조건 경보를 구성하여 주의가 필요할 수 있는 문제점에 대해 알릴 수 있습니다. 경보가 트리거되면 하나 이상의 알림 채널을 통해 알림을 받을 수 있습니다. 경보 정의는 다중 채널 알림을 생성할 수 있습니다.
경보는 주의를 요하는 상황에 대해 경고하는 데 사용할 수 있는 알림 이벤트입니다. 각 경보에는 심각도 상태가 있습니다. 이 상태는 보고되는 정보의 심각도에 대해 알려줍니다.
경보를 정의할 때 알림을 트리거하는 조건 및 알림을 받을 하나 이상의 알림 채널을 정의해야 합니다. 또한 경보의 심각도 및 경보의 유형도 정의해야 합니다. 경보를 구성하는 방법에 대한 자세한 정보는 경보 구성의 내용을 참조하십시오.
기본적으로 심각도는 경고로 설정됩니다. 경보의 심각도를 다음 값으로 설정할 수 있습니다. 긴급, 경보, 심각, 오류, 경고, 알림, 정보, 디버그*
모니터하려는 이벤트 또는 문제를 알리기 위해 단일 메트릭 또는 메트릭 세트에 대한 경보를 정의할 수 있습니다.
- 단일 조건 경보를 정의할 수 있습니다.
- 다중 조건 경보를 정의할 수 있습니다. 경보 임계값은 복합 조건을 사용하여 구성됩니다.
- 데이터 집계 방식을 정의할 수 있습니다.
- 부울 로직을 사용하여 여러 메트릭에 대해 보고하는 경보를 정의할 수 있습니다.
- 경보 조건이 충족되면 알림을 받게 됩니다.
- 경보별로 다중 알림 채널을 구성할 수 있습니다.
- 경보는 수신 후 1분 이내에 실행되며 트리거 대기 시간을 시간별 또는 일별로 구성할 수 있는 옵션이 있습니다.
- PromQL 경보의 경우에만 선택적으로 0분 대기 시간을 구성할 수 있습니다.
웹 UI 및 IBM Cloud Monitoring API에서 사전 정의된 경보를 사용으로 설정하고 경보를 수정하며 사용자 정의 경보를 작성할 수 있습니다.
사용자는 웹 UI의 경보 보기에서 경보를 관리합니다. 또한 경보 보기에 표시되는 테이블 열을 구성할 수 있습니다. 유효한 열 옵션은 이름, 범위, 알림 시기, 세그먼트 기준, 알림, 사용, 수정, 캡처, 채널, 생성됨, 설명, 이메일 수신자, 최소한, OpsGenie, PagerDuty, 심각도, Slack, WebHook, 유형 및 VictorOps.
경보 유형
IBM Cloud Monitoring 서비스에는 사용으로 설정할 수 있는 사전 정의된 경보가 포함되어 있습니다. 또한 대시보드의 패널, REST API 또는 웹 UI의 경보 섹션에서 사용자 정의 경보를 구성할 수 있습니다.
IBM Cloud Monitoring 서비스에서는 다음 유형의 경보를 정의할 수 있습니다.
-
작동 중단: 이 유형의 경보는 소스를 모니터하여 소스(예: 베어메탈)가 작동 중단될 경우 경보를 전송합니다.
-
메트릭: 이 유형의 경보는 time-series 메트릭을 모니터하여 이 메트릭이 정의된 임계값에 도달할 경우 경보를 전송합니다.
-
PromQL: 이 유형의 메트릭은 PromQL 조회를 사용하여 메트릭을 모니터합니다.
-
이벤트: 이 유형의 경보는 특정 이벤트의 발생을 모니터하여 해당 이벤트가 정의된 임계값에 도달할 경우 경보를 전송합니다. 예를 들어 이 경보를 사용하여 많은 무단 액세스 요청이 보고되는 시기를 모니터할 수 있습니다.
-
이상 항목 발견: 이 유형의 경보는 동작 히스토리를 기준으로 호스트를 모니터하여 호스트가 예상 패턴에서 벗어날 경우 경보를 전송합니다.
이 유형의 알림은 더 이상 사용되지 않습니다. 이 유형의 기존 알림만 관리할 수 있습니다.
-
그룹 아웃라이어(outlier): 이 유형의 경보는 호스트를 모니터하여 1이 나머지와 다르게 작동할 경우 사용자에게 알립니다.
이 유형의 알림은 더 이상 사용되지 않습니다. 이 유형의 기존 알림만 관리할 수 있습니다.
알림 채널
알림 채널은 경보가 트리거될 때 정보를 수신할 위치를 정의합니다.
경보를 구성할 때 하나 이상의 알림 채널을 지정할 수 있습니다.
기본적으로 경보가 트리거되면 이벤트 섹션에서 알림을 받게 됩니다.
다음 알림 채널을 구성할 수 있습니다.
- 이메일
- IBM Event Notifications
- Microsoft Teams
- OpsGenie
- PagerDuty
- Slack
- 팀 이메일
- VictorOps
- WebHook
이벤트
이벤트는 Monitoring 인스턴스에 데이터를 전달하는 노드에서 발생하는 사항에 대해 알리는 알림입니다. 이벤트를 사용하여 문제를 검토, 추적 및 해결할 수 있습니다.
다음 목록에는 여러 가지 유형의 이벤트가 설명되어 있습니다.
- 경보 이벤트는 사용자 구성된 경보에 의해 트리거되는 이벤트입니다.
- 인프라 기반 이벤트는 Docker 및 Kubernetes 노드에서 수집된 이벤트입니다. 기본적으로 모니터링 에이전트는 선택한 이벤트 그룹에서 데이터를 자동으로 검색하고 수집합니다. 에이전트 구성 파일을 편집하여 추가 이벤트를 사용으로 설정할 수 있습니다.
- Slackbot, 사전 빌드된 Python 스크립트, 사용자 정의 사용자 작성된 Python 스크립트 또는 cURL 요청 등의 통합을 통해 구성하는 사용자 정의 이벤트.
기본적으로 이벤트의 상태는 다음과 같습니다.
- 활성: 이 상태는 이벤트를 트리거한 상황이 계속 유지됨을 표시합니다(예: 노드가 계속 작동 중지 상태임).
- 정상: 이 상태는 상황이 다시 정상으로 돌아왔음을 표시합니다(예: 노드가 시작되어 실행 중임).
웹 UI의 이벤트 섹션에서 이벤트를 관리할 수 있습니다.
- 경보 이벤트 탭을 통해 경보 이벤트를 볼 수 있습니다.
- 사용자 정의 이벤트 탭을 통해 인프라 기반 이벤트를 볼 수 있습니다.
- 사용자 정의 이벤트 탭을 통해 사용자 정의 이벤트를 볼 수 있습니다.
- 팀에 대한 API 토큰을 사용하여 해당 팀에 사용자 정의 이벤트를 전송할 수 있습니다. 자세한 내용은 다음을 참조하세요.맞춤 이벤트).
- 상태가 정상으로 설정될 때까지 대기하는 대신 이벤트를 해결됨으로 설정하여 다른 사용자에게 문제가 해결되었음을 알릴 수 있습니다.