메트릭 알림 구성
메트릭 알림은 Event2Metrics 을 사용하여 IBM® Cloud Logs 에서 기록한 메트릭에 대한 계산에 기반한 알림입니다.
메트릭 알림은 IBM Cloud Logs 대시보드에서 특정 메트릭에 대해 미리 정의된 임계값이 충족되거나 초과되면 트리거되는 알림입니다.
메트릭 알림은 인프라 및 기타 메트릭과 관련된 중요한 성능 지표를 모니터링하도록 설계되었습니다. 특정 임계값이나 조건이 초과되면 이러한 알림은 조기 경보 시스템으로 작동하여 즉각적인 주의가 필요한 잠재적 문제를 팀에 알립니다. 예를 들어 클라우드 환경의 서버 CPU 사용률, 응답 시간, 오류율, 리소스 사용률을 모니터링하는 데 도움이 됩니다.
전제조건
- IBM Cloud Logs 의 알림에 대해 알아보세요. 자세한 내용은 알림을 참조하세요.
- Event Notifications 인스턴스가 IBM Cloud Logs 인스턴스와 동일한 계정에 있는지 확인하고, Event Notifications 인스턴스에서 리소스를 구성할 수 있는 권한이 있는지 확인하세요.
- IBM Cloud Logs 인스턴스와 Event Notifications 인스턴스 간의 아웃바운드 통합이 구성되었는지 확인하세요. 자세한 내용은 아웃바운드 통합을 구성하여 연결을 참조하세요.
시작 알림 관리
다음 단계를 완료하십시오.
- 콘솔에서 탐색 메뉴 아이콘
> 리소스 목록을 클릭합니다.
- IBM Cloud Logs의 인스턴스를 선택하십시오.
- IBM Cloud Logs 탐색에서 알림 아이콘
> 알림 관리를 클릭합니다.
- 새 알림을 클릭합니다.
구성할 알림 유형을 선택하세요
다음 단계를 완료하십시오.
-
알림 유형을 선택하세요. 자세한 내용은 알림 유형을 참조하세요.
-
세부 정보 섹션에서 다음 단계를 완료합니다:
-
이름을 입력하십시오.
- 이름의 최대 길이는 4096자입니다.
-
[선택 사항] 설명을 입력합니다.
- 설명의 최대 길이는 4096자입니다.
-
[선택 사항으로] 하나 이상의 레이블을 추가합니다.
라벨은 나중에 빠른 검색을 위해 사용할 수 있는 키:값 쌍입니다.
-
메트릭 쿼리 지정
PromQL, 을 사용하여 IBM® Cloud Logs 인스턴스에 저장된 메트릭에 대한 쿼리를 입력합니다.
PromQL 쿼리를 입력하면 자동 완성 제안이 표시됩니다.
애플리케이션, 하위 시스템, 머신 ID 또는 기타 데이터 등 원하는 값을 사용하여 메트릭을 집계합니다. 예를 들어 모든 애플리케이션에 대해 단일 메트릭으로 총 예외 횟수를 추적하고 새 코드 영역을 나타내는 메트릭 레이블을 추가하고 싶을 수 있습니다. 예외 카운터의 이름이 application_error_count 이고 코드 영역이 x 인 경우 해당 메트릭 레이블을 추가할 수 있습니다.
application_error_count{area="x"}
by 집계 연산자를 사용하여 집계에 사용할 차원(메트릭 레이블)과 알림 알림 그룹을 분할하는 방법을 선택합니다. 예를 들어 sum by(instance) (node_filesystem_size_bytes) 쿼리는 각 인스턴스에 대한 총 node_filesystem_size_bytes 을 반환합니다.
트리거 조건 지정
쿼리에서 반환된 데이터에 대해 평가할 트리거 조건을 지정합니다.
-
Is는 알림을 트리거할 시기를 지정합니다. 예를 들어, 메트릭 쿼리가 평소보다 많이 발생하는 경우입니다.
-
값의 경우 쿼리에서 알림을 트리거할 일치 항목을 반환하는 횟수를 지정합니다.
-
For는 Of에 지정된 시간 동안 쿼리가 일치하는 시간의 백분율을 지정합니다.
데이터에 누락된 값이 있을 수 있습니다. 누락된 값을 0으로 바꾸지 않고 비워두면 보유한 데이터는 100% 데이터로 간주됩니다.
10분의 시간 프레임에 대해 쿼리한다고 가정해 보겠습니다. 6개 데이터 요소에는 값이 있고 4개 데이터 요소에는 값이 없습니다. 누락된 값을 0으로 바꾸지 않은 경우, 값이 있는 6분은 100%의 시간으로 간주됩니다. 이로 인해 잘못된 트리거가 발생할 수 있습니다.
고급 설정에서 누락된 값을 0으로 바꿀 수 있습니다.
고급 설정 에서 '이 알림이 트리거되려면 최소 %의 시간대에 값이 있어야 합니다'의 백분율을 조정하여 알림 트리거의 민감도를 조정할 수 있습니다.
-
백분율 값 설정은 알림을 신뢰할 수 있는 데이터 포인트가 충분하지 않은 경우 알림을 비활성화하도록 설계되었습니다. 데이터 양이 설정된 백분율 미만이면 실제 메트릭 값과 임계값 초과 또는 미달 여부에 관계없이 알림이 트리거되지 않습니다.
-
백분율을 0으로 설정하고 쿼리가 임계값을 한 번 초과하면 알림이 트리거됩니다.
-
백분율을 100으로 설정하면 모든 시간 창 값이 임계값을 넘어야 한다는 의미입니다. 어느 시점에서든 값이 일치하지 않으면 알림이 트리거됩니다.
누락된 값을 0으로 바꾸기를 선택한 경우 백분율 값 설정은 표시되지 않습니다. 누락된 값이 0으로 대체되면 데이터의 100%가 존재한다는 것을 보장합니다.
임계값 미만 조건을 사용하는 경우 감지되지 않은 값을 관리할 수 있는 옵션이 제공됩니다.
감지되지 않은 값은 미만 알림의 순열이 전송을 중단하여 알림이 전송되지 않은 모든 시간대에 대해 여러 번 트리거되는 경우 발생합니다.
감지되지 않은 값이 포함된 알림을 볼 때 이러한 값을 수동으로 삭제하거나 감지되지 않은 값이 자동으로 삭제되는 기간을 선택할 수 있습니다. 감지되지 않은 값에 대한 트리거를 비활성화하여 감지되지 않은 값이 발생하면 즉시 알림 전송을 중지할 수도 있습니다.
이상 징후 탐지 사용자 지정
이상 징후 탐지는 들어오는 메트릭을 분석합니다. IBM Cloud Logs 은 지난 24시간 동안의 데이터를 사용하여 다음 24시간 동안의 예상 행동을 예측합니다. 예측 모델은 예상되는 행동의 상한 및 하한 임계값을 설정하여 이러한 임계값을 경계로 설정합니다. 데이터가 이러한 임계값을 초과하면 알림이 트리거됩니다. 평균 행동과 각 임계값 사이에서 기준선이 계산됩니다. 이 기준선에 대한 편차 비율을 지정하여 알림 트리거의 민감도를 조정할 수 있습니다.
평소보다 많음 또는 평소보다 적 음 조건을 설정할 때 백분율 편차가 해당 백분율만큼 초과될 때만 알림을 보내도록 고급 설정을 구성할 수 있습니다.
예를 들어 기준선이 50이고 상한 임계값이 150이고 편차 백분율이 10%인 경우, 이 값이 155를 초과하는 경우에만 알림이 트리거됩니다.
예제
예를 들어, 특정 값보다 작거나 같거나, 일정 값보다 크거나 같거나, 평소보다 크거나 같을 때 알림을 트리거할지, 최소 임계값을 평소보다 크거나 작을 때 알림을 트리거할지 선택할 수 있습니다. 쿼리가 조건에 설정된 값 또는 임계값을 통과하면 알림이 트리거됩니다.
백분율 (x % 이상) 과 기간 (최근 x분 )을 지정하여 알림이 트리거되는 임계값을 얼마나 초과할지 결정할 수 있습니다. 알림을 트리거하기 위해 값이 필요한 기간의 백분율 (최소 x %) 을 선택합니다.
예를 들어, 알림이 트리거되려면 내 10분 시간 프레임의 50% 이상이 설정된 값이어야 한다고 판단합니다. 10개 데이터 포인트 중 5개 데이터 포인트의 값에 도달하면 50%가 넘지 않으므로 알림을 트리거하기에 충분하지 않습니다. 10개 데이터 포인트 중 6개 데이터 포인트의 값에 도달하면 알림이 트리거됩니다.
그룹 기준에서 값을 집계하고 알림이 트리거되는 시기를 결정할 JSON 필드를 최대 2개까지 구성할 수 있습니다.
-
지정된 시간 내에 집계된 값이 필터링 조건 섹션에 설정된 임계값을 초과하는 경우 알림이 트리거됩니다.
-
지정된 시간 내에 특정 집계 값에 대한 조건 임계값이 충족되면 알림이 트리거됩니다.
-
2개의 값을 구성하는 경우 일치하는 로그는 먼저 상위 필드에 의해 집계된 다음 하위 필드에 의해 집계됩니다. 임계값이 부모와 자식 모두의 고유한 조합을 충족하면 알림이 발생합니다.
알림 세부 정보 구성
다음 단계를 완료하십시오.
-
알림을 구성하여 알림이 트리거되면 얼마나 자주 이벤트를 받을지 정의할 수 있습니다. 기본값은 0시간 10분으로 설정되어 있습니다.
-
이벤트가 해결되면 자동으로 해결을 사용 설정하여 이벤트를 받습니다.
알림의 조건이 더 이상 이벤트를 트리거하지 않게 되면, 처음에 트리거된 이벤트는 ‘해결됨’으로 표시됩니다.
-
팬텀 모드 사용을 사용 설정하여 이 알림이 팬텀 알림임을 표시합니다.
팬텀 알림은 플로우 알림의 빌딩 블록 역할을 합니다.
팬텀 알림은 독립적인 이벤트 알림을 트리거하지 않습니다.
이 옵션을 사용 설정하면 알림 섹션이 알림 정의에서 제거됩니다.
-
통합을 추가합니다.
연동 서비스를 추가하려면 아웃바운드 연동 서비스가 정의되어 있어야 합니다. 자세한 내용은 Event Notifications 서비스와의 연동 구성하기를 참조하세요.
일정 및 포함할 로그 콘텐츠 설정
다음 단계를 완료하십시오.
-
일정 섹션에서 이 알림이 활성화되는 시기를 제어할 일정을 설정합니다. 특정 요일과 시간을 선택할 수 있습니다.
-
알림 내용 섹션에서 트리거되는 이벤트에 샘플 로그 행을 포함할지, 아니면 일부 필드만 포함할지 정의합니다.
알림 알림에 포함할 특정 JSON 키를 선택하거나 알림 메시지에 전체 로그 텍스트를 포함하려면 이 값을 비워둡니다:
-
옵션 1: 알림의 필터링 조건과 일치하는 로그 행 하나를 포함하려면 비워둡니다.
-
옵션 2: 선택한 필드를 키:값 쌍 형식으로 포함하도록 JSON 키를 지정합니다. 필드를 추가하려면 로그 레코드가 JSON 형식이어야 한다는 점에 유의하세요.
이름에
.이 포함된 JSON 키는 선택된 필드로 사용할 수 없습니다. -
옵션 3: 필터로 JSON 경로를 지정합니다.
-
알림이 트리거되면 이벤트에 포함되는 데이터의 양에 제한이 있습니다. 이러한 제한 사항에 대한 자세한 내용은 데이터 크기를 참조하세요.
알림 구성 저장
다음 단계를 완료하십시오.
-
알림을 확인합니다.
확인을 클릭하여 데이터를 평가하여 지난 24시간 동안 알림이 기준과 일치한 횟수를 확인합니다.
확인은 우선순위 인사이트 파이프라인의 데이터만 평가합니다. 분석 및 경보 파이프라인에서 사용 가능한 데이터에 대해 알림이 트리거되도록 구성된 경우에는 이 기능을 사용할 수 없다는 점에 유의하세요.
-
경보 작성을 클릭하십시오.
알림 확인
알림을 트리거합니다. 알림이 트리거되고 처리되면 시스템은 이메일, Slack, SMS 또는 통합 인시던트 관리 플랫폼과 같은 다양한 채널을 통해 지정된 사용자 또는 팀에게 알림을 보냅니다. 그런 다음 인시던트 페이지로 이동하여 트리거된 알림에 대한 정보를 볼 수 있습니다. 자세한 내용은 IBM Cloud Logs 트리거된 알림 관리하기를 참조하세요.
동적 알림 제한
동적 알림은 평소보다 많거나 평소보다 적은 조건의 알림입니다. 각 동적 알림에는 500개의 순열이 할당되며 IBM Cloud Logs 인스턴스에는 최대 10,000개의 순열이 허용됩니다.
순열 제한은 IBM Cloud Logs 인스턴스에 대해 최대 20개의 동적 알림을 구성할 수 있다는 의미입니다.
동적 알림 한도인 20개에 도달한 후에도 다른 비동적 알림을 만들 수 있습니다.