경보

IBM Cloud Logs 경보를 사용하면 이상 항목, 사전 예방적 인시던트 응답, 개선된 평균 해결 시간 (MTTR), 수동 모니터링 노력 감소, 사용자 정의 및 유연성을 적시에 발견할 수 있습니다. 머신 러닝으로 구동되는 경보는 팀에 잠재적인 문제점을 사전에 알리고 인시던트를 상관시키며 근본 원인 분석을 제공합니다.

경보 작동 방식

경보는 생성되고 트리거되어 사용자에게 전달되는 방법에 대한 일반 워크플로우를 따릅니다.

Alerting in IBM Cloud Logs
Alerting in IBM Cloud Logs

  1. 경보 규칙 설정

    관리자, 개발자 또는 DevOps 는 관찰 가능성 플랫폼 내에서 경보 규칙을 정의합니다. 이러한 규칙은 경보가 트리거되는 조건을 지정합니다. 예를 들어, 특정 오류 메시지가 로그에 표시될 때 경보하도록 규칙을 설정할 수 있습니다.

  2. 데이터 콜렉션 및 분석

    IBM Cloud Logs 은 로그 및 메트릭을 포함하여 시스템에서 지속적으로 데이터를 수집합니다. 정의된 경보 규칙에 대해 이 데이터를 처리하고 분석합니다.

  3. 경보 트리거

    모니터된 데이터가 경보 규칙에 지정된 조건을 충족하면 경보가 트리거됩니다. 트리거는 오류 비율의 갑작스런 급증, 높은 대기 시간, 낮은 자원 가용성 또는 기타 사전정의된 이상 항목의 결과일 수 있습니다.

  4. 경보 집계 및 중복 제거

    경보 시스템은 여러 개의 유사한 경보를 단일 알림으로 집계하여 중복 알림을 사용하는 압도적인 사용자를 방지할 수 있습니다. 또한 사용자에게 반복적인 정보를 보내지 않도록 경보를 중복 제거할 수 있습니다.

  5. 알림 및 에스컬레이션

    경보가 트리거되고 처리되면 시스템은 지정된 사용자 또는 팀에 알림을 전송합니다. 알림은 이메일, Slack, SMS 또는 통합 인시던트 관리 플랫폼과 같은 다양한 채널을 통해 전달될 수 있습니다. 상황이 해결되지 않은 상태로 남아 있는 경우 경보를 상위 레벨 팀 또는 개인에게 에스컬레이트할 수 있습니다.

  6. 경보 분석 및 수신확인

    경보 수신자는 경보를 수신확인하고 적절한 조치를 수행하여 문제를 해결합니다. 문제점이 해결되면 경보를 "완료" 로 표시합니다.

  7. 모니터링 및 보고

    경보 프로세스 전체에서 IBM Cloud Logs 은 시스템의 상태를 지속적으로 모니터합니다. 수신확인 상태, 분석 시간 및 기타 메트릭을 추적하여 보고서를 생성하고 사후 인시던트 분석 및 개선을 지원할 수 있습니다.

경보 유형

IBM Cloud Logs 은 구성할 수 있는 6가지유형의 경보를 제공합니다.

알림을 구성하는 방법에 대한 자세한 내용은 알림 아이콘 알림 구성하기를 참조하세요.

표준 경보

표준 경보는 로그에 대한 변경사항으로 트리거되는 경보입니다. 특정 로그의 설정된 수량 임계값을 교차하여 트리거되는 이 기능을 사용하면 시스템 성능을 모니터하고 변경 발생 시 알림을 받으며 잠재적인 원인을 파악할 수 있습니다. 이러한 경보는 특정 인시던트의 발생 수를 측정할 때 유용합니다.

표준 경보 기능을 사용하여 다음을 수행할 수 있습니다.

  • 실시간으로 시스템 성능을 모니터합니다. 선택한 기준을 기반으로 실시간 인사이트를 확보합니다.

  • 특정 요구에 맞게 조회를 구성하십시오. 검사할 로그를 캡처하는 조회를 정의하고 애플리케이션, 서브시스템 및 심각도별로 필터링하여 조회를 보다 구체적으로 작성하십시오. 그런 다음 경보를 트리거할 조건의 범위를 선택하십시오. 예를 들어, 특정 시간 프레임 동안 10개가 넘는 로그가 수신될 때 경보를 트리거하도록 설정할 수 있습니다.

  • 기계 학습 기반 접근 방식을 사용하십시오. 이 설정을 사용하여 IBM Cloud Logs 은 데이터를 프로파일링하고 비정상 동작을 자동으로 발견합니다.

  • 개인화된 알림을 수신합니다. 선호하는 통신 채널에 대한 실시간 푸시 알림을 수신합니다.

표준 경보는 IBM Cloud Logs에서 제공하는 가장 단순한 경보입니다. 이러한 유스 케이스는 관찰 가능성 시스템의 기초로 가장 명확한 유스 케이스를 다루는 데 사용할 수 있습니다.

시간 상대 경보

시간 관련 경보를 사용하여 시스템에서 비정상 작동을 자동으로 발견합니다. 고정 비율이 이전 시간 프레임과 비교하여 설정된 임계값에 도달하면 경보가 트리거됩니다.

시간 상대 경보를 사용하여 다음을 수행하십시오.

  • 시간 경과에 따른 시스템의 보안, 운영 또는 비즈니스 동작의 변경사항에 대한 자동 경보를 수신합니다.

  • 서로 다른 기간 동안의 동작을 비교합니다. 예를 들면 다음과 같습니다.

    보안
    의심스러운 동작을 비교하는 자동 경보를 수신합니다. 예를 들어, 며칠 또는 몇 주 동안 NX 도메인 이름 응답 또는 관리 로그인 수를 비교하십시오.
    조작
    애플리케이션에서 오류 비율 및 페이지 로드 시간에 대한 자동 경보를 수신합니다. 예를 들어, 지난 하루 또는 한 시간 동안의 오류 비율 및 페이지 로드 시간을 비교하십시오.
    Business
    영업 교대 또는 사용자 서명이 발생하면 자동 경보를 수신합니다. 예를 들어, 지난 주 같은 날에 구매한 수를 비교하거나 지난 달에 사용자가 사인인합니다.

고유 개수 경보

데이터 볼륨이 증가하고 로그, 지표 및 보안 시스템에서 생성되는 경보의 수가 기하급수적으로 증가함에 따라 경보 중요도의 가장 강력한 지표 중 하나는 경보의 영향을 받는 요소의 수입니다. 예를 들어, API를 호출할 때 5XX 오류가 발생한 사용자 수, 오류를 리턴한 Kafka 이용자 그룹 수, 3초이상 현재 사이트를 로드 중인 CDN 위치 수 또는 단일 사용자가 클라우드 서비스 콘솔에 로그인하려고 시도하는 서로 다른 비밀번호의 수를 포함할 수 있습니다.

대부분의 경보에 대한 문제점은 문제점을 설명하는 것입니다. 그러나 문제의 심각도나 범위를 이해하려면 사용자가 데이터를 자세히 살펴보거나 대시보드에 의존해야 합니다.

고유 계수 경보는 특정 검색 기준과 일치하는 선택된 키 내의 고유 값 수를 트리거합니다. 즉, 검색과 일치하는 특정 키의 카디널리티입니다.

비율 경보

두 로그 조회 사이의 비율을 계산하고 비율이 설정된 임계값에 도달하면 경보를 트리거할 수 있습니다.

모니터하려면 이 비율 경보를 사용하십시오.

  • 운영 상태: 수신 요청에 대한 발신 응답 수 또는 전체 오류 수에 대한 특정 오류 코드의 비율을 모니터하십시오.

  • 마케팅: 특정 지역의 트래픽과 지역 캠페인을 따르는 전체 트래픽 간의 비율을 모니터합니다.

  • 보안: 모든 요청과 비교하여 거부된 요청, 특정 관리 조작 또는 차단된 네트워크 도메인에서 시작된 요청의 비율을 모니터합니다.

새 값 경보

새 값 경보는 시간 간격 내에서 새 값의 첫 번째 발생에 의해 트리거됩니다. 모든 값은 경보가 활성 상태인 동안 동적으로 작성되는 목록에 대해 테스트됩니다. 경보는 로그의 서브세트를 식별하는 특정 조회에 의해 설정되며 (필요한 경우), 원하는 간격 내에서 새 값을 추적하기 위한 키로 정의됩니다.

이 경보는 시스템 내에서 가능한 비정상 작동을 자동으로 발견하는 데 도움이 될 수 있습니다.

이 경보 유형의 사용 예는 다음과 같습니다.

  • 보안: 경보는 새 도메인 연결에 의해 트리거될 수 있습니다. IBM Cloud Logs 보안이 모든 네트워크 트래픽에서 모든 보안 정보를 로깅하므로 새 도메인 연결은 security.highest_registered_domain 필드가 새 값을 갖는 결과를 가져올 수 있습니다. 새 도메인 연결은 가능한 보안 공격을 가리킬 수 있습니다.

  • 모니터링: 새 애플리케이션 오류 코드로 경보를 트리거할 수 있습니다. 많은 애플리케이션이 error_code 필드를 전송합니다. 이 필드의 새 값은 애플리케이션의 새 문제를 표시할 수 있습니다.

플로우 경보

플로우 경보는 정의된 시간 프레임 내에서 특정 순서로 경보 이벤트 조합이 발생할 때 사용자에게 알리도록 설계되었습니다.

예를 들어, 높은 CPU 이용률로 인한 HTTP 오류 비율의 증가를 알리기 위해 정의된 시간 프레임 내에서 높은 CPU 이용률 경보 다음에 높은 HTTP 오류 비율 경보가 올 때 트리거하도록 플로우 경보를 구성할 수 있습니다.

다음은 플로우 경보 사용의 몇 가지 이점입니다.

  • 포괄적인 데이터 상관: 플로우 경보를 사용하여 로그, 메트릭 및 보안 이벤트에 대한 경보를 상관시킬 수 있습니다. 이 접근 방식은 분리된 정보가 아니라 시스템의 성능에 대한 전체적인 보기를 제공합니다. 상관 정보는 정보에 입각한 의사결정을 내리는 데 필요한 모든 데이터를 보유하는 데 도움이 됩니다.

  • 고급 근본 원인 분석: 문제의 근본 원인을 식별하도록 플로우 경보를 구성할 수 있습니다. 문제의 근본 원인을 정확하게 나타내는 경보를 정의하는 기능을 사용하여 문제에 신속하게 대응하여 시스템 중단 시간을 줄이고 운영 효율성을 향상시킬 수 있습니다.

  • 경보 피로도 감소: 일반적인 모니터링 시스템은 종종 사용자에게 중복 경보를 제공하여 경보 피로도 및 중요한 문제를 간과할 수 있는 가능성을 초래합니다. 플로우 경보는 정렬된 시간 제한 기준 필터를 적용하여 거짓 경보를 줄일 수 있습니다. 이는 모든 설정된 조건이 충족되면 불필요한 알림 노이즈를 줄이는 경보를 받음을 의미합니다.

  • 사용자 정의할 수 있는 경보 시퀀스: 이 플로우 경보를 사용하면 단순한 끌어서 놓기 인터페이스를 사용하여 경보 시퀀스를 정의할 수 있는 고유한 기능을 사용할 수 있습니다. 모든 기준이 순서 및 시간별로 충족되는 경우에만 트리거되는 플로우를 작성하십시오.

  • 효율적인 문제점 해결: 캔버스에서 경보 시퀀스를 시각화하는 기능을 사용하면 문제점 해결이 보다 효율적으로 수행됩니다. 패턴을 쉽게 식별하고, 경보를 발생시키는 이벤트 체인을 이해하고, 문제를 수정하기 위해 신속하게 조치를 취할 수 있습니다.

  • 최적화된 자원 활용: 거짓 경보를 줄이고 근본 원인 식별을 사용하여 시간과 자원을 절약할 수 있습니다. 최적화를 통해 팀은 지속적인 거짓 경보 스트림을 사용하지 않고 보다 전략적인 태스크에 집중할 수 있습니다.

IBM Cloud Logs 은 플로우 경보를 트리거하는 사용자 정의 경보를 시각적으로 결합한 후 함께 연결하는 플로우 빌더 도구를 제공합니다. 플로우 경보의 기본 빌딩 블록은 스테이지 및 그룹입니다.

그룹은 개별 사용자 정의 경보의 논리적 조합을 나타냅니다. 그룹은 여러 개의 개별 경보를 결합하기 위해 OR, AND및 NOT 논리 연산자를 지원합니다.

스테이지는 지정된 시간 프레임 내에서 트리거해야 하는 경보 그룹을 나타냅니다. 스테이지에 여러 그룹이 있을 수 있습니다.

플로우 경보에는 다음과 같은 제한사항이 있습니다.

  • 플로우 경보에는 최소 두 개의 단계가 있어야 합니다.
  • 플로우 경보의 첫 번째 단계에는 하나의 그룹만 포함될 수 있습니다.
  • 모든 단계에서 시간 프레임의 지속 기간은 36시간을 초과할 수 없습니다.
  • 최대 30개의 경보를 단일 플로우 경보로 결합할 수 있습니다.
  • 다음 플로우 경보 경보 유형은 NOT 논리 연산자를 지원하지 않습니다.
    • 새 값 경보
    • 고유 개수 경보
    • 즉시 알림
    • 표준 경보