Event Streams에 대한 고가용성 및 재해 복구 이해

고가용성(HA)서비스 또는 작업 부하가 장애를 견디고 사전 정의된 서비스 수준에 따라 처리 기능을 계속 제공할 수 있는 능력. 서비스의 경우, 가용성은 서비스 수준 협약에 정의되어 있습니다. 가용성에는 유지보수, 고장, 재해 등 계획된 이벤트와 계획되지 않은 이벤트가 모두 포함됩니다. 은 예기치 못한 장애가 발생했을 때 서비스가 계속 운영되고 액세스할 수 있는 기능입니다. 재해 복구는서비스 중단과 같은 드물지만 심각한 사고와 광범위한 장애로부터 복구할 수 있는 서비스 또는 작업량 능력. 여기에는 전체 지역에 영향을 미치는 물리적 재해, 데이터베이스 손상, 또는 작업 부하에 기여하는 서비스의 손실이 포함됩니다. 이 영향은 고가용성 설계가 처리할 수 있는 능력을 초과합니다. 서비스 인스턴스를 작동 상태로 복구하는 프로세스입니다.

IBM® Event Streams for IBM Cloud® 은 글로벌 서비스이며, 사용 가능한 지역과 데이터 센터 위치는 서비스 및 인프라 가용성 위치별 설명서에서 확인할 수 있습니다. 글로벌 서비스 Event Streams 스탠다드 및 엔터프라이즈 플랜을 통해 정의된 서비스 수준 목표(SLO)를 충족합니다. SLO는 보증이 아니며 IBM® 에서는 목표를 달성하지 못한 경우 크레딧을 발급하지 않습니다.

고가용성 아키텍처

아키텍처
Event Streams 고가용성 아키텍처

높은 가용성 기능

Event Streams 다음과 같은 고가용성 기능을 지원합니다

HA 기능 Event Streams
기능 설명 고려사항
다중 구역 지역 재배치 내결함성과 고가용성을 위해 3개의 가용성 영역에 분산 Event Streams 각 파티션 데이터는 가용성 영역(MZR 배포의 경우) 3곳에 분산되어 가용성 영역 데이터가 손실되는 경우 비즈니스 연속성을 보장합니다.
최소 동기화 복제본 항상 최소 두 개의 동기화 복제본이 필요합니다 Event Streams 브로커 또는 존 장애 발생 시 메시지가 손실되지 않도록 가용성 범위에서 최소 두 개의 복제본이 동기화되도록 지속적으로 모니터링하고 확인하여 중요한 데이터가 지속 가능하도록 유지합니다.

재해 복구 아키텍처

아키텍처
Event Streams 재해 복구 아키텍처

재해 복구 기능

Event Streams 다음과 같은 재해 복구 기능을 지원합니다

DR 기능 Event Streams
기능 설명 고려사항
미러링 클러스터 복제를 위한 미러링 Event Streams Event Streams 메시지를 다른 인스턴스로 계속 복사할 수 있는 미러링 기능을 제공합니다. Event Streams 미러링 기능을 사용하거나, 자체 미러링 솔루션을 관리하도록 선택할 수 있습니다.

Event Streams 에 대한 미러링

미러링을 사용하면 Event Streams 인스턴스 중 하나의 메시지가 두 번째 인스턴스로 계속 복사됩니다. 미러링을 사용하면 애플리케이션의 복원력을 향상시킬 수 있습니다. 따라서 첫 번째 서비스 인스턴스를 사용할 수 없게 되면 애플리케이션이 두 번째 인스턴스에 다시 연결하여 정상적인 작동을 계속할 수 있습니다.

이 기능은 완전 관리형 서비스의 일부이며, Event Streams 사용하는 서비스 인스턴스 간에서만 사용할 수 있습니다.

  1. 미러링의 특징:
  • 두 개의 Event Streams 인스턴스 간의 주제, 메시지 데이터, 소비자 그룹 오프셋을 미러링합니다. 이 서비스 인스턴스는 서로 다른 IBM Cloud® 계정에서 프로비저닝될 수 있습니다.
  • Event Streams 와 일치하는 99.99 가용성의 SLA.
  • IBM Cloud® Monitoring 사용하여 모니터링할 수 있습니다.
  1. 미러링의 한계:
  • 단방향: 데이터는 한 쌍의 서비스 인스턴스 사이에서 한 번에 한 방향으로만 미러링될 수 있습니다. 즉, 미러링은 "능동-수동" 방식의 고가용성을 제공하며, "능동-능동" 방식은 제공하지 않습니다.
  • 비동기: 대상 인스턴스에 메시지를 미러링하기 전에 소스 인스턴스에 메시지를 성공적으로 생성해야 합니다. 이는 실패가 발생하면 일부 메시지 데이터가 손실될 수 있음을 의미합니다.
  • 최소 한 번 메시지 소비: 소비자가 인스턴스 간에 이동할 때, 이미 처리한 메시지를 다시 처리해야 할 수 있습니다.

재해 복구 계획

재해 복구 단계는 정기적으로 실행해야 합니다. 계획 수립 시, 다음과 같은 실패 시나리오와 해결책을 고려하십시오.

Event Streams 재해 복구 시나리오
실패 분석
하드웨어 고장(단일 지점) Event Streams 구역 내의 단일 하드웨어 장애에 대해 복원력이 있습니다 - 별도의 설정이 필요하지 않습니다.
구역 장애 다중 구역 지역에 배포된 Event Streams 단일 구역의 장애에 대해 복원력이 있습니다 - 별도의 설정이 필요하지 않습니다. 단일 구역 배포의 경우, 구역 장애를 완화하기 위해 다른 Event Streams 클러스터를 미러링된 쌍으로 설정하십시오.
데이터 손상 Event Streams 에는 데이터 손상 복구 기능이 내장되어 있지 않습니다. 이러한 상황에 대비한 계획을 재해 복구 계획의 일부로 세울 필요가 있으며, 미러링 기능을 사용하거나 새로운 인스턴스를 구성해야 할 수도 있습니다.
지역적 실패 다중 영역 지역에서 Event Streams 인스턴스를 구성한 경우 지역 재해가 발생할 가능성은 낮습니다. 지역적 장애가 발생하면 다른 지역에 새로운 인스턴스를 구성해야 합니다. 자세한 내용은 회원님의 책임 이해하기를 참조하세요.

HA 및 DR에 대한 귀하의 책임

다음 정보는 HA 및 DR 계획을 수립하고 지속적으로 실행하는 데 도움이 될 수 있습니다.

Event Streams 사용할 때의 관리 책임과 이용 약관을 이해하는 것이 중요합니다. 고객 책임 페이지는 고가용성 및 재해 복구 계획을 세우는 출발점으로 도움이 됩니다.

재해 복구의 일환으로, 사용자와 프로세스에 IAM 역할과 작업을 부여할 때 업무 수행에 필요한 최소한의 권한을 부여하는 것이 좋습니다. 자세한 내용은 서비스의 실수로 인한 삭제를 방지하는 방법을 참고하세요.

모든 Event Streams 계획 Satellite 제외)은 삭제된 인스턴스를 3일 이내에 복구할 수 있으며, 그 이후에는 데이터가 복구 불가능하게 파괴됩니다. IBM Cloud 사용하여 매립 상태를 확인하고, 예정된 매립을 강제하거나 취소할 수 있습니다.

Event Streams 서비스 인스턴스를 복구할 수 없는 경우, 재해 복구 시나리오의 미러링 에 설명된 대로 복구해야 합니다.

IBM 서비스를 유지하는 방법

모든 업그레이드는 IBM 서비스 모범 사례를 따르며 복구 계획과 롤백 프로세스가 준비되어 있습니다. 새로운 기능과 유지보수를 위한 정기적인 업그레이드는 정상적인 운영의 일부로 이루어집니다. 이러한 유지보수는 간혹 짧은 중단 간격을 유발할 수 있으며, 이는 클라이언트 가용성 재시도 로직 에 의해 처리됩니다. 변경 사항은 지역별로, 지역 내의 구역별로 순차적으로 적용됩니다. 결함이 발견되는 즉시 업데이트가 취소됩니다.

복잡한 변경 사항은 노출을 제어하는 기능 플래그를 통해 활성화 및 비활성화됩니다.

고객의 작업량에 영향을 미치는 변경 사항은 알림에 자세히 설명되어 있습니다. 더 자세한 정보를 원하시면, Event Streams 에 영향을 미치는 유지보수 계획, 공지사항, 릴리즈 노트 에 대한 알림과 상태를 모니터링하는 방법을 참고하세요.