고가용성 및 재해 복구(HADR)

IBM® watsonx.data ( IBM Cloud )의 고가용성(HA) 및 재해 복구(DR)는 복원력, 가동 중단 시간 최소화 및 데이터 보호를 보장하도록 설계되었습니다.

고가용성(HA)

IBM® watsonx.data 는 IBM Cloud 및 AWS 모두에서 다중 영역 영역(MZR)을 사용하여 고가용성을 제공합니다. watsonx.data 의 다양한 구성 요소는 액티브-액티브 및 액티브-온리 설정으로 배포되어 높은 가용성과 복원력을 보장합니다.

활성-활성

액티브-액티브 설정에서는 여러 개의 컴포넌트 인스턴스가 서로 다른 가용성 영역(AZ)에서 동시에 실행됩니다. 이러한 인스턴스는 부하가 분산되어 있으며 요청을 병렬로 처리할 수 있습니다.

주요 특징

  • 이중화 - 하나의 인스턴스 또는 AZ에 장애가 발생해도 다른 인스턴스는 중단 없이 트래픽을 계속 서비스합니다.
  • 부하 분산 - 트래픽이 모든 활성 인스턴스에 분산되어 성능이 향상되고 지연 시간이 줄어듭니다.
  • 자동 장애 조치 - 수동 개입이 필요하지 않으며 시스템이 자동으로 트래픽 경로를 재지정합니다.

혜택:

  • 높은 내결함성.
  • 영역 장애 시 원활한 사용자 경험.
  • 리소스 사용량 개선.

watsonx.data 에서 대부분의 구성 요소는 지속적인 가용성을 보장하기 위해 여러 영역에 복제본이 있는 액티브-액티브 설정으로 배포됩니다. 예를 들어 엔터프라이즈 요금제의 메타데이터 서비스(MDS)가 있습니다.

활성 전용

활성 전용 설정에서 구성 요소는 한 번에 하나의 가용성 영역에서만 실행됩니다. 해당 영역에 실패하면 컴포넌트를 다시 시작하거나 다른 영역에 다시 배포해야 합니다.

주요 특징

  • 컴포넌트당 단일 활성 인스턴스.
  • 장애 발생 시 새 영역에서 자동 재시작.
  • 재시작 시간으로 인해 장애 조치 중 약간의 지연이 발생할 수 있습니다.

혜택:

  • 더 단순한 아키텍처.
  • 리소스 소비 감소.
  • 장애 조치 중 짧은 다운타임으로 복원력을 확보하세요.

watsonx.data 에서 단일 테넌트 구성 요소는 활성 전용 설정으로 배포됩니다. 이러한 단일 테넌트 구성 요소( Presto 엔진 및 메타스토어 구성 요소 포함)는 용량 및 장애 조치를 위해 3개의 AZ에 전략적으로 분산되어 있습니다. 이러한 구성요소는 실패 중에 새 구역에서 다시 시작됩니다. 예를 들어, Lite 요금제의 메타데이터 서비스(MDS)가 있습니다.

다중 구역 지역(MZR)에서는 Presto MDS가 여러 구역에 분산되어 있습니다.

단일 가용성 구역이 MZR에서 실패하거나 임의의 지역에서 하드웨어 장애가 발생하면 워크로드가 자동으로 실패하고 해당 지역 내의 다른 구역에서 다시 시작됩니다. 모든 watsonx.data 인스턴스는 기본 교차 지역 메타데이터 버킷 및 선택적 평가판 버킷 (10GB) 과 함께 제공됩니다. 두 버킷 모두 IBM Cloud® Object Storage 버전 관리로 활성화됩니다. 데이터는 별도의 IBM Cloud Object Storage 계정으로 복제를 활성화하여 백업합니다. 그러나 고객이 watsonx.data 인스턴스로 가져오는 모든 외부 버킷에 대해서는 고객이 해당 백업에 대한 책임을 집니다.

지역 재해에서는 수행해야 하는 모든 단계가 포함된 이메일을 수신합니다. watsonx.data에 대한 책임을 참조하십시오. 단일 테넌트 구성요소는 '활성 전용' 모델에서 작동하므로 장애가 있는 경우 동일한 서비스를 제공하는 새 노드에서 즉시 다시 시작할 수 있습니다.

단일 테넌트 구성요소는 신뢰성을 향상시키기 위해 3개의 AZ에 전략적으로 분배됩니다. AZ가 실패하면 사용 가능한 AZ에서 필요한 서비스를 시작하기에 충분한 용량이 보장됩니다. 이는 AZ 가동 중단으로 인한 영향을 최소화합니다.

책임

백업

IBM 책임

  • 자동 일일 백업: watsonx.data 은 IBM 에서 제공하고 관리하는 모든 리소스의 일일 백업을 자동으로 수행합니다. 다음이 포함됩니다.
    • 시스템 메타데이터
    • 구성 설정
    • 내부 데이터 관리 주체 watsonx.data
  • 백업 스토리지 및 보안: 이러한 백업은 IBM 인프라 내에 안전하게 저장되어 데이터 내구성을 보장하고 엔터프라이즈급 표준을 준수합니다.

고객 책임사항

  1. 복원을 위해 새 인스턴스를 프로비저닝합니다:
    • 복원이 필요한 경우 클라이언트는 복원된 데이터를 수신하기 위해 watsonx.data 인스턴스를 새로 만들어야 합니다.
    • 이렇게 하면 원래 환경이 그대로 유지되고 복원된 데이터를 안전하게 검증할 수 있습니다.
  2. IBM 백업을 확인합니다: 복원 후 클라이언트는 복원된 데이터의 무결성과 완전성을 확인해야 합니다. 여기에는 메타데이터, 구성 및 시스템 동작 확인이 포함됩니다.
  3. 외부 구성 요소를 복원합니다:
    • watsonx.data 에 통합된 모든 외부 데이터 소스 또는 구성 요소(예: 사용자 지정 커넥터, 타사 도구, 사용자 관리 데이터 세트)는 IBM 에서 백업되지 않습니다.
    • 클라이언트는 이러한 구성 요소를 별도로 백업하고 복원할 책임이 있습니다.

복원

IBM 책임

제공된 리소스 복원: IBM 는 백업하는 리소스에 대한 실제 복원 프로세스를 처리합니다. 여기에는 새 인스턴스에 백업을 로드하고 시스템 수준의 일관성을 보장하는 작업이 포함됩니다.

고객 책임사항

  1. 복원할 새 인스턴스를 만듭니다: 클라이언트는 복원된 데이터를 받으려면 새 watsonx.data 인스턴스를 시작해야 합니다.
  2. 복원된 데이터의 유효성을 검사합니다: 클라이언트는 복원 후 유효성 검사를 수행하여 복원된 데이터가 정확하고 사용 가능한지 확인해야 합니다.
  3. 외부 구성 요소를 복원합니다: 클라이언트는 원래 설정의 일부였던 외부 통합 또는 데이터 소스를 수동으로 복원해야 합니다.

애플리케이션 레벨 고가용성

네트워크 및 클라우드 서비스를 통해 통신하는 애플리케이션은 일시적 연결 실패의 영향을 받습니다. 배치 또는 IBM Cloud에 대한 연결이 일시적으로 끊어진 경우 연결을 재시도하도록 애플리케이션을 디자인하면 오류가 발생합니다. watsonx.data 은 관리형 서비스이므로 정기적인 업데이트와 유지보수가 정상적인 운영의 일부로 이루어집니다. 이러한 유지보수로 인해 임시 서비스 인터럽트가 발생하는 경우가 있습니다.

애플리케이션은 서비스에 대한 일시적인 중단을 처리하고, 실패한 명령을 처리하는 데 발생한 오류를 구현하고, 일시적인 중단을 복구하도록 재시도 논리를 구현하도록 설계되어야 합니다.

다음은 임시 서비스 인터럽트 중에 예상될 수 있는 일부 오류 코드입니다.

Presto 코디네이터 노드가 다시 시작되면 유지보수 목적으로 또는 시스템 장애로 인해 애플리케이션이 Presto 엔진과의 연결을 다시 설정해야 합니다.

몇 분 동안 서비스를 사용할 수 없거나 연결이 중단되는 것은 예상되지 않습니다. 연결이 되지 않는 시간이 1분 이상 지속되는 경우 자세한 내용을 담은 지원 티켓을 열어 중단 원인을 조사할 수 있도록 하세요.

재해 복구 전략

복구 시간 목표(RTO)는 장애 발생 후 시스템이나 서비스를 사용할 수 없는 최대 허용 시간을 의미합니다. 운영 중단을 방지하기 위해 시스템을 얼마나 빨리 복구해야 하는지 정의합니다. watsonx.data 의 RTO는 다음 측면에 따라 달라집니다:

  • 가장 최근 백업 지점입니다.
  • 로그 보관 상태.
  • 메타데이터 복원에 필요한 수동 단계.

복구 지점 목표(RPO)는 장애 발생 시 허용 가능한 최대 데이터 손실량을 의미합니다. 가장 최근에 성공한 백업 또는 스냅샷을 기준으로 시스템이 데이터를 얼마나 오래 전으로 복구할 수 있는지를 나타냅니다. 복구는 마지막으로 성공한 메타데이터 백업 및 로그 아카이브를 기반으로 합니다. 장애와 복구된 상태 사이에 지연이 있을 수 있습니다.

데이터 복원력을 강화하고 잠재적 손실을 최소화하기 위해 SaaS 환경의 Milvus 서비스 백업 주기를 늘렸습니다. 이 변경으로 복구 시점 목표(RPO)가 2시간으로 단축되어 장애 발생 시 훨씬 더 최근 시점부터 데이터를 복원할 수 있습니다.

위치

AWS 지역

  1. 오리건 (us-west-2)
  2. N. 버지니아 (us-east-1)
  3. 프랑크푸르트 (eu-central-1)
  4. 도쿄(jp-tok)

IBM 지역

  1. 댈러스(us-south)
  2. 워싱턴(us-east)
  3. 프랑크푸르트(eu-de)
  4. 런던(eu-gb)
  5. 도쿄(jp-tok)
  6. 시드니(au-syd)