IBM Cloud VPC에 대한 고가용성 및 재해 복구 이해

고가용성서비스 또는 작업 부하가 장애를 견디고 사전 정의된 서비스 수준에 따라 처리 기능을 계속 제공할 수 있는 능력. (HA)은 예기치 않은 장애가 발생하더라도 서비스가 계속 작동하고 액세스할 수 있는 기능입니다. 재해 복구는서비스 중단과 같은 드물지만 심각한 사고와 광범위한 장애로부터 복구할 수 있는 서비스 또는 작업량 능력. 여기에는 전체 지역에 영향을 미치는 물리적 재해, 데이터베이스 손상, 또는 작업 부하에 기여하는 서비스의 손실이 포함됩니다. 그 영향은 고가용성 설계가 처리할 수 있는 능력을 초과합니다. 서비스 인스턴스를 작동 상태로 복구하는 프로세스입니다.

IBM Cloud® Virtual Private Cloud 는 서비스 수준 목표(SLO)를 충족하도록 설계된 고가용성 서비스입니다. 지역 및 지역 서비스로 구성되어 있습니다.

사용 가능한 지역 및 데이터 센터 위치에 대한 자세한 내용은 위치별 서비스 및 인프라 가용성을 참조하세요.

고가용성 아키텍처

VPC 리소스는 컨트롤 플레인과 데이터 플레인 서비스로 나뉘어 고객이 VPC 위에 고가용성 애플리케이션을 구축할 수 있도록 지원합니다. 컨트롤 플레인은 VPC 리소스를 프로비저닝 및 관리(생성, 업데이트, 삭제)하고 제어 기능을 제공하기 위해 존재합니다. 데이터 플레인은 가상 서버 인스턴스, 플로팅 IP 주소, 보안 그룹, 블록 스토리지 등과 같이 프로비저닝된 VPC 리소스의 모음입니다.

컨트롤 플레인은 여러 영역에 걸쳐 중복 하드웨어에서 호스팅되므로 하드웨어 및 영역 장애에 대한 복원력을 제공합니다. 컨트롤 플레인과 데이터 플레인은 서로 다른 장애 도메인에 있습니다. 예를 들어, 제어 플레인 중단은 데이터 플레인의 가용성에 영향을 미치지 않습니다. 기존의 모든 고객 리소스는 아무런 영향 없이 계속 운영됩니다. 복원력을 높이기 위해 사용자는 중복 데이터 플레인 리소스로 애플리케이션을 구축할 수 있습니다.

VPC 리소스는 범위에 따라 영역 리소스와 지역 리소스로 분류됩니다. VPC와 같은 일부 리소스는 여러 영역에 걸쳐 있으며 지역 리소스로 간주됩니다. 대부분의 리소스는 영역별로 범위가 지정되어 있으며 특정 영역에서 사용할 수 있습니다. 예를 들어 서브넷, 액세스 제어 목록, 보안 그룹, 라우팅 테이블, 공용 게이트웨이 및 가상 사설 엔드포인트 게이트웨이가 생성된 영역에 존재합니다.

제어 플레인 장애로부터 데이터 플레인 보호, 영역별 서비스 독립성 및 지역 서비스 이중화에 대한 자세한 내용은 고가용성 및 복원력을 위한 IBM Cloud 서비스 아키텍처를 참조하세요.

구역 장애

완전한 영역 장애가 발생하면 컨트롤 플레인과 데이터 플레인 모두 영역에 영향을 받습니다. 영향을 받는 영역의 제어 기능을 사용할 수 없으며 모든 영역 리소스가 다운되었습니다. 예를 들어, 영향을 받는 영역의 가상 서버 인스턴스는 사용할 수 없으며 다른 정상 영역으로 이동되지 않습니다. 지역 리소스에 대한 모든 변경 사항은 장애가 발생한 영역이 복구될 때까지 해당 영역에 적용되지 않습니다.

다른 영역의 데이터 플레인은 영향을 받지 않으며, 영향을 받지 않는 영역의 모든 영역 리소스는 중단 없이 계속 작동합니다. VPC와 같은 지역 리소스는 정상 영역에서 계속 실행됩니다. 컨트롤 플레인은 가용성이 높으며 서비스에서 영향을 받지 않는 다른 영역의 리소스를 관리할 수 있습니다.

고객은 영역(장애 도메인)에 리소스를 분산하여 애플리케이션의 고가용성을 관리하는 메커니즘을 개발하고 재해 복구에 대한 계획을 세워야 합니다.

지역별 실패

비정상적인 지역 재해가 발생하면 근본적인 문제가 해결되고 리소스의 데이터 손실을 줄이는 데 중점을 두고 VPC 제어 영역이 복원됩니다. 데이터 플레인은 또한 복구 지점 목표(RPO) 및 복구 시간 목표(RTO)를 충족하는 것을 목표로 스토리지에서 고객 데이터의 상태를 복구하여 복원됩니다.

단일 캠퍼스 다중 영역(SC-MZR)에서는 영역이 더 긴밀하게 연결되어 있기 때문에 데이터 센터 재해가 전체 영역에 영향을 미칠 수 있습니다. 서비스는 데이터 손실을 방지하기 위해 다른 MZR로 백업 및 복구 전략을 사용해야 합니다.

하드웨어 장애

리소스는 안정적이고 종종 이중화된 하드웨어에서 제공되지만 예기치 않은 하드웨어 장애로 인해 이러한 리소스가 중단될 수 있습니다. 예를 들어 기본 하드웨어에 장애가 발생하면 가상 서버 인스턴스가 실패할 수 있습니다. 이 상황에서는 호스트 장애 복구 정책에 따라 가상 서버가 복구되는 방식이 결정됩니다. 장애가 발생하고 호스트 장애 복구 정책이 기본 설정인 restart 으로 설정되어 있는 경우 제어 플레인은 하드웨어 장애를 감지하고 가상 서버를 동일한 영역의 사용 가능한 하드웨어로 마이그레이션한 후 가상 서버를 다시 시작합니다. 임시 디스크 스토리지는 부팅 볼륨으로 복원되지 않습니다. 데이터 볼륨을 사용할 수 있지만 장애 발생 시 저장되지 않은 애플리케이션 또는 운영 체제 캐시 쓰기가 누락되었을 수 있습니다.

블록 볼륨은 고급 복제 기술을 갖춘 이중화 하드웨어로 지원되어 복원력을 향상시킵니다. 그러나 영역별 재해 또는 다중 하드웨어 장애로 인해 블록 볼륨 장애가 발생할 수 있습니다. 백업 및 복원은 데이터 손실 또는 손상을 완화하는 데 적합한 접근 방식입니다. 이 접근 방식은 다른 IBM Cloud 지역으로 데이터를 복제하여 지역적 재난을 완화하는 데에도 사용할 수 있습니다. 스냅샷 기능을 사용하여 백업 및 복원을 지원할 수 있습니다. 또한 고객은 애플리케이션을 다른 영역에 분산하여 중단을 방지하고 RPO/RTO를 개선할 수 있습니다.

볼륨 스토리지와 관련 서버 애플리케이션 장애 사이에는 강력한 장애 상관관계가 존재할 수 있습니다. 장애가 발생한 저장 장치가 있을 때 애플리케이션 동작을 확인하려면 워크로드를 검사하고 테스트해야 합니다.

베어메탈 서버 및 관련 스토리지에 대한 자세한 내용은 스토리지 개요(Bare Metal Servers for VPC )를 참조하세요. 베어 메탈 서버의 로컬 디스크에는 스냅샷을 사용할 수 없습니다. 고객은 이러한 디바이스에 대한 고가용성 및 재해 복구를 관리해야 합니다.

HA 애플리케이션 구축

VPC 부하 분산 장치를 사용하여 들어오는 요청을 여러 가상 서버와 베어메탈 서버로 분산할 수 있습니다. 사용할 수 없게 된 가상 서버와 베어메탈 서버는 상태 확인에 응답하지 않으며, 로드 밸런서가 사용 가능한 리소스의 부하를 분산합니다. 애플리케이션 로드 밸런서(ALB)를 사용하여 워크로드의 트래픽을 여러 영역의 가상 서버로 분산하고 전체 영역을 사용할 수 없게 되더라도 사용할 수 있는 워크로드를 만들 수 있습니다.

ALB 자체가 여러 영역의 서브넷에 구성되어 있으면 단일 영역 장애에도 복원력이 있습니다. 네트워크 부하 분산 장치는 여러 기본 가상 서버에 분산되어 있으며 단일 가상 서버 장애에 탄력적으로 대응하는 영역 서비스입니다.

VPC 리소스로 구성된 워크로드의 가용성을 개선하기 위한 기본 전략은 여러 리소스에 워크로드를 분산하는 것입니다. 한 구역 내, 다중 구역 지역(MZR)의 여러 구역 또는 여러 지역에 걸쳐 리소스를 배포할 수 있습니다. 자세한 내용은 여러 위치 및 영역에 격리된 워크로드 배포 (이 전략은 IBM Cloud Internet Services (CIS) 및 글로벌 로드 밸런서를 사용함)를 참조하세요.

고가용성 기능

IBM Cloud VPC 는 다음과 같은 고가용성 기능을 지원합니다:

다음용 HA 기능 IBM Cloud VPC
기능 설명 고려사항
애플리케이션 로드 밸런서 ALB는 여러 영역의 부하를 IP 주소로 분산합니다. 워크로드는 확장 가능해야 합니다.
네트워크 로드 밸런서 NLB는 영역 내의 IP 주소에 부하를 분산합니다. 워크로드는 확장 가능해야 합니다.
Auto scale for VPC 환경의 요구 사항에 맞게 가상 서버 인스턴스를 동적으로 생성하여 성능과 비용을 개선하세요. 워크로드는 확장 가능해야 합니다.
로드 밸런서 및 인스턴스 그룹 로드 밸런서를 앞세운 확장 가능한 워크로드는 여러 영역에 걸쳐 여러 인스턴스로 부하를 분산합니다. 워크로드는 확장 가능해야 합니다.

고객은 HA를 생성하고 지원할 수 있습니다:

다음을 위한 고객 HA 기능 IBM Cloud VPC
기능 설명 고려사항
확장 가능한 워크로드 더 많은 서버로 수평 확장할 수 있는 가상 서버 또는 베어메탈 서버 기반 워크로드를 생성하세요. 모든 워크로드를 수평으로 확장할 수 있는 것은 아닙니다.

확장 가능한 워크로드

확장 가능한 워크로드는 동일한 이미지를 실행하는 서버를 더 추가하여 증가하는 수요를 처리할 수 있습니다. 로드 밸런서 및 VPC용 자동 확장을 사용하여 확장 가능한 워크로드를 구현할 수 있습니다.

재해 복구 아키텍처

재해 복구 전략은 복구 위치에서 VPC 워크로드를 복원하기 위한 스크립팅 자동화를 제공하는 것입니다. 예를 들어, 특정 지역을 사용할 수 없게 되면 워크로드 및 관련 데이터를 사용 가능한 지역으로 마이그레이션하는 것은 고객의 책임입니다. IBM 는 파라미터화된 위치와 성능으로 워크로드를 정의하는 데 사용할 수 있는 코드 시스템으로서의 Terraform 인프라를 지원합니다. 고객은 재해 발생 시 사용 가능한 위치에서 리소스를 복구하는 스크립트를 생성하는 데 VPC API, SDK 및 CLI를 사용할 수 있습니다. 자세한 내용은 재해 복구 계획을 참조하세요.

재해 복구 IBM Cloud IBM Cloud Object Storage, Terraform-as-a-Service를 제공하는 IBM Cloud IBM Cloud Schematics 및 배포 가능한 아키텍처에 대해 자세히 알아볼 수 있습니다.

재해 복구 기능

IBM Cloud VPC 는 다음과 같은 재해 복구 기능을 지원합니다:

다음을 위한 DR 기능 IBM Cloud VPC
기능 설명 고려사항
단일 볼륨 스냅샷 스냅샷은 부팅 또는 데이터 볼륨의 특정 시점 복사본입니다. Block Storage 스냅샷은 지역 Cloud Object Storage 인스턴스에 저장됩니다. 스냅샷은 소스 볼륨과 독립적입니다. 소스 볼륨의 영역을 사용할 수 없는 경우 스냅샷을 사용하여 해당 지역의 다른 영역에 새 볼륨을 만들 수 있습니다. 스냅샷은 콘솔에서, CLI에서, API 또는 Terraform을 사용하여 온디맨드 방식으로 만들 수 있습니다. VPC용 백업 서비스를 사용하여 예약할 수도 있습니다.
지역 간 스냅샷 복사본 소스 스냅샷과 독립적인 지역 간 스냅샷 복사본을 사용하여 새 볼륨을 만들 수 있습니다. 스냅샷은 콘솔, CLI에서 수동으로 다른 리전으로 복사하거나 API 또는 Terraform을 사용하여 프로그래밍 방식으로 복사할 수 있습니다. 백업 정책에 다른 지역에 사본 생성을 포함할 수도 있습니다.
일관성 그룹 스냅샷 스냅샷 일관성 그룹에는 동일한 가상 서버 인스턴스에 연결된 여러 Block Storage 볼륨의 스냅샷이 포함되어 있습니다. 일관성 그룹의 스냅샷을 요청하면 시스템에서 가상 서버 인스턴스에 연결된 모든 태그가 지정된 Block Storage 볼륨의 스냅샷을 동시에 생성합니다. 부팅 볼륨을 포함하거나 제외할 수 있습니다. 인스턴스 스토리지는 포함되어 있지 않습니다.
빠른 복원 스냅샷 빠른 복원 스냅샷은 상위 블록 볼륨이 있는 영역에 캐시되는 스냅샷입니다. 부팅 가능한 빠른 복원 스냅샷으로 가상 서버를 생성하면 일반 스냅샷에서 부팅 볼륨을 프로비저닝할 때보다 서버가 더 빠르게 완전히 작동합니다.
파일 공유 복제 소스 공유를 사용할 수 없게 되면 복제본 공유로 복제 장애 조치를 시작할 수 있습니다. 같은 지역의 다른 영역에 복제본 공유를 만들 수 있습니다. 같은 지역의 다른 지역에 복제본을 만들 수도 있습니다. 15분마다 데이터를 복제할 수 있습니다.

스냅샷에서 볼륨 또는 공유를 복원하는 것은 시간이 걸리는 수동 작업입니다. 재해 복구를 위해 더 높은 수준의 서비스가 필요한 경우 IBM Cloud 의 백업 및 복구 서비스를 참조하세요.

고객은 추가 재해 복구 옵션을 만들고 지원할 수 있습니다:

다음을 위한 고객 DR 기능 IBM Cloud VPC
기능 설명 고려사항
VPC 구성을 위한 외부 소스 Terraform 스크립트, 셸 스크립트 또는 프로그램과 같이 고객이 관리하는 구성 파일에 캡처된 VPC, 네트워크 및 서버의 구성. 고객은 스크립트를 생성하고 잠재적인 재해 발생 시 사용할 수 있는 구성을 유지해야 합니다.
파일 스토리지 백업 및 복사를 위한 고객 제작 스크립트 파일 공유의 콘텐츠를 복사하여 다른 위치에서 사용할 수 있도록 합니다. 고객은 스크립트를 만들거나 고객이 관리하는 연속 백업 및 복원을 사용해야 합니다.
블록 볼륨 및 파일 스토리지에 대한 고객 관리형 연속 백업 및 복원 고객은 Veeam과 같은 백업 및 복구 시스템과 통합되는 서버에 타사 에이전트 및 OS 드라이버를 설치할 수 있습니다. 고객은 타사 백업 및 복구 솔루션을 설치하고 관리해야 합니다.

재해 복구 계획

재해 복구 단계는 정기적으로 연습해야 합니다. 계획을 세울 때 다음과 같은 실패 시나리오와 해결 방법을 고려하세요.

다음 대상에 대한 DR 시나리오 IBM Cloud VPC
실패 분석
부팅 볼륨 실패 볼륨에서 만든 사용자 지정 이미지로 새 볼륨을 만들 수 있습니다. 또는 콘솔의 스냅샷, CLI, API, Terraform을 사용하거나 고객이 관리하는 지속적 백업 및 복원 솔루션을 사용하여 볼륨을 복원 할 수 있습니다. 스냅샷에서 부팅 볼륨을 복원하는 경우 스냅샷에서 부팅 볼륨으로 데이터를 복사하는 동안 약간의 성능 저하가 발생할 수 있습니다. 빠른 복원 스냅샷을 사용하면 모든 데이터를 사용할 수 있고 성능에 영향을 주지 않으므로 일반 스냅샷에서 복원하는 것보다 더 빠르게 복구 시간 목표재해 복구 계획에서, 재해 발생 후 비즈니스 프로세스를 복구하는 데 걸리는 시간입니다. (RTO)를 달성할 수 있습니다.
데이터 볼륨 장애 또는 데이터 손상 콘솔, CLI, API, Terraform을 사용하거나 고객이 관리하는 지속적인 백업 및 복원 솔루션을 사용하여 스냅샷에서 볼륨을 복원합니다. 데이터 볼륨에 대해서도 빠른 복원 스냅샷을 사용할 수 있습니다.
파일 공유 데이터 손상 파일 공유 스냅샷을 만들어 특정 시점의 파일 공유에 있는 데이터를 보존할 수 있습니다. 그러면 파일 공유의 콘텐츠가 실수로 삭제되거나 덮어쓴 경우 파일 공유 스냅샷에서 데이터를 복원할 수 있습니다.
파일 공유 실패 다른 영역의 기존 복제본으로 장애 조치를 시작하면 완화됩니다. 장애 조치 프로세스를 테스트하여 시간이 얼마나 걸리는지 확인하세요.
가상 서버 장애 로드 밸런서의 고가용성 기능 및 VPC용 자동 확장 기능을 사용하여 확장 가능한 워크로드를 생성함으로써 완화됩니다. 가상 서버를 다시 시작해야 할 수도 있습니다. 블록 볼륨 장애 해결이 필요할 수 있습니다.
베어메탈 서버 장애 고객이 관리하는 백업 및 복원 솔루션.
구역 장애 로드 밸런서의 고가용성 기능 및 VPC용 자동 확장 기능을 사용하여 확장 가능한 워크로드를 생성함으로써 완화됩니다. 서버 장애 해결 및 블록 볼륨 장애 해결을 사용하여 사용 가능한 영역에 리소스를 생성하려면 VPC 영역 구성에 외부 소스를 사용하세요.
지역별 실패 VPC 지역 구성에 외부 소스를 사용하여 사용 가능한 지역에 리소스를 생성합니다. 서버 장애 해결을 사용하여 볼륨 및 파일 스토리지를 이전 값으로 복원합니다.

고가용성 및 재해 복구에 대한 사용자의 책임

자세한 내용은 Virtual Private Cloud를 사용할 때의 책임에 대한 이해를 참조하세요. HA 및 DR에 대한 계획을 지속적으로 테스트하는 것은 귀하의 책임입니다. 자세한 내용은 재해 복구 테스트를 참조하세요.

네트워크 연결이 중단되거나 단기간 동안 서비스를 이용할 수 없는 경우가 발생할 수 있습니다. 애플리케이션의 고가용성을 유지하기 위해 애플리케이션 소스 코드에 클라이언트 가용성 재시도 로직이 포함되어 있는지 확인하는 것은 회원님의 책임입니다.

다음 체크리스트를 사용하여 계획을 세우고 실천하는 데 도움을 받을 수 있습니다.

  • 블록 볼륨 스냅샷

  • 파일 스토리지 복제

  • VPC 구성을 위한 외부 소스

변경 관리

변경 관리에는 업그레이드, 구성 변경 및 삭제와 같은 작업이 포함됩니다.

사용자와 프로세스에 업무에 필요한 최소한의 권한으로 IAM 역할과 작업을 부여하세요. 자세한 내용은 실수로 서비스가 삭제되는 것을 방지하려면 어떻게 해야 하나요?

인프라 구성을 변경하기 전에 수동 백업을 만드는 것이 좋습니다.

IBM® 재해 복구 계획을 지원하는 방법

IBM® 재해가 발생하면 IBM Cloud VPC 에 대한 구체적인 복구 조치를 취합니다.

단일 호스트에 예기치 않게 장애가 발생하면 장애가 발생한 호스트의 가상 서버가 정상 호스트에서 자동으로 다시 시작될 수 있습니다. IBM 에서 인프라를 모니터링하고 호스트 장애에 대응하는 방법에 대한 자세한 내용은 호스트 장애 복구 정책을 참조하세요.

IBM 영역 장애에서 복구하는 방법

영역 장애는 자연재해, 정전과 같은 인프라 문제, 정보를 삭제하는 우발적이거나 악의적인 작업, 또는 버그나 오류가 포함된 소프트웨어 업데이트. 영역 장애가 발생하면 IBM 에서 시설과 데이터 센터, 물리적 네트워크 및 장치를 복구합니다, 물리적 스토리지, 물리적 서버 및 메모리, 하이퍼바이저를 복구합니다. 자세한 내용은 IBM Cloud 제품 사용에 대한 공동 책임을 참조하세요.

IBM 지역 장애에서 복구하는 방법

전체 지역에 장애가 발생하는 경우 IBM 에서 다시 시설과 데이터 센터, 물리적 네트워크 및 장치, 물리적 스토리지, 물리적 서버 및 메모리, 하이퍼바이저를 복구합니다. 자세한 내용은 IBM Cloud 제품 사용에 대한 공유 책임재해 복구에 대한 자주 묻는 질문을 참조하세요.

IBM 에서 서비스 인스턴스를 복원할 수 없는 경우 재해 복구 아키텍처에 설명된 대로 서비스를 복원해야 합니다.

IBM 서비스 유지 관리 방법

가상 서버, 호스트 및 데이터 센터에서 정기 유지보수를 수행할 때는 정기 프로토콜을 따릅니다. 자세한 정보는 클라우드 유지보수 오퍼레이션 이해를 참조하십시오.

모든 업그레이드는 복구 계획 및 롤백 프로세스를 포함한 IBM 서비스 모범 사례에 따릅니다. 정기 유지보수로 인해 짧은 중단이 발생할 수 있으며, 이는 클라이언트 가용성 재시도 로직으로 완화됩니다. 변경 사항은 지역별로, 지역 내에서 지역별로 순차적으로 배포됩니다. IBM 에서는 결함이 처음 발견되면 업데이트를 되돌립니다.

복잡한 변경 사항은 기능 플래그를 통해 활성화 및 비활성화하여 노출을 제어합니다.

고객 워크로드에 영향을 미치는 변경 사항은 IBM Cloud 알림에 자세히 설명되어 있습니다. 이 서비스에 영향을 미치는 계획된 유지 관리, 공지사항 및 릴리스 노트에 대한 자세한 내용은 알림 및 상태 모니터링을 참조하세요.