IBM Cloud Direct Link에 대한 고가용성 및 재해 복구 이해
고가용성서비스 또는 작업 부하가 장애를 견디고 사전 정의된 서비스 수준에 따라 처리 기능을 계속 제공할 수 있는 능력. (HA)은 예기치 않은 장애가 발생하더라도 서비스가 계속 작동하고 액세스할 수 있는 기능입니다. DR( 재해 복구서비스 중단과 같은 드물지만 심각한 사고와 광범위한 장애로부터 복구할 수 있는 서비스 또는 작업량 능력. 여기에는 전체 지역에 영향을 미치는 물리적 재해, 데이터베이스 손상, 또는 작업 부하에 기여하는 서비스의 손실이 포함됩니다. 그 영향은 고가용성 설계가 처리할 수 있는 능력을 초과합니다. )은 서비스 인스턴스를 작동 상태로 복구하는 프로세스입니다.
IBM Cloud® 는 계획되지 않았거나 예정된 유지보수로 인한 중단을 방지하기 위해 보조적이고 다양한 직접 링크를 설정할 것을 강력히 권장합니다. 특히 전체 위치에 영향을 미치는 문제에 대한 효과적인 재해 복구를 위해서는 신중한 계획과 준비가 필요합니다.
IBM Cloud Direct Link 는 서비스 수준 목표(SLO)를 충족하도록 설계된 고가용성 서비스입니다. 다양한 요구 사항에 맞게 구역 및 지역 구성으로 구성되어 있습니다. 데이터 센터, 영역 및 PoP(Points of Presence)의 정의를 비롯한 기본 인프라를 더 잘 이해하려면 IBM Cloud 리소스 배포를 위한 지역 및 데이터 센터 위치 ( PoPs )를 참조하세요. Direct Link 에 사용할 수 있는 지역 및 데이터 센터 위치에 대한 자세한 내용은 Direct Link 연결 또는 Direct Link 전용 프로비저닝 페이지의 게이트웨이 섹션을 참조하세요.
플랫폼 전반의 표준 및 모범 사례를 포함하여 고가용성 및 재해 복구에 대한 IBM Cloud 접근 방식에 대해 자세히 알아보려면 IBM Cloud 고가용성 및 재해 복구를 보장하는 방법을 참조하세요. 고가용성에 대한 정보는 IBM Cloud 서비스 수준 계약 (SLA)에서도 확인할 수 있습니다.
고가용성 아키텍처
고가용성(HA) 아키텍처( IBM Cloud Direct Link )를 달성하려면 단순히 두 번째 연결을 추가하는 것 이상으로 연결 제공업체와 관련된 장애 지점을 포함한 모든 단일 장애 지점을 제거해야 합니다. 다른 위치 또는 네트워크 경로에서 두 번째 Direct Link 를 프로비저닝하는 것은 좋은 시작이지만 진정한 복원력은 물리적 분리 이상의 것에 달려 있습니다.
여기서 중복성과 다양성의 개념이 중요해집니다. 이중화란 백업 시스템 또는 연결이 마련되어 있어 하나가 고장나면 다른 하나가 이를 대신할 수 있도록 하는 것을 의미합니다. 다양성은 한 걸음 더 나아가 백업이 서로 다른 공급자, 인프라 또는 물리적 경로를 사용하여 독립적으로 이루어지도록 보장합니다. 다양성이 없으면 이중화 시스템은 여전히 단일 장애 지점을 공유할 수 있습니다.
예를 들어 Direct Link 연결에 대해 단일 공급업체에 의존하는 경우 여전히 위험이 따릅니다. 완전한 경로 중복성을 보장하려면 다양한 공급자를 통해 추가 연결을 설정해야 합니다. 이렇게 하면 공급업체별 서비스 중단 시에도 IBM Cloud 연결이 유지됩니다.
가용성을 더욱 강화하려면 IBM 여러 IBM Cloud 영역에 걸쳐 Direct Link 연결 또는 전용 연결을 배포할 것을 권장합니다. IBM 에서 복원력 있는 디자인을 지원하는 인프라와 도구를 제공하지만, 특정 가용성 요구 사항을 충족하는 아키텍처를 구축하고 유지 관리하는 것은 사용자의 몫입니다. 여기에는 여러 지역에 워크로드를 분산하고, 다양한 연결을 구현하며, 정기적으로 재해 복구 및 장애 조치 절차를 테스트하는 것이 포함됩니다.
귀하는 Direct Link 연결이 어떻게 구성, 사용자 지정 및 사용되는지 이해할 책임이 있습니다. 또한 새 위치에서 서비스 인스턴스를 다시 만들고 데이터를 복원할 책임이 있습니다. Direct Link를 사용하여 HA를 실현하기 위해 다양성을 디자인하는 방법에 대한 정보는 Direct Link의 다양성 및 중복성을 위한 모델을 참조하십시오.
고가용성 기능
IBM Cloud Direct Link 는 다음과 같은 고가용성 기능을 지원합니다:
| 기능 | 설명 | 고려사항 |
|---|---|---|
| IBM Cloud Transit Gateway | 트랜짓 게이트웨이에 여러 개의 직접 링크를 연결하여 VPC와 온프레미스에서 중앙 집중식, 확장성, 이중화 네트워크 라우팅을 구현할 수 있습니다. 라우팅을 중앙 집중화하여 대규모 배포의 복잡성을 줄입니다. | 단일 장애 지점을 방지하려면 별도의 영역 또는 지역에 이중화 트랜짓 게이트웨이를 배포하고 각각에 직접 링크를 연결하세요. 첨부 파일 할당량 및 경로 전파 등의 구성 제한을 주의하세요. |
| BGP(보더 게이트웨이 프로토콜) 지원 | BGP를 사용하면 직접 링크 장애 발생 시 트래픽을 동적으로 라우팅하여 빠른 복구와 자동 경로 선택이 가능합니다. | 비대칭 라우팅 또는 장애 조치 지연을 방지하기 위해 BGP 세션 모니터링 및 라우팅 기본 설정 튜닝을 구성해야 합니다. |
고객은 다음과 같은 다른 고가용성 기능을 만들고 지원할 수 있습니다:
| 기능 | 설명 | 고려사항 |
|---|---|---|
| 온프레미스 내 여러 디바이스 | 온프레미스에 여러 개의 중복 장치(예: 라우터 및 스위치)를 설정하여 직접 연결되는 네트워크 경로의 고가용성을 보장하세요. | 물리적 공간, 전원 및 케이블 이중화를 계획하세요. 장애 조치 시나리오를 정기적으로 테스트하여 장치 수준 HA가 예상대로 작동하는지 확인하세요. |
| 온프레미스 장치를 다른 PoPs 및 데이터 센터에 연결하기 | 단일 장애 지점을 피하기 위해 장치(예: 라우터 및 방화벽)를 서로 다른 PoP( PoPs ) 또는 데이터 센터에 연결합니다. | PoPs 및 데이터 센터 전반의 네트워크 지연 시간 및 대역폭을 평가하세요. 다양한 물리적 경로를 확보하고 제공업체와 협력하여 위험 그룹이 공유되지 않도록 합니다. |
| AS 예비, BGP | 액티브 연결과 패시브 연결 간의 트래픽 흐름을 관리하기 위해 AS 프리패딩 및 BGP 라우팅을 구성하세요. | 인바운드 및 아웃바운드 트래픽에 대한 명확한 라우팅 정책을 정의하세요. BGP 광고의 정확성을 모니터링하고 필요에 따라 AS 경로 전략을 조정합니다. |
| BFD(Bidirectional Forwarding Detection) | BFD를 사용하면 링크 장애를 신속하게 감지하고 신속한 장애 조치를 보장하여 가용성을 개선할 수 있습니다. | 모든 네트워크 요소가 BFD를 지원하는지 확인합니다. BFD 세션 상태를 모니터링하고 감지 간격을 신중하게 조정하여 감도와 오탐의 균형을 맞출 수 있습니다. |
재해 복구 아키텍처
IBM Cloud Direct Link 는 복원력이 뛰어난 고가용성 아키텍처를 구축하는 데 중요한 역할을 합니다. 재해 복구 계획을 위해 Direct Link 에서는 장애 발생 시 안정적이고 지연 시간이 짧은 연결을 지원하도록 설계된 다양한 기능을 제공합니다.
조직은 데이터 복제 요구사항에 따라 여러 포트 속도 옵션(50Mbps~10Gbps) 중에서 선택할 수 있습니다. 이중화 기능이 기본 제공되지는 않지만, 다양한 교차 연결 라우터(XCR)에 이중 링크를 프로비저닝하고 적절한 BGP 장애 조치 전략을 구현하여 이중화 기능을 구성할 수 있습니다. Direct Link 는 로컬 및 글로벌 라우팅을 모두 지원하므로 여러 지역에 워크로드를 분산하여 복원력을 향상할 수 있습니다. 멀티존 리전(MZR)과의 통합 및 구성 백업 및 복구 지원으로 국지적인 장애로부터 더욱 안전하게 보호할 수 있습니다.
다음 표에서는 이러한 기능과 주요 고려 사항을 간략하게 설명합니다.
재해 복구 기능
IBM Cloud Direct Link 는 다음과 같은 재해 복구 기능을 지원합니다:
| 기능 | 설명 | 고려사항 |
|---|---|---|
| 로컬 및 글로벌 라우팅 | Direct Link 에는 로컬 라우팅과 글로벌 라우팅이 모두 포함되어 있어 동일한 시장 내(로컬 라우팅)와 다른 지리적 시장(글로벌 라우팅)에 있는 데이터 센터에 원활하게 연결할 수 있습니다. | 글로벌 라우팅은 여러 지역에 걸친 지역 간 워크로드 공유 및 재해 복구를 위해 필요합니다. |
| 구성 백업 및 복구 | IBM Cloud 는 Direct Link 구성을 백업할 수 있는 도구를 제공하여 재해 발생 시 서비스를 복원할 수 있도록 합니다. | 중단 시 신속한 복구를 위해 정기적으로 백업을 하고 복구 절차를 테스트하는 것이 좋습니다. |
| MZR(Multi-Zone Region) 지원 | Direct Link 는 IBM Cloud 의 MZR과 통합되어 여러 영역에 워크로드를 분산함으로써 가용성과 복원력을 향상시킵니다. | 고가용성을 달성하고 영역별 장애의 영향을 최소화하려면 여러 영역에 걸쳐 적절한 배포가 필요합니다. |
고객은 다음과 같은 다른 재해 복구 옵션을 만들고 지원할 수 있습니다:
| 기능 | 설명 | 고려사항 |
|---|---|---|
| 스크립트 및 백업 데이터 백업/복원 | 자체 백업 및 복원 스크립트를 생성 및 유지 관리하고, 구성 및 네트워크 상태 데이터를 안전하게 저장하여 중단 시 신속하게 복구할 수 있습니다. | 백업이 암호화되고, 버전이 관리되며, 지리적으로 다양한 위치에 저장되도록 하세요. 백업 일정을 자동화하고 주기적으로 복원 절차를 검증하세요. |
| Direct Link 의 다양한 연결 방식 | 여러 지역 또는 구역에 걸쳐 다양한 Direct Link 연결을 설정하여 지역 정전 시에도 지속적인 연결을 보장하세요. | 다양한 연결을 구현하려면 원활한 장애 조치를 보장하기 위해 네트워크 아키텍처와 BGP 구성을 신중하게 계획해야 합니다. |
| 데이터 보호 | IBM 는 비즈니스 연속성을 유지하고 재해 복구 노력을 지원하는 데 중요한 데이터 백업, 보존 및 복구를 위한 강력한 솔루션을 제공합니다. | 정기적으로 백업 및 복원 프로세스를 테스트하여 데이터 무결성과 가용성을 보장합니다. |
재해 복구 계획
재해 복구 단계를 정기적으로 연습하여 예기치 않은 중단에 잘 대비하는 것이 중요합니다. 재해 복구 계획을 수립할 때 IBM Cloud Direct Link 에 대한 다음 장애 시나리오 및 해결 방법을 고려하세요.
특정 장애를 복구하는 방법에는 여러 가지가 있을 수 있으므로 특정 아키텍처와 요구 사항에 따라 각 시나리오를 평가해야 합니다. 다음은 일반적인 장애 시나리오와 잠재적인 복구 조치입니다:
| 실패 | 분석 |
|---|---|
| PoP 실패 | 동일한 PoP 에 연결되지 않는 연결이 두 개 이상 있는지 확인합니다. |
| 데이터 센터(영역) 장애 | 장애 조치를 보장하기 위해 서로 다른 영역에 걸쳐 두 개 이상의 직접 링크가 있는지 확인하세요. IBM Cloud Direct Link 는 트래픽을 자동으로 라우팅할 수 있지만 고객 측 구성이 복원력을 향상시킵니다. |
| 지역 장애 | 복원된 지역에 연결하여 이 문제를 예상하세요. 비용이 부담스럽다면 직접 링크 연결을 대체할 수 있는 VPN 기능과 관련 스크립트를 준비하세요. |
| 하드웨어 장애(단일 지점) | IBM Cloud Direct Link 아키텍처는 다양한 네트워크 연결을 제공하여 단일 지점 하드웨어 장애를 처리하도록 설계되었습니다. 장애 조치는 고객 구성이 필요 없이 원활하게 이루어집니다. |
| 네트워크 연결 패킷 손실 | 모니터링 도구를 사용하여 근본 원인을 파악하세요. 프로비저닝된 대역폭을 초과하는 트래픽 급증이 있는지 확인하여 폴리싱 및 패킷 드롭을 유발할 수 있습니다. 포트, 케이블 및 네트워크 하드웨어에 결함이 있는지 검사하세요. 문제가 지속되거나 격리할 수 없는 경우 IBM 지원팀으로 에스컬레이션하여 추가 조사를 요청하세요. |
| 두 개의 직접 링크가 서로 다른 공급자를 사용하여 동일한 PoP, 에 프로비저닝되지만 둘 다 동일한 하드웨어 장치에 연결되어 단일 장애 지점을 생성합니다. | 직접 링크를 주문할 때 IBM Cloud 콘솔에서 포트 할당 세부 정보를 확인하여 포트 다양성을 확보하세요. 통합되지 않은 공급업체(공급자 포털과 IBM Cloud 콘솔 모두에서 별도로 주문)의 경우 기존 링크에서 사용하는 포트를 확인하고 다른 포트를 선택합니다. API 통합 공급업체(공급업체의 포털에서 주문이 시작되고 IBM Cloud 콘솔에 반영되는 경우)의 경우 공급업체별 지침을 참조하세요. 전용 직접 링크의 경우, 동일한 PoP 에서 기존 교차 연결이 있는지 확인하세요. |
HA 및 DR에 대한 책임
IBM 과 고객인 회원님 간의 Direct Link 사용에 대한 책임 소유권에 대한 배경 정보는 IBM Cloud Direct Link 사용 시 회원님의 책임 이해하기를 참조하세요. HA 및 DR에 대한 계획을 지속적으로 테스트하는 것은 귀하의 책임입니다.
네트워크 연결이 중단되거나 단기간 동안 서비스를 이용할 수 없는 경우가 발생할 수 있습니다. 애플리케이션의 고가용성을 유지하기 위해 애플리케이션 소스 코드에 클라이언트 가용성 재시도 로직이 포함되어 있는지 확인하는 것은 회원님의 책임입니다.
복구 시간 목표(RTO)
Direct Link 데이터를 보호하고 서비스 기능을 복구할 수 있는 메커니즘을 제공합니다. 서비스의 목표 복구 시간 목표재해 복구 계획에서, 재해 발생 후 비즈니스 프로세스를 복구하는 데 걸리는 시간입니다. (RTO)를 달성하기 위한 비즈니스 연속성 계획이 마련되어 있습니다. 다음 표는 ‘ Direct Link ’의 목표를 요약한 것입니다.
| 기능 | RTO |
|---|---|
| 이중화 구성 | 몇 분 이내(보통 5분 미만) |
| 라우팅 | 몇 분 내 자동 페일오버(일반적으로 2분 미만) |
| 백업 및 복구 | 데이터 크기 기준: 최대 10분 + 복원된 데이터 10GB당 1분 |
| 다중 구역 지역 | 데이터 복원이 필요한 경우 ~10분 + 10GB당 1분 |
| 스크립트 및 백업 데이터 백업/복원 | 자동화 및 데이터 양에 따라 30분~몇 시간 소요됨 |
| Direct Link 의 다양한 연결 방식 | < BGP 및 라우팅 장애 복구가 올바르게 구성되고 정기적으로 테스트되는 경우 5분 미만(일반적으로 1~2분) |
| 데이터 보호( IBM-제공 도구 가정) | 10분 + 복원된 데이터 10GB당 1분( IBM 표준 백업 복구와 동일) |
변경 관리
변경 관리에는 업그레이드, 구성 변경, 삭제 등의 작업이 포함됩니다.
사용자와 프로세스에 업무에 필요한 최소한의 권한으로 Identity and Access Management (IAM) 역할 및 작업을 부여합니다. 자세한 내용은 실수로 서비스가 삭제되는 것을 방지하려면 어떻게 해야 하나요?
변경 관리를 위한 모범 사례도 다음과 같습니다:
- Direct Link 구성에 대한 모든 수정 사항에 대한 변경 로그를 유지하여 변경 사항을 계획하고 문서화하세요.
- 업그레이드 또는 주요 변경을 수행하기 전에 중요한 구성의 백업을 만드세요.
- 트래픽이 적은 시간대에 업그레이드 또는 영향력이 큰 변경 사항을 예약하고 영향을 받는 팀에 알립니다.
- Direct Link 연결 상태 및 메트릭을 모니터링하여 모든 것이 예상대로 작동하는지 확인하세요.
IBM 재해 복구 계획을 지원하는 방법
IBM 는 특히 온프레미스 네트워크를 IBM Cloud 에 연결하는 데 중요한 IBM Cloud Direct Link 과 같은 서비스를 위해 복원력을 염두에 두고 인프라를 설계합니다. 장애가 발생한 경우:
- 인시던트 대응팀은 장애를 신속하게 파악하고 격리합니다.
- 트래픽 라우팅은 가능한 경우 IBM 의 백본 및 제공업체 네트워크를 사용하여 수행됩니다.
- 서비스 상태 커뮤니케이션은 IBM Cloud 상태 페이지를 통해 계속 유지되어 사용자에게 정보를 제공합니다.
영역 및 지역 장애의 경우 IBM 에서 다음과 같은 복구 조치를 취합니다:
IBM 영역 장애에서 복구하는 방법
영역 장애란 지역 내 하나의 데이터 센터 또는 가용성 영역에 장애가 발생하는 것을 말합니다. IBM 이러한 방식으로 영향을 완화합니다:
- Direct Link 는 여러 물리적 네트워크 경로에서 작동합니다. 다양한 링크와 경로를 통해 한 영역에서 장애가 발생해도 전체 연결이 중단되지 않도록 합니다.
- IBM Direct Link 엔드포인트의 상태를 지속적으로 모니터링합니다. 구역을 사용할 수 없게 되면 해당되는 경우 트래픽을 정상 구역으로 경로를 변경할 수 있습니다.
IBM 에서 서비스 인스턴스를 복원할 수 없는 경우 재해 복구 아키텍처에 설명된 대로 서비스를 복원해야 합니다.
IBM 지역 장애에서 복구하는 방법
드물게 지역 장애가 발생하는 경우:
- IBM 는 여러 지역에 걸쳐 워크로드를 설계하도록 권장합니다. Direct Link 연결을 다른 IBM Cloud 지역에 프로비저닝하여 지역 중단의 영향을 줄일 수 있습니다.
- IBM 의 글로벌 백본과 주요 통신 네트워크 제공업체와의 파트너십을 통해 특정 지역을 사용할 수 없게 되는 경우 트래픽을 위한 대체 경로를 제공합니다.
- IBM 는 여러 지역에서 Direct Link 프로비저닝을 활성화하여 재해 복구 계획을 지원합니다. 필요에 따라 활성화할 수 있는 보조 영역에 다양한 링크를 구성하는 것이 좋습니다.
IBM 에서 서비스 인스턴스를 복원할 수 없는 경우 재해 복구 아키텍처에 설명된 대로 서비스를 복원해야 합니다.
IBM 서비스 유지 관리 방법
모든 업그레이드는 복구 계획 및 롤백 프로세스를 포함한 IBM 서비스 모범 사례에 따릅니다. 정기 유지보수로 인해 짧은 중단이 발생할 수 있으며, 이는 클라이언트 가용성 재시도 로직으로 완화됩니다. 변경 사항은 지역별로, 지역 내에서 지역별로 순차적으로 배포됩니다. IBM 에서는 결함이 처음 발견되면 업데이트를 되돌립니다.
IBM 는 계획된 모든 유지보수 활동에 대한 사전 알림을 제공합니다. 변경 사항이 워크로드에 영향을 미칠 것으로 예상되는 경우 IBM 에서 공식 알림을 통해 이를 알려드립니다. 유지 관리, 서비스 공지 및 기타 업데이트에 대한 최신 정보를 확인하려면 모니터링 상태 모범 사례 페이지를 참조하세요.