瞭解 IBM Cloud® Object Storage 的高可用性及災難回復
高可用性服務或工作負載承受故障並根據某些預先定義的服務等級繼續提供處理能力的能力。 (HA) 是服務在出現意外故障時保持運作和可存取的能力。
災難復原服務或工作負載從罕見的重大事故和大規模故障(如服務中斷)中恢復的能力。 這包括影響整個區域的實體災難、資料庫損毀或對工作負載有貢獻的服務遺失。 其影響超出了高可用性設計的處理能力。是將服務實例還原到工作狀態的過程。
IBM Cloud Object Storage 是一項全域服務,可讓您配置儲存資料彈性,同時保持高可用性。 有關詳細信息,請參閱 服務等級協定(SLA)。 您也可以 透過本機文件在服務和基礎架構可用性 中找到可用區域和資料中心位置。
高可用架構
Object Storage 是一項全球服務,您可以選擇配置儲存彈性。 儲存桶的彈性由用於建立它的端點定義,即跨區域、區域和單一站點。
-
跨區域容錯能力將把您的資料分散儲存於多個都會區
-
區域韌性將使數據分散於單一都會區
-
單一資料中心的容錯能力將資料分散儲存於單一資料中心內的多台設備中
區域和跨區域儲存桶可以在網站或區域中斷期間保持可用性,而無需更改任何配置,因此建議在配置工作負載以實現高可用性時使用這些儲存桶彈性設定。 儲存於單一站點的資料,仍分散於多個實體儲存裝置中,但僅存放於單一資料中心內,且不具備區域支援功能。
高可用性功能
Object Storage 提供以下功能來協助您規劃中斷發生時的高可用性:
| 特性 | 說明 | 考量 |
|---|---|---|
| 存儲桶彈性 | 能夠為客戶資料配置特定的彈性選擇。 | 在區域端點建立的 Object Storage 儲存桶將資料分佈到都會區中包含的三個或更多區域。 這些區域中的任何一個發生停機甚至毀損,都不會影響可用性。 在跨區域端點建立的儲存桶將資料分佈在同一地理位置的三個區域。 其中任何一個地區都可能會遇到中斷甚至破壞,而不影響可用性。 透過GSLB(Global Server Load Balancing)將請求路由到就近的跨區域都會區。 有關更多信息,請參閱 端點和存儲位置。 |
| 抄寫 | 複製將新建立的物件和物件更新從來源儲存桶複製到目標儲存桶,並允許您定義自動非同步複製物件的規則。 | 為了確保在災難發生時有可用的備份副本,建議配置和設定複製。 了解有關 追蹤複製事件 的更多資訊。 |
容災架構
跨區域、區域和單一站點儲存桶針對特定災難場景提供不同程度的容忍度。 為您的儲存桶選擇符合您企業災難復原要求的正確彈性模型。 對於資料中心或區域層級的許多災難場景,IBM 計畫目標是在 24 小時內復原服務和相關內容,RPO 為 1 小時。
客戶可以實施其他選用架構以縮短恢復時間。
例如,為了從不太可能發生的 COS 區域完全中斷(無法恢復原始資料)中恢復,可以在備用區域中建立重複的儲存桶。 等待 IBM Cloud 恢復受影響的區域或服務也是一種有效的路徑,但請記住,這可能需要數小時或更長時間,並且根據災難場景,可能會出現資料遺失。
複製的儲存桶可以配置為鏡像生產儲存桶,但更新了對區域服務的引用。 例如,如果使用 Key Protect,馬德里中的重複儲存桶應引用儲存在馬德里 Key Protect 實例中的根密鑰。 如果發生災難場景,無法等待 IBM 完全恢復該區域,客戶可以使用來源儲存桶中原始資料的備份副本重新填充此複製儲存桶。 或者,客戶可以在任何中斷之前設定複製規則,以保持來源儲存桶和複製儲存桶之間的資料同步。 為了獲得最高等級的彈性,應在事前(在任何潛在災難之前)建立此類重複儲存桶,並與使用複製的來源儲存桶保持同步。 應考慮使用物件複製功能以及來源儲存桶的彈性模型和整體業務災難復原目標。
規劃恢復到恢復區域。 複製的儲存桶應與 IBM Cloud 中的工作負載 災難復原方法 保持一致。 如果災難不會影響生產來源儲存桶的配置或可用性(例如,只是資料遺失),則客戶可以就地修復來源儲存桶中的資料。 如果需要故障轉移到複製儲存桶,則需要重新配置客戶端應用程式以呼叫目標複製儲存桶的端點。
災難復原功能
IBM COS 提供以下可供客戶設定的災難復原功能:
| 特性 | 說明 | 考量 |
|---|---|---|
| 物件複製 | 複製將新建立的物件和物件更新從來源儲存桶複製到目標儲存桶,並允許您定義自動非同步複製物件的規則。 | 為了確保在災難發生時有第二個副本可用,您可以配置生產儲存桶和目標復原儲存桶之間的複製。 根據您的業務的彈性要求,如果使用跨區域或區域儲存桶,可能不需要複製。 了解有關 追蹤複製事件 的更多資訊。 |
| 物件版本化 | 啟用物件版本控制以維護物件的先前版本,以便在資料損壞或刪除時可以復原。 | 客戶可以在儲存桶上啟用物件版本控制,並在資料損壞時還原舊版本。 此儲存桶必須可用才能執行版本復原。 進一步瞭解 |
| 物件鎖定 | 物件鎖定可防止在指定保留期間內刪除物件版本。 | 啟用物件鎖定以防止意外或未經授權的物件刪除或覆蓋。 確保安全物件版本可用於復原。 進一步瞭解 |
其他災難復原選項由客戶建立和支援。
| 特性 | 說明 | 考量 |
|---|---|---|
| 備份及還原 | 使用腳本或第三方備份應用程式,將來源儲存桶中的資料備份至復原區域。 | 客戶必須自行託管及管理任何腳本或第三方備份解決方案,以備份儲存於 COS 儲存桶中的資料。 |
規劃災難復原
災難復原步驟必須定期練習。 在製定計劃時,請考慮以下故障場景和解決方案。
| 失敗 | 解決方法 |
|---|---|
| 硬體故障(單點) | Object Storage 儲存桶能夠抵禦區域內的單點硬體故障。 無需配置。 |
| 資料中心故障 | 跨區域和區域 COS 儲存桶能夠抵禦單一資料中心的故障。 客戶無需進行任何配置或故障轉移。 位於單一資料中心區域的儲存桶使用者,可設定資料複製功能或採用第三方備份解決方案,以確保區域外存在資料的安全副本。 等待 IBM Cloud 恢復受影響區域或服務亦為可行方案,但請注意根據資料中心故障性質,此過程可能耗時數小時甚至更久。 |
| 資料毀損 | 使用物件版本控制、物件複製或第三方備份解決方案,以確保存在未損壞的物件版本,以便在資料損壞或意外刪除時進行復原。 |
| 區域故障 | 跨區域 COS 儲存桶對區域故障具有彈性。 Key Protect 等一些整合區域服務可能需要針對跨區域儲存桶執行額外的故障轉移步驟。 在區域或單一資料中心 COS 儲存桶中擁有儲存桶的客戶應在區域全部故障的情況下遵循上述災難復原步驟。 等待 IBM Cloud 恢復受影響的區域或服務也是一種有效的途徑,但請記住,這可能需要幾個小時或更長時間,具體取決於區域中斷的性質。 |
使用 IBM Cloud Key Management Service 新增信封加密:
如果您使用任何其他 IBM Cloud 服務整合(例如 Key Protect 或 Hyper Protect 等 IBM Cloud Key Management Service)來新增信封加密,則需要確保使用適當的金鑰副本配置計畫。 當使用跨區域配置時,這一點至關重要,以確保在發生中斷時副本金鑰可用。 有關 高可用性和災難復原的 信息,請參閱 Key Protect 文件。
您對 HA 和 DR 的責任
| 責任 | 說明 |
|---|---|
| 備援 | 使用適當的彈性選項、儲存類別、資料局部性以及特定工作負載和用例所需的可選配置來配置Object Storage桶。 |
| 資料備份 | 如果需要,請根據您的組織要求確保客戶資料備份。 |
| 網路 | 監視和管理非 IBM 網路資源,以確保對 IBM Cloud 服務端點的適當訪問,包括容量和可用性。 |
| 使用 IBM Cloud KMS 新增信封加密 | 如果您使用 IBM Cloud Key Protect 或 Hyper Protect Crypto Services 新增信封加密,請確保查看相應的高可用性和災難復原文件以充分了解其意義。 您可能需要使用具有可在故障轉移時使用的金鑰副本的金鑰實例位置。 另請確保查看適當的許可和計劃資訊。 |
要了解有關客戶和 Object Storage 之間責任歸屬的更多信息,請參閱[使用 Object Storage 時的責任(/docs/cloud-object- storage?主題=雲端物件儲存責任)]。
復原時間目標 (RTO) 和復原點目標 (RPO)
IBM Cloud Object Storage 產品已製定計劃,可在發生相應災難時在數小時內恢復雲端服務和相關內容。
| 特性 | RTO 和 RPO |
|---|---|
| 從硬體故障中恢復(單點) | 對於所有彈性模型,RTO = 0、RPO = 0 |
| 從資料中心中斷中恢復 | 對於跨區域和區域彈性模型,RTO = 0、RPO = 0 |
| 還原先前的物件版本 | RTO = 秒,RPO = 接近 0 |
| 透過主動複製恢復到單獨區域中的儲存桶 | RTO = 分鐘,腳本編寫可以進一步縮短時間,並考慮調整工作負載以瞄準恢復桶的時間,, RPO = 接近 1 小時 |
| 恢復到新區域中的新儲存桶,無需主動複製 | RTO = 分鐘到天,考慮重新配置新儲存桶並調整工作負載以定位新儲存桶端點的時間量。 也要考慮用原始資料的副本填滿儲存桶的時間。 RPO以客戶的備份和復原計畫為準 |
變更管理
變更管理包含升級、配置變更及刪除等任務。 為了確保使用者根據角色要求獲得存取權限,請查看 IAM 入門。
建議您向使用者授予並使用其工作所需的最低權限來處理 IAM 角色和操作。 如何防止服務被意外刪除?
IBM® 如何協助確保災難復原
IBM® 在災難發生時採取特定的復原作業。
- 從區域或區域故障中恢復
如果發生區域故障,IBM Cloud 將解決區域中斷問題,當區域恢復聯機時,全域負載平衡器將恢復向已恢復的執行個體節點發送 API 請求,而無需客戶執行任何操作。 - IBM® 對各種災難情境進行年度測試,並根據這些測試期間發現的結果不斷完善我們的復原文件。
- 客戶可以透過 IBM® 主題專家獲得 24 × 7 全球支持,他們在災難發生時隨時待命提供協助。
所有 IBM® 主題專家每年都會接受有關業務連續性和災難復原政策和程序的培訓,以確保在災難發生時做好準備。
IBM 如何維護服務
所有升級都遵循 IBM 服務最佳實踐,並制定復原計畫和回溯流程。 新功能的定期升級和維護是正常操作的一部分。 此類維護有時會導致短暫的中斷間隔,該間隔由 客戶端可用性重試邏輯 處理。 更改是按順序推出的,一個區域內一個區域一個區域一個區域。 一旦出現缺陷跡象,更新就會被取消。
使用功能標誌啟用和停用複雜的變更以控制曝光。
通知中詳細介紹了影響客戶工作負載的變更。 有關詳細信息,請參閱 監控影響此服務的計劃維護、公告和發行說明的通知和狀態。