瞭解 IBM Cloud VPC 的高可用性及災難回復
高可用性服務或工作負載承受故障並根據某些預先定義的服務等級繼續提供處理能力的能力。 (HA) 是指服務在發生意外故障時仍能維持運作和存取的能力。 災難復原服務或工作負載從罕見的重大事故和大規模故障(如服務中斷)中恢復的能力。 這包括影響整個區域的實體災難、資料庫損毀或對工作負載有貢獻的服務遺失。 其影響超出了高可用性設計的處理能力。是將服務實例還原到工作狀態的過程。
IBM Cloud® Virtual Private Cloud 是高可用性的服務,旨在滿足 服務等級目標(SLO)。 它由區域服務和區域服務組成。
如需有關可用區域和資料中心位置的詳細資訊,請參閱 依位置顯示的服務和基礎結構可用性。
高可用性架構
VPC 資源分為控制平面和資料平面服務,讓客戶能夠在 VPC 上建立高可用性的應用程式。 控制平面用於配置和管理 VPC 資源(建立、更新、刪除),並提供控制功能。 資料平面是已佈建 VPC 資源的集合,例如虛擬伺服器實體、浮動 IP 位址、安全群組、區塊儲存等。
控制平面託管在跨區的備援硬體上,可提供硬體和區域故障的復原能力。 控制平面和資料平面位於不同的故障域上。 例如,控制平面中斷不會影響資料平面的可用性。 所有現有的客戶資源會繼續運行,不會受到任何影響。 為了增加彈性,使用者可以利用備援資料平面資源建立應用程式。
VPC 資源根據其範圍可分為區域資源和區域資源。 某些資源 (例如 VPC) 橫跨多個區域,被視為區域資源。 大多數資源都有區域範圍,可在特定區域內使用。 例如,子網路、存取控制清單、安全群組、路由表、公用閘道和虛擬專用端點閘道存在於所建立的區域中。
如需有關控制平面故障的資料平面保護、區域服務獨立性和區域服務備援的詳細資訊,請參閱 IBM Cloud 服務架構的高可用性和彈性。
區域故障
如果發生完整的區域故障,控制平面和資料平面都會在區域上受到影響。 受影響區域的控制功能無法使用,所有區域資源均已停機。 例如,受影響區域中的虛擬伺服器實體無法使用,也不會移動到其他健康的區域。 在區域恢復之前,對區域資源所做的任何變更都不會在故障區域上生效。
其他區域的資料平面不受影響,不受影響區域內的所有區域資源會繼續運作,不會中斷。 VPC 等區域資源會繼續在健康的區域上執行。 控制平面具有高可用性,可讓服務管理其他未受影響區域的資源。
客戶應建立機制,透過將資源分散至不同區域 (故障域) 來管理應用程式的高可用性,並規劃災難復原。
區域失敗
在不尋常的區域災難事件中,任何潛在的問題都會被解決,並恢復 VPC 控制平面,重點在於減少資源的資料遺失。 資料平面也是透過從儲存中恢復客戶資料的狀態來還原,目標是滿足復原點目標 (RPO) 和復原時間目標 (RTO)。
在單一校園多區域 (SC-MZR) 上,資料中心災難可能會影響整個區域,因為區域之間的關係較為緊密。 服務應採用備份和復原策略至另一個 MZR,以避免資料遺失。
硬體故障
資源由可靠且通常是備援的硬體提供,但不可預見的硬體故障可能會導致這些資源癱瘓。 例如,當基礎硬體發生故障時,虛擬伺服器實例可能會失效。 在這種情況下 ,主機故障復原策略 決定了虛擬伺服器如何復原。 如果發生故障且主機故障復原原則設定為預設值 restart,控制平面會偵測到硬體故障,並將虛擬伺服器遷移到同一區域內的可用硬體,然後重
新啟動虛擬伺服器。 暫存磁碟儲存不會還原為開機磁碟區。 資料卷是可用的,但可能遺失了應用程式或作業系統快取寫入的資料,這些資料在故障發生時沒有被儲存。
區塊磁碟區由具有先進複製技術的備援硬體支援,以提高復原能力。 但是,區域災難或多重硬體故障可能會導致區塊磁碟區故障。 備份和還原是減輕資料遺失或損毀的合適方法。 此方法也可用於將資料複製到其他 IBM Cloud 區域,以減輕區域性災害的影響。 快照功能可用於支援備份和還原。 客戶也可以將應用程式分散到其他區域,以避免任何中斷,並改善 RPO/RTO。
卷儲存與相關伺服器應用程式故障之間可能存在強烈的故障關聯性。 請務必檢查和測試工作負載,以確定應用程式在儲存裝置故障時的行為。
如需有關裸機伺服器及其相關儲存設備的資訊,請參閱 Bare Metal Servers for VPC 的儲存設備概觀。 裸機伺服器上的本機磁碟無法使用快照。 客戶必須管理這些裝置的高可用性和災難復原。
建立 HA 應用程式
您可以使用 VPC 負載平衡器將傳入的要求分散到多個虛擬伺服器和裸機伺服器。 不可用的虛擬伺服器和裸機伺服器會停止回應健康檢查;負載平衡器會平衡可用資源上的負載。 您可以使用應用程式負載平衡器 (ALB) 將工作負載的流量分佈到多個區域中的虛擬伺服器,並建立即使整個區域不可用也可用的工作負載。
當 ALB 本身是配置在跨區域的子網路上時,它對單一區域故障具有彈性。 網路負載平衡器是分佈在多個底層虛擬伺服器上的區域服務,對單個虛擬伺服器故障具有彈性。
對於由 VPC 資源建構的工作負載,改善可用性的基本策略是將工作負載分散到多個資源上。 可以在一個區域內、多區域 (MZR) 中的多個區域間、或多個區域間分發資源。 如需詳細資訊,請參閱 跨多個地點和區域部署隔離的工作負載;此策略使用 IBM Cloud Internet Services (CIS) 和 Global Load Balancer。
高可用性功能
IBM Cloud VPC 支援下列高可用性功能:
| 特性 | 說明 | 考量 |
|---|---|---|
| 應用程式負載平衡器 | ALB 會跨區域將負載分派到 IP 位址。 | 工作負載必須是可擴充的。 |
| 網路負載平衡器 | NLB 會將負載分派至區域內的 IP 位址。 | 工作負載必須是可擴充的。 |
| VPC 的自動調整 | 透過動態建立虛擬伺服器實體來滿足環境的需求,從而改善效能與成本。 | 工作負載必須是可擴充的。 |
| 負載平衡器和實例群組 | 由負載平衡器前置的可擴充工作負載會將負載分派到跨區域的多個實體。 | 工作負載必須是可擴充的。 |
身為客戶,您可以建立並支援 HA:
| 特性 | 說明 | 考量 |
|---|---|---|
| 可擴充的工作負載 | 建立基於虛擬伺服器或裸金屬伺服器的工作負載,可使用更多伺服器進行水平擴充。 | 並非所有工作負載都可以水平擴充。 |
可擴充的工作負載
可擴充的工作負載可透過增加執行相同映像的伺服器來處理增加的需求。 可擴充的工作負載可透過使用負載平衡器和 Auto Scale for VPC 來實現。
災難復原架構
災難復原的策略是提供腳本自動化,以還原復原位置中的 VPC 工作負載。 例如,當一個區域不可用時,客戶有責任將該工作負載和相關資料遷移至可用的區域。 IBM 支援 Terraform 基礎架構即程式碼系統,可用於定義具有參數化位置和效能的工作負載。 客戶可使用 VPC API、SDK 及 CLI 來建立腳本,以便在發生災難時,於可用的位置恢復資源。 如需詳細資訊,請參閱 規劃災難復原。
有關使用 IBM Cloud Object Storage、提供 Terraform 即服務的 IBM Cloud Schematics 以及可部署架構的詳細資訊,請參閱在 災難復原中使用 IBM Cloud 服務。
災難復原功能
IBM Cloud VPC 支援下列災難復原功能:
| 特性 | 說明 | 考量 |
|---|---|---|
| 單卷快照 | 快照是您的開機卷或資料卷在某個時間點的副本。 Block Storage 快照儲存在區域 範例中。Cloud Object Storage | 快照獨立於來源磁碟區。 如果來源磁碟區的區域不可用,則可使用快照在區域中的不同區域建立新磁碟區。 快照可在主控台、CLI、API 或 Terraform 中依需求建立。 也可以使用 Backup for VPC 服務排程。 |
| 跨區域快照副本 | 您可以使用獨立於來源快照的跨區域快照複本來建立新磁碟區。 | 快照可以在主控台中透過 CLI 手動複製到另一區域,或透過 API 或 Terraform 程式化複製到另一區域。 您也可以在備份原則中包含在其他區域建立複本。 |
| 一致性群組快照 | 快照一致性群組包含連接至同一虛擬伺服器實體的多個 Block Storage 磁碟區的快照。 | 當您要求一致性群組的快照時,系統會為同時附加到虛擬伺服器實體的所有標記 Block Storage 磁碟區產生快照。 您可以包含或排除開機磁碟區。 不包含實例儲存。 |
| 快速還原快照 | 快速還原快照是在區域中與父區塊磁碟區一起快取的快照。 使用可開機快速還原快照建立虛擬伺服器時,伺服器會比從一般快照提供開機磁碟區更快完全運作。 | 相較於從一般快照還原,快速還原快照可實現更短的 目標恢復時間在災難復原規劃中,災難發生後,業務程序恢復的時間長度。 (RTO),但針對啟用此功能的每個區域,將按每小時額外費率計費。 |
| 檔案共用複製 | 如果來源共用不可用,您可以啟動 複製故障移轉 至副本共用。 | 您可以在同一區域的其他區中建立複製共用。 您也可以在相同地理位置的其他區域建立複本。 您可以每 15 分鐘複製一次資料。 |
從快照還原磁碟區或共用是一項需要時間的手動作業。 如果您需要更高等級的災難復原服務,請參閱 IBM Cloud 的 備份與復原服務。
身為客戶,您可以建立並支援額外的災難復原選項:
| 特性 | 說明 | 考量 |
|---|---|---|
| VPC 設定的外部真實來源 | 建構 VPC、網路和伺服器,並擷取客戶管理的設定檔,例如 Terraform 腳本、shell 腳本或程式。 | 客戶必須建立腳本,並將組態保留在可能發生災難時可以使用的地方。 |
| 客戶自訂檔案儲存備份與複製的指令碼 | 複製檔案共用的內容,使其可在其他位置使用。 | 客戶必須建立腳本或使用客戶管理的持續備份和還原。 |
| 由客戶管理的區塊卷和檔案儲存的持續備份和還原 | 客戶可在伺服器上安裝第三方代理和作業系統驅動程式,與 Veeam 等備份和復原系統整合。 | 客戶必須安裝和管理第三方備份和復原解決方案。 |
規劃災難回復
災難復原步驟必須定期練習。 當您建立計劃時,請考慮以下的失敗情況和解決方案。
| 失敗 | 解決方法 |
|---|---|
| 開機磁碟區故障 | 您可以從 您的磁碟區建立的自訂映像 建立新磁碟區。 或者,您可以 從控制台中的快照、從 CLI、使用 API、Terraform 或使用客戶管理的持續備份和還原解決方案還原磁碟區。 當您從快照還原開機磁碟區時,當資料從「快照」複製到開機磁碟區時,效能可能會下降。 透過使用 快速還原快照,您可以比從一般快照還原更快地達成 復原時間目標在災難復原規劃中,災難發生後,業務程序恢復的時間長度。 (RTO),因為所有資料都是可用的,而且不會影響效能。 |
| 資料卷故障或資料損毀 | 使用控制台中的 快照、CLI、API、Terraform 或使用客戶管理的持續備份和還原解決方案還原磁碟區。 資料卷也可使用 快速還原快照。 |
| 檔案共用資料損毀 | 您可以建立檔案共用快照,以在特定時間點保留檔案共用上的資料。 然後,如果檔案共享的內容被意外刪除或覆蓋,您可以 從檔案共用快照還原資料。 |
| 檔案共用失敗 | 透過啟動故障移轉至另一區域中的現有副本來緩解。 測試故障移轉程序,瞭解所需時間。 |
| 虛擬伺服器故障 | 使用負載平衡器的高可用性功能和 VPC 的自動擴充功能,創建可擴充的工作負載,從而緩解問題。 可能需要重新啟動虛擬伺服器。 可能需要解決區塊磁碟機故障。 |
| 裸機伺服器故障 | 由客戶管理的備份與還原解決方案。 |
| 區域故障 | 使用負載平衡器的高可用性功能和 VPC 的自動擴充功能,創建可擴充的工作負載,從而緩解問題。 使用伺服器故障解析和區塊卷故障解析,為 VPC 區域組態使用外部真實來源,以在可用區域中建立資源。 |
| 區域失敗 | 使用 VPC 區域組態的外部真實來源,在可用的區域中建立資源。 使用伺服器故障解析,將磁碟區和檔案儲存還原為先前的值。 |
您在高可用性和災難復原方面的責任
有關背景,請參閱 使用虛擬私有雲時瞭解您的責任。 您有責任持續測試您的 HA 和 DR 計劃。 如需更多資訊,請參閱「災難復原測試」。
網路連線中斷和服務短暫無法使用的情況可能會發生。 您有責任確保應用程式原始碼包含 用戶端可用性重試邏輯,以維持應用程式的高可用性。
您可以使用下列核對表來幫助您建立和實踐您的計劃。
-
區塊卷快照
-
檔案儲存複製
-
VPC 設定的外部真實來源
變更管理
變更管理包含諸如升級、配置變更及刪除等任務。
授予使用者和程序工作所需的最少權限的 IAM 角色和動作。 如需詳細資訊,請參閱 如何防止意外刪除服務?
在變更基礎結構組態之前,請考慮建立手動備份。
IBM® 如何協助支援災難復原規劃
IBM® 如果發生災難,為 採取特定的復原行動。IBM Cloud VPC
如果單一主機意外故障,故障主機上的虛擬伺服器可以自動在健康的主機上重新啟動。 如需有關 IBM 如何監控基礎結構及回應主機故障的詳細資訊,請參閱 主機故障復原政策。
IBM 如何從區域故障中復原
自然災害、停電等基礎設施問題、刪除資訊的意外或惡意行動,或含有錯誤的軟體更新,都可能導致區域故障。包含錯誤或錯誤的軟體更新。 若某個區域發生故障,IBM 將致力於恢復設施與資料中心、實體網路與裝置、 實體儲存裝置、實體伺服器與記憶體,以及虛擬化平台。 如需詳細資訊,請參閱 使用 IBM Cloud 產品的共同責任。
IBM 如何從區域故障中復原
當整個區域發生故障時,IBM 將再次著手恢復設施與資料中心、實體網路與裝置、實體儲存裝置、 實體伺服器與記憶體,以及虛擬化平台。 如需詳細資訊,請參閱 使用 IBM Cloud 產品的共同責任 和 災難復原常見問題。
如果 IBM 無法還原服務實例,您必須按照 災難復原架構 中所述的方式還原服務。
IBM 如何維護服務
對虛擬伺服器、主機和資料中心執行例行維護時,會遵循例行協議。 如需詳細資訊,請參閱 瞭解雲端維護作業。
所有升級都遵循 IBM 服務最佳實務,包括恢復計劃和回滾流程。 定期維護可能會造成短暫中斷,但 客戶端可用性重試邏輯 可減緩中斷情況。 IBM 會在缺陷出現的第一時間恢復更新。
使用功能旗標啟用或停用複雜變更,以控制曝光。
影響客戶工作負載的變更詳列於 IBM Cloud 通知中。 如需有關影響此服務的計劃維護、公告和發佈說明的詳細資訊,請參閱 監控通知和狀態。