瞭解 Event Streams 的高可用性及災難回復

高可用性服務或工作負載承受故障並根據某些預先定義的服務等級繼續提供處理能力的能力。 對於服務而言,可用性是在服務等級協議中定義的。 可用性包括計劃內和計劃外的事件,例如維護、故障和災難。 (HA) 是指服務在發生意外故障時仍能維持運作和存取的能力。 災難復原服務或工作負載從罕見的重大事故和大規模故障(如服務中斷)中恢復的能力。 這包括影響整個區域的實體災難、資料庫損毀或對工作負載有貢獻的服務遺失。 其影響超出了高可用性設計的處理能力。是將服務實例還原到工作狀態的過程。

IBM® Event Streams for IBM Cloud® 是一項全球性服務,您可以在 服務和基礎結構可用性(依地點分類 )文件中找到可用的區域和資料中心位置。 作為一項全局服務,Event Streams 可透過標準與企業計劃達成已定義的 服務層級目標(SLO )。 SLO 並非保證書,IBM® 不會因未達到目標而給予學分。

高可用性架構

架構
Event Streams 高可用性架構

高可用性功能

Event Streams 支援下列高可用性功能:

Event Streams 的 HA 功能
特性 說明 考量
多區域重新部署 分佈在三個可用性區域,提供容錯與高可用性 在 Event Streams 中,每個分區的資料會分佈在三個可用區域 (針對 MZR 部署),以確保在一個可用區域資料遺失時的業務連續性。
保持同步抄本數下限 任何時候都需要至少兩個同步複製本 Event Streams監控並確保至少兩個複本在不同可用性之間同步,以確保訊息不會在代理程式或區域故障時遺失,從而確保重要資料的持久性。

災難復原架構

架構
Event Streams 災難復原架構

災難復原功能

Event Streams 支援下列災難復原功能:

Event Streams 的 DR 功能
特性 說明 考量
鏡映 群集複製的鏡像 Event Streams 提供鏡像功能,可將一個 Event Streams 實例中的訊息持續複製到第二個實例中。 您可以使用 Event Streams 鏡像功能,或選擇管理您自己的鏡像解決方案。

Event Streams 的鏡射

鏡像功能可讓一個 Event Streams 服務實體中的訊息持續複製到第二個實體。 應用程式的復原能力可透過使用鏡像來改善,因此如果第一個服務實體無法使用,應用程式可以重新連線到第二個實體,繼續正常運作。

此功能是完全管理服務的一部分,且僅可在使用 Event Streams服務實體之間使用。企業方案。

  1. 鏡像的功能:
  • 在兩個 Event Streams 服務實體之間鏡射主題、訊息資料和消費者群組偏移量,這些服務實體可以配置在不同的 IBM Cloud® 帳戶中。
  • SLA 的可用性為 99.99,與 Event Streams 服務一致。
  • 可使用 IBM Cloud® Monitoring 進行監控。
  1. 鏡像的限制:
  • 單向:資料一次只能在一對服務實體之間單向鏡射。 這表示鏡像提供「主動-被動」式的高可用性,而非「主動-主動」式。
  • 異步:訊息必須成功產生到來源實體,才能鏡射到目標實體。 這表示當故障發生時,可能會遺失一些訊息資料。
  • 最少消費一次訊息:當消費者在實體間移動時,可能需要重新處理已經處理過的訊息。

規劃災難回復

災難復原步驟必須定期練習。 當您建立計劃時,請考慮以下的失敗情況和解決方案。

Event Streams 的災難復原方案
失敗 解決方法
硬體故障(單點) Event Streams 對於區域內的單點硬體故障具有彈性 - 無需設定。
區域故障 部署在多區域的 Event Streams 實例對單一區域的故障具有彈性 - 無需設定。 對於單一區域部署,請設定另一個 Event Streams 群集作為鏡射對,以避免區域故障。
資料毀損 Event Streams 不包含任何內建的資料損毀復原機制。 作為災難復原計劃的一部分,您需要為這種情況制定計劃,並可能需要使用鏡像功能或配置新的實例。
區域失敗 如果您在多區域配置了 Event Streams 實例,發生區域災難的可能性不大。 如果發生區域故障,您必須在其他區域設定新的實例。 如需詳細資訊,請參閱 瞭解您的責任

您對 HA 和 DR 的責任

以下資訊可協助您建立並持續實作 HA 和 DR 的計劃。

當您使用 Event Streams 時,請務必瞭解您的管理責任和條款。 客戶責任 頁面有助於作為建立高可用性和災難恢復計劃的起點。

作為災難復原的一部分,建議您授予使用者和程序其工作所需權限最少的 IAM 角色和動作。 如需詳細資訊,請參閱 如何防止意外刪除服務?

所有 Event Streams 計劃 ( Satellite 除外) 都可以在三天的回收期內復原已刪除的實例,三天後資料將不可逆转地銷毀。 您可以使用 IBM Cloud CLI 檢查填海的狀態,並強制或取消排程的填海。

如果 Event Streams 無法還原服務實體,則必須按照 災難復原情境中的鏡 像中所述進行還原。

IBM 如何維護服務

所有升級都遵循 IBM 服務最佳實務,並有復原計劃和回滾程序。 新功能的定期升級和維護是正常作業的一部分。 此類維護偶爾會造成短暫的中斷,這些中斷會由 用戶端可用性重試邏輯 處理。 變更會依序推出,在區域內依區域逐一推出。 只要一有缺陷的跡象,更新就會被退回。

使用功能旗標啟用或停用複雜變更,以控制曝光。

影響客戶工作負載的變更會在通知中詳細說明。 如需詳細資訊,請參閱會影響Event Streams計劃維護、公告和 發行說明監控通知與狀態