瞭解 IBM Cloud Logs 的高可用性及災難回復

高可用性服務或工作負載承受故障並根據某些預先定義的服務等級繼續提供處理能力的能力。 (HA) 是指服務在發生意外故障時仍能維持運作和存取的能力。 災難復原服務或工作負載從罕見的重大事故和大規模故障(如服務中斷)中恢復的能力。 這包括影響整個區域的實體災難、資料庫損毀或對工作負載有貢獻的服務遺失。 其影響超出了高可用性設計的處理能力。是將服務實例還原到工作狀態的過程。

IBM Cloud Logs 是高度可用、多租戶、區域性的服務,您可以在 位置 文件中找到可用的區域和資料中心位置。 作為一項區域服務,IBM Cloud Logs,以「標準」計畫實現已定義的 服務等級目標(SLO)。 SLO 並非保證書,IBM 不會因未達到目標而給予學分。

服務層級目標 (SLO) 描述 IBM Cloud 服務在設計上要達到的設計點。IBM Cloud Logs 在設計上要達到下列可用性目標。

SLO 為 IBM Cloud Logs
可用性目標 目標值
可用性百分比 99.99%

高可用性架構

顯示 IBM Cloud Logs 高可用性架構的圖表
高可用性架構

可用性區域是 IBM Cloud 區域內一個邏輯上和實體上隔離的位置,您的資料就是在此處處理和託管。

  • 可用性區域擁有獨立的電源、冷卻和網路基礎設施,與其他區域隔離,避免區域間出現單點故障,以加強容錯能力。
  • 可用性區域在區域內提供高頻寬和低區域間延遲。

區域 (位置) 是一組地理上和實體上獨立的一個或多個可用性區域,具有與其他區域隔離的獨立電力和網路基礎設施。

  • 區域的設計可移除與其他區域共用的單點故障,並確保區域內的低區間延遲。
  • 每個區域都有 3 個不同的資料中心 (DC),以提供備援。

高可用性功能

IBM Cloud Logs 支援下列高可用性功能:

HA 功能用於 IBM Cloud Logs
特性 說明
多區域部署 IBM Cloud Logs 只部署到多區域 (MZR),而在一個 MZR 中,資料平面群集跨越所有三個區域,確保一個區域的損失不會影響服務可用性。
IBM Cloud Logs 跨區資源複製 所有 IBM Cloud Logs 資源,例如警示、度量與日誌,都會複製到 MZR 內的三個區域。 這可確保資料在區域遺失時仍能保留。
有效性 / 準備狀態監控 所有微服務都透過 Kubernetes liveness 和 readiness probes 進行監控。

災難復原架構

顯示 IBM Cloud 災難復原架構的圖表
災難復原架構

IBM Cloud Logs 是建基於 上的 VPC,它使用多區域 (Multi Zone Regions),並將所有工作節點分散到三個區域。Red Hat OpenShift on IBM Cloud VPC 負載平衡器會處理傳入的流量,並將它們轉送至群集中執行的服務網狀結構。

沒有自動跨區域故障移轉或跨區域災難復原。 如果一個區域中的所有可用區都發生故障,則 IBM Cloud Logs 在該區域中將不可用。

災難復原功能

IBM Cloud Logs 支援下列災難復原功能:

DR 功能適用於 IBM Cloud Logs
特性 說明
替代區域 可使用執行於替代區域的服務,與主服務分開
資料庫備份 儲存目前資料集的副本

DR 規劃

DR 步驟必須定期練習。 當您建立計劃時,請考慮以下的失敗情況和解決方案。

的 DR 應用程式 IBM Cloud Logs
失敗 解決方法
硬體故障(單點) IBM 提供可避免區域內單點硬體故障的資料庫 - 無需設定。
區域故障 IBM Cloud Logs 使用多區域部署,可避免區域故障點。
資料毀損 在資料損毀的情況下,資料庫會回滾到備份站點中最後可用的穩定狀態。 我們使用 IBM Cloud Object Storage 備份進行復原,請參閱 備份
區域失敗 遵循 您對 HA 和 DR 的責任 下的步驟

您對 HA 和 DR 的責任

IBM Cloud 有業務連續性企業能夠根據預先定義的服務水準合約,承受中斷並正常運作關鍵任務服務而不中斷。計劃,可在發生災難時於數小時內恢復服務。 您必須負責資料備份及相關內容的復原。

在重大的區域災難中,例如地震、洪水或龍捲風,整個區域都可能受到影響。

若要復原 IBM Cloud Logs 範例,您必須提供新的 IBM Cloud Logs 範例,並重新建立 IBM Cloud Logs 資源。 您還必須為 IBM Cloud Object Storage 與該實體關聯的儲存桶,以及可能已設定為觸發通知警示的 IBM Cloud Event Notifications 實體,設定 DR 策略。

為了確保您的工作負載能夠適應此類事件,請完成下列步驟:

  1. 定義區域策略,您可以在此還原已停機的組態。

    選擇復原區域時,請檢查您的資料區域和合規要求。

    有關地點的詳細資訊,請參閱:

  2. 如果您有不使用 Terraform 的配置,請使用 API 備份您目前的配置。 如果您使用 Terraform,請儲存您的 Terraform 腳本,以協助您重新建立宕機區域。 考慮使用版本控制系統儲存備份檔案或 Terraform 指令碼。

    您可以使用 Terraform 創建 IBM Cloud Logs 實例。 請參閱 資源管理 Terraform 資源。

    您可以使用 Terraform 創建 IBM Cloud Logs 資源。 請參閱 IBM Cloud Logs Terraform 資源。

    您可以使用 Terraform 建立您的資料桶、度量值桶,或兩者皆有_跨區域_彈性,以跨多個地理區域儲存和存取資料,並確保高可用性、耐用性和災難復原能力。 請參閱 IBM Cloud Object Storage Terraform 資源。

    您可以使用 Terraform 創建 IBM Cloud Event Notifications 資源。 請參閱 IBM Cloud Event Notifications Terraform 資源。

    您可以使用 Terraform 建立 IAM 授權和權限。 請參閱 IAM Terraform 資源。

    務必測試您是否可以將備份組態還原到其他區域。

如果發生區域災難,您必須完成下列步驟,才能在新的區域中復原您的實體:

  1. 確定要還原 IBM Cloud Logs 範例的替代區域。

  2. 建立新的 IBM Cloud Logs 範例。 如需相關資訊,請參閱佈建實例。

  3. 如果您的實例已設定資料或度量儲存桶,請完成下列步驟:

    • 如果您在災難區域中的 IBM Cloud Logs 使用_跨區域_ IBM Cloud Object Storage (COS) 儲存桶,您可以將相同的儲存桶附加到新的 IBM Cloud Logs 實體,但您無法使用新 IBM Cloud Logs 實體的儀表板或 CLI 查詢在災難區域中的 IBM Cloud Logs 實體上建立的資料。 您只能查詢在新區域擷取的資料。 您可以下載並檢視宕機區域的現有資料。 有關存檔資料結構的詳細資訊,請參閱 直接從存檔查詢資料。

    • 如果您需要使用新建立的 IBM Cloud Logs 實例的儀表板或 CLI 存取災難區 IBM Cloud Logs 實例的日誌,請 聯絡 IBM 支援。 如需有關 IBM Cloud Object Storage 災難復原策略的詳細資訊,請參閱 跨區域端點、 資料安全性、建立安全的 Content Store,以及 使用複製以達到業務持續性和災難復原。

    • 如果您使用受影響區域的本地或區域儲存庫,請建立新的儲存庫。 將儲存桶附加到新的 IBM Cloud Logs 實例。 有關更多信息,請參閱 配置資料儲存桶 和 配置指標資料儲存桶。

    • 定義 IBM Cloud Logs 範例和儲存桶之間的 IAM 授權。 如需詳細資訊,請參閱 建立 S2S 授權,以授予水桶存取權。

    如果您位於災難影響區域的實體未設定 IBM Cloud Object Storage buckets,則會遺失日誌和度量資料。

  4. 如果您的實例已設定警示,請完成下列步驟:

  5. 在新的 IBM Cloud Logs 範例中重新建立資源。

    建立檢視。

    建立儀表板。

    建立警示。

    建立 TCO 政策。

    建立解析規則。

    建立事件的指標。

    啟用資料使用。

    設定資料規則。

    設定資料豐富化政策。

為了更容易復原 IBM Cloud Logs 的實體,請使用 Terraform 來管理您的實體、組態和 IAM 存取權限。 使用 Terraform 可以省去在其他區域設定實體時的手動步驟。

恢復實體後,您必須重新設定資料來源,以便將記錄傳送至新實體:

  1. 如果新區域已設定 IBM Cloud Logs Routing 租戶,則必須使用該區域關聯的目前目標來檢視和監控平台日誌。 如果新區域未設定 IBM Cloud Logs Routing 租戶,請建立 IBM Cloud Logs Routing 租戶,以引用您的新 IBM Cloud Logs 範例。 請參閱 「建立 IBM Cloud Logs Routing 租戶」和 「瞭解高可用性與災難復原」,以瞭解 IBM Cloud Logs Routing。

  2. 如果新區域有 IBM Cloud Activity Tracker Event Routing 設定,可從停機的區域收集活動追蹤事件,您就可以使用現有的設定來檢視和管理事件。 如果新區域沒有 IBM Cloud Activity Tracker Event Routing 設定從宕機區域收集活動追蹤事件,則必須新增一條規則,指出要在何處及如何收集事件。 如需詳細資訊,請參閱 建立可抵抗區域災難的路由設定。

  3. 重新設定 記載代理程式,指向 IBM Cloud Logs 復原區域的 攝取端點。

要了解有關您和 IBM Cloud 之間使用 IBM Cloud Logs 的所有權責任的更多信息,請參閱 了解使用 IBM Cloud Logs 時的責任。

復原時間目標 (RTO) 和復原點目標 (RPO)

IBM Cloud Logs 提供保護資料和恢復服務功能的方法。 制定業務連續性計畫以實現服務的目標 復原點目標在災難復原規劃中,還原資料的時間以時間 (秒、分、小時) 計算,從已復原的實體開始,到災難發生點為止。 (RPO) 和 復原時間目標在災難復原規劃中,災難發生後,業務程序恢復的時間長度。 (RTO)。 下表概述了 IBM Cloud Logs 的目標。

的 RPO 和 RTO IBM Cloud Logs
災難復原目標 目標值
RPO 4 小時內
RTO 24 小時內

變更管理

變更管理包括升級、組態變更和刪除等工作。

建議您賦予使用者和程序其工作所需的最低權限的 IAM 角色和動作。 請參閱 如何防止意外刪除服務?

如果您的配置不使用 Terraform,請考慮在升級到新版本 IBM Cloud Logs 之前使用 API 建立備份。

IBM® 如何支援災難復原規劃

  • IBM® 每年對各種災難情況進行測試,並根據測試結果持續改進我們的復原文件。

  • IBM® 災難發生時,隨時待命的主題專家可為客戶提供 24 × 7 全球支援。

    所有 IBM® 的主題專家每年都會接受有關業務連續性和災難復原政策與程序的訓練,以確保在發生災難時能做好準備。

IBM Cloud Logs 是一項高度可用的區域服務。

  • 如需有關 IBM Cloud Logs 可用區域的詳細資訊,請參閱 地點。
  • 每個區域都有三個不同的備援資料中心,以 active/active 模式設定。
  • 如果某個地點的所有資料中心都發生故障,該地點的 IBM Cloud Logs 將無法使用。
  • 在每個支援的區域中,流量會在多個可用區域的基礎架構中進行負載平衡,不會出現單點故障。

下表列出 IBM Cloud Logs 服務所在區域 (位置) 的高可用性 (HA) 狀態:

提供服務的地點清單
地理 地區 歐盟支援 HA 狀態
亞太地區 大阪 (jp-osa) 不適用 MZR
亞太地區 悉尼 (au-syd) 不適用 MZR
亞太地區 東京 (jp-tok) 不適用 MZR
歐洲 法蘭克福 (eu-de) 是 MZR
歐洲 倫敦 (eu-gb) 否 MZR
歐洲 馬德里 (eu-es) 是 MZR
北美洲 多倫多 (ca-tor) 不適用 MZR
北美洲 蒙特婁 (ca-mon) 不適用 MZR
北美洲 達拉斯 (us-south) 不適用 MZR
北美洲 華盛頓(us-east) 不適用 MZR
南美洲 聖保羅 (br-sao) 不適用 MZR

其中

  • _地理區域_是指包含一個或多個區域的地理區域或較大的政治體。
  • _區域_是界定的地理區域。
  • 區域可以是特定的郵遞區號、城鎮、城市、州、州群組,甚至是國家群組。
  • 一個區域包含 多個可用性區域,以滿足該區域的本機存取、低延遲和安全性需求。
  • MZR 表示多區域。 進一步瞭解資訊。

如需更多關於區域和資料中心內服務可用性的資訊,請參閱 依地點劃分的服務和基礎結構可用性。

IBM Cloud Logs 在某個區域管理的資料會保存在該區域附近的資料中心。

多區域 (MZR) 由 3 個或更多可用區域組成,這些可用區域彼此獨立,以確保單一故障事件只會影響單一區域。

預設情況下,IBM Cloud Logs 部署在 3 個區域。 每個區域設定為 active/active/active:

  • 每個區域都位於區內不同的資料中心。
  • 每個區域的資料會以低延遲自動複製到其他區域。 您不需要做任何事情來啟用複製。
  • 服務的設計可承受單一區域故障而不中斷。

MZR 架構提供區域內區域間的自動故障移轉,以及區域內 IBM Cloud Logs 部署的高可用性。

IBM Cloud Logs 管理的元資料包括客戶元資料,例如關鍵設定資訊 - 金鑰、警示定義、e2m 定義、度量資料等。

IBM Cloud Logs 定期備份每個區域的資料:

  • 每日進行定期備份,保留 30 天,並儲存在跨區域的 IBM Cloud Object Storage 資料桶中
  • 連續增量備份會保留最近 7 天的資料。

如果整個區域發生故障,備份資料仍然可用,然後作為 IBM Cloud Logs 服務還原的一部分進行還原。

IBM 如何從區域故障中復原

如果區域發生故障,IBM Cloud 將解決區域中斷的問題。 由於資料平面橫跨一個區域中的所有三個區域,因此不會對服務可用性造成影響,而且全局負載平衡器會恢復向恢復的區域傳送資料。 目前不需要客戶採取任何行動。

IBM 如何從區域故障中復原

故障後還原區域時,IBM 會嘗試從區域狀態還原服務實體。 如果區域狀態已損毀,服務會還原至最後一次內部備份的狀態,該備份會持續串流至服務管理的跨區域 IBM Cloud Object Storage 資料桶中的備用資料站。 如果備份資料已損毀,可能會造成 24 小時的資料遺失。 這些備份無法用於客戶管理的災難復原。

如果 IBM 無法還原服務實例,客戶必須按照 災難復原架構 中所述的方式進行還原。

IBM 如何維護服務

所有升級都遵循 IBM 服務最佳實務,並有復原計劃和回滾程序。 新功能的定期升級和維護是正常作業的一部分。 此類維護偶爾會造成短暫的中斷間隔,由用 戶端可用性重試邏輯 處理。 變更會依序推出,在區域內依區域逐一推出。 只要一有缺陷的跡象,更新就會被退回。

影響客戶工作負載的變更會在通知中詳細說明。 如需詳細資訊,請參閱影響此服務的計劃維護、公告和發佈說明的 監控通知與狀態。