主動作業
產品停售:自 2025 年 10 月 31 日起,新客戶將無法再部署 VMware Solutions 相關服務。 現有客戶仍可繼續在 IBM Cloud® 上使用並擴展其有效的 VMware® 工作負載。 如需詳細資訊,請參閱 IBM Cloud 上 VMware 的結束行銷。
這些主動檢查的目的是讓系統管理員能夠將其 VMware Cloud Foundation for Classic - Automated 範例維持在健康狀態。 每日執行時,可避免許多與使用、容量和效能問題相關的常見問題影響您的工作負載。 這些主動檢查可分為下列結構。
- 性能 - 檢查指出目前影響環境性能的問題,需要立即注意,以將影響降到最低,亦即硬體故障。
- 風險 - 檢查顯示並非即時威脅,但必須盡快處理的問題。 例如,容量問題。
- 效率 - 檢查指出要改善效能或收回資源的區域。 例如,正確調整虛擬機器 (VM) 及叢集大小。
透過 IBM Cloud® 上的作業管理,這些主動式任務中的許多任務都可以變得更簡單,並減少管理時間。
了解您的「基線」是很重要的。 這個基準線反映您環境中的正常作業。 所有客戶端都有不同的基準,該基準由其標準實踐、在VCF for Classic - Automated實例上運行的工作負載等決定。 然後,這些主動檢查將最近的容量/效能/利用率與該基準進行比較。 這些主動使用情況檢定回答了以下四個問題。
- 我現在是否過度使用?
- 我很快就會耗盡容量嗎?
- 我的叢集對於預期尖峰使用期間是否太小?
- 是否可以收回虛擬基礎架構中的未用資源?
準則
下列準則可協助您主動維護穩定環境:
- 針對您計劃執行的所有 VM 配置足夠的資源,來規劃 VM 部署。 別忘了允許 vSphere ESXi™ 本身的資源。
- 正確調整 VM 的大小,並僅向每個 VM 配置其所需的虛擬資源量。 佈建超過所需資源的 VM,可能會降低相同主機上該 VM 及其他 VM 的效能。
- 一般而言,80% 的主機 CPU 使用率是合理的上限,而 90% 則是 CPU 接近過載狀況的警告。 如果您的主機 CPU 使用率接近 80%,請配置更多的主機。
- 一般而言,80% 的主機 RAM 使用量是合理的上限,90% 則是主機已完全使用的警告。 如果您的主機已接近 80% 的 RAM 使用量,請配置更多的主機。
- 很重要的是不要配置不足的記憶體,因此請配置足夠的記憶體來保留您計劃要在 VM 中執行之應用程式的工作集,以盡量減少衝擊。 衝擊可能會明顯地影響應用程式效能。 不過,也要避免過度配置記憶體。
- 只有在環境中需要時,才會使用資源設定、保留、共用及限制。 如果您預期經常變更可用資源總計,請使用共用(而非保留),在 VM 之間平均地配置資源。 只有當存在資源爭用時,共享才生效。
- 如果您確實需要使用保留,請將它們配置為指定可接受的 CPU 或記憶體數量下限,而不是您想要使用的數量。
- 使用資源儲存區進行委派的資源管理,以及完整隔離資源儲存區,以將資源儲存區類型設為「固定」,並使用「保留」和「限制」。
- 將多層服務的虛擬機器分組到資源池中,從而可以為整個服務分配資源。 請小心選取 VM 的資源設定(亦即,保留、共用及限制)。 將保留設定得太高,可能會使群集中未保留的資源很少,因而限制 DRS 必須平衡負載的選項。
- 設定限制太低,可能會讓 VM 無法使用叢集裡可用的額外資源來改善其效能。
- 在資源使用率不超過 80% 的情況下執行叢集,以容許使用 VMware Update Manager 來補救主機。 當叢集以最多 80% 的使用率執行時,叢集修復最有可能成功。
- 儲存的精簡配置會增加維護環境的管理工作量,因為您在容量管理過程中需要小心謹慎。
- 分析 VM 成長狀況,並瞭解基礎架構的使用如何達到支援此成長、訂購更多容量以加速此成長。
- 使用可用容量,這考慮到高可用性和緩衝區,而不是總可用容量。
- 確保您正在執行系統可用的最新版本 BIOS。
- 確保您對已安裝的產品執行目前的 VMware 更新,包括虛擬機器硬體和虛擬機器工具。
作業清單
| 標題 | 說明 |
|---|---|
| 性能 | 使用 vCenter,檢查所有主機及 VM 物件的性能。 有條理地逐步檢查尋找警報的群集、主機、資料庫、虛擬機器和網路。 |
| 警示及通知檢查 | 檢查以確認vCenter中不存在任何您不知道的活動警報。 依預設,vCenter 具有一些安裝時定義的警示。 這些警報可能會提醒您注意問題。 但是,預設情況下,這些警報僅在VMware vSphere® Web Client 中發出警告或警報。 它們可以配置為通知,例如電子郵件。 當您檢查主機和虛擬機器物件的健康狀況時,請檢閱警示,決定是否需要通知,並根據需要進行設定。 只有最重要或關鍵的問題才需要通知您。 請考慮下列情況:我希望在凌晨 2 點收到有關此問題的通知,還是可以等到正常工作時間? 太多的通知會被視為「雜訊」,而人的本性就是會忽略所有警示。 |
| 叢集CPU和記憶體容量及利用率檢查 | 查看叢集的 CPU 和記憶體的容量和使用率指標。 使用vCenter依序導航到每個叢集並選擇“監控”,然後選擇“效能”。 請檢閱圖形及統計資料,以確保叢集有足夠的資源可滿足需求。 您必須以需求為基礎,維持足夠的容量,讓虛擬機器在需要時爆發、讓 vSphere ESXi 主機發生故障,以及讓虛擬機器根據您已知的服務需求增加。 |
| 資料儲存容量和使用率檢查 | 查看資料儲存的容量和使用率指標。 使用vCenter依序導航至每個資料儲存並選擇「監控」、「效能」、「空間」。 請檢閱圖形及統計資料,以確保資料儲存庫有足夠的空間可滿足需求。 需求應基於維持足夠的 vSphere ESXi 主機故障容量 (對於 vSAN™ 叢集而言),並根據您已知的服務要求增加虛擬機器。 |
| 資料儲存庫效能檢查 | 查看資料儲存的效能指標。 使用vCenter依序導航至每個資料儲存並選擇:監控、效能、效能、即時。 請檢閱圖形及統計資料,以確保出現預期資料儲存庫效能基準線,且可以說明所有變更。 請調查所有異常狀況。 |
| 裸機伺服器韌體 | 最佳實務建議為您的裸機伺服器主機安裝最新的韌體更新。 使用IBM Cloud入口網站中的更新韌體選項檢查裸機伺服器主機上的韌體更新。 在顯示的頁面上,檢視系統板和硬碟機的目前和更新版本,並查看是否有可用的更新。 如果是,請規劃在下一個維護時段更新韌體。 如需詳細資訊,請參閱 常見問題:裸機伺服器。 |
| vSphere ESXi 修補 | 有關檢查 vSphere ESXi 修補程式可用性的詳細資訊,請參閱 建立基線和附加到清單物件。 |
| VM 硬體更新 | 如需檢查虛擬機器硬體更新可用性的詳細資訊,請參閱 建立基線和附加到清單物件。 |
| VM 工具更新 | 如需相關資訊,請參閱建立基準線並連接至庫存物件。 |
| vSphere vSAN 修補 | 有關檢查 vSphere vSAN 修補程式的可用性以及修補程式流程的詳細資訊,請參閱 更新 vSAN 群集。 |
| VMware vCenter®修補 | 有關檢查 vCenter 修補程式的可用性以及套用更新的詳細資訊,請參閱 VCSA 更新與 SSO 連結 vCenters。 |
| 更新 NSX | 如需檢查 NSX 修補程式可用性及套用升級的相關資訊,請參閱NSX 修補。 |
| 不使用 VM 工具檢查 VM | 最佳作法是安裝 VM 工具,因為這容許與 OS 進行更大的互動,例如循序關閉 VM 的電源。 您可以使用 vCenter 檢查哪些虛擬機器沒有安裝 VM Tools。 移至叢集、選取相關物件、VM,然後是表格中啟用以執行 VM Tools 的直欄及 VM Tools 版本。 檢閱清單並根據需要安裝 VM 工具。 |
| 具有 Snapshot 的 VM | 有關使用快照時的最佳作法的詳細資訊,請參閱 在 vSphere 環境中使用快照的最佳作法(1025279)。 識別具有 Snapshot 的 VM 是否存在很重要,因為使用單一 Snapshot 超過 72 小時會建立一個大小持續成長的 Snapshot 檔案,可能導致 Snapshot 儲存空間位置耗盡空間,並影響系統效能。 若要檢視具有快照的虛擬機器,請使用 Web Client 連線至 vCenter,選取 vCenter,並移至「相關物件」索引標籤。 用滑鼠右鍵按一下欄標題,進入 Show/Hide Columns(顯示/隱藏欄)清單。 從列清單中選擇 Needs Consolidation(需求整合 )選項。 此直欄會顯示目前執行中的所有 VM 的摘要。 |
| AD/DNS OS 修補 | Microsoft® Active Directory™ (AD) / 網域名稱伺服器 (DNS) 會自動設定為只下載更新。 如需相關資訊,請參閱其他限制及考量,以進一步更新建議。 |
| 檢查儲存空間延遲 | 檢查儲存空間延遲,以瞭解對 vSphere ESXi 主機存取資料儲存庫的所有變更。 延遲過高會導致在 VM 中管理的應用程式速度變慢。 在vCenter,前往「效能」標籤。 在每個資料儲存上,查看每個虛擬機器的平均寫入延遲。 |
| 檢閱具有虛擬裝置的 VM | 虛擬裝置(例如,CD 或軟式磁碟機)會產生額外負擔,因此請移除 VM 不需要的任何裝置。 |
| vSAN 容量建議 | 當叢集中的任何容量裝置達到 80% 滿載時,vSAN 會自動重新平衡叢集,直到所有容量裝置上的可用空間低於臨界值為止。 下列作業可能會導致磁碟容量達到 80% 並起始叢集重新平衡:硬體故障、使用「撤除所有資料」選項讓 vSAN 主機進入維護模式,或獲指派 PFTT=0 的物件駐留在主機上時,使用「確保資料存取性」讓 vSAN 主機進入維護模式。 若要提供足夠的空間來進行維護及重新保護,並將 vSAN 叢集裡的自動重新平衡事件減到最少,請考慮隨時保留 30% 的可用容量。 |
| 叢集使用率檢查 | 使用vCenter,檢查每個叢集並確定哪些叢集的 CPU 和 RAM 利用率為 50% 或更高。選擇 50% 作為警告級別,以集中註意此叢集可能會因更多主機或叢集而擴展。 50% 的使用率與最高 80 - 90% 的使用率之間的差異,就是您因服務要求而增加虛擬機器的空間。 在達到 50% 的限制時,應該考慮不久的將來的要求,並預測何時需要新增更多資源。 |
| 叢集合併檢閱 | 使用vCenter,檢查每個叢集並確定哪些叢集的 CPU 和 RAM 利用率為 30% 或更低。選擇 30% 作為警告級別,以透過刪除主機或刪除此叢集並將虛擬機器移至另一個叢集來關注此叢集的潛在正確規模調整。 |
| 正確調整大小過大的 VM | 使用簡單方法將大小過大的 VM 調整為正確大小:對需求趨勢進行識別、側寫並調整以及監視。 使用 vCenter 識別可能需要進行正確大小調整的大型 VM。 導覽至「監視」>「效能」,以及側寫一段時間之工作負載的平均 CPU 和 RAM 需求設定檔,並調整虛擬資源。 最後,繼續監視工作負載,以查看效能可接受。 理想情況下,使用的 VM 的記憶體數量應該接近來賓 OS 所使用的記憶體,再加上執行 VM 的額外負擔。 |
| 正確調整大小過小的 VM | 使用簡單的方法來調整大小不足的虛擬機器。 首先,識別然後分析和調整,然後監控需求趨勢。 確定需要正確調整大小的小型 VM。 側寫一段時間之工作負載的平均 CPU 和 RAM 需求設定檔,並調整虛擬資源。 最後,繼續監視工作負載,以查看效能可接受。 理想情況下,使用的 VM 的記憶體數量應該接近來賓 OS 所使用的記憶體,再加上執行 VM 的額外負擔。 |
| 檢查 VM 硬體裝置相容性 | 使用 VMware 硬體相容性線上資源,檢查您虛擬機器的硬體資源 (例如網路和儲存裝置) 是否支援該作業系統。 如果不支援,請更換為支援的裝置,以提高可靠性和效能。 |