使用抽樣來優化指標

使用取樣來分析資料的子集,而不是處理每個單獨的資料點。 它有助於維持效能和可擴充性,同時提供精確的洞察力。 鑒於 CIS 所處理的資料量(每秒超過 7 億筆事件),取樣對於在大型資料集上提供快速、具成本效益的度量來說至關重要。

在少數情況下,CIS 面板和 GraphQL API 中提供的度量基於_樣本 -_ 資料集的子集。 在這些情況下,CIS metrics 會回傳從取樣值得出的估計值。 舉例來說,如果在攻擊期間的取樣率為 10% 且取樣了 5,000 個事件,CIS 估計事件總數為 50,000 (5,000 × 10),並報告這個數值。

CIS 主要使用 自適應取樣,包括稱為自適應位元率 (ABR) 的方法,可根據查詢複雜度和數量調整傳回資料的詳細程度。 當記錄數量少或查詢簡單時,會使用全解析度資料 (100%)。 隨著資料集的成長,或查詢變得更複雜,採樣率會逐漸降低(例如 10% 或 1% ),以確保有效率地完成查詢。

此方法可防止大型查詢消耗過多的運算資源,確保所有使用者的公平分配和一致的效能。 資料以多種解析度 (100%、10% 及 1%) 儲存,讓系統可根據查詢的複雜度及大小選擇適當的解析度,協助 ABR 提供快速、精確的結果。

CIS GraphQL API 會揭露由適應性取樣所驅動的資料集。 這些節點的名稱中有 Adaptive 字樣,可以透過 內省發現。

為什麼要應用抽樣

CIS 度量標準的設計是為了儘快以適當的詳細程度提供資料。 取樣可減少處理的資料量,讓 CIS 在幾秒鐘內傳回指標,即使在資料量激增時也不例外,例如在攻擊期間防火牆事件爆發時。 如果沒有取樣,查詢可能需要幾分鐘或更長的時間才能完成,在驗證緩解工作或排除故障時,時間就太長了。

CIS 在其全球網路中,每秒處理超過 7 億個事件。 即時儲存和處理所有這些資料需要耗費太多時間和運算能力,因此並不實際可行。 取樣可平衡精確度與效能,讓度量更快、更可擴充、更有效率。 由於資料集相當龐大,因此取樣值仍具有統計意義,並能提供可靠的洞察力。

此方法與其他領域類似:

  • Google 地圖:放大時解析度較低的影像,反映 如何根據查詢大小調整取樣率,以提供快速、相關的洞察力。CIS
  • 民意調查:具有代表性的小樣本可以反映整個系統的趨勢。
  • 電影畫格:以每秒 30 畫格 (fps) 而非每秒 60 畫格觀賞,仍能呈現完整的畫面。 同樣地,取樣可以維持資料中的關鍵模式。

雖然 ABR 取樣解析度並非總是看得到,但讀取的行數是一個很好的指標:讀取的行數越多,解析度越高,結果的可靠性也越高。

取樣類型

CIS 度量使用兩種主要的取樣方式:適應取樣和固定取樣。 應用的方法取決於資料集和資料查詢的方式。

適應性取樣

CIS 度量主要依賴自適應取樣,也就是取樣率會依據擷取或查詢的資料量而波動。 如果記錄的數量相對較少,則通常不使用取樣,允許傳回完整的資料。 然而,當記錄量增加時,為了維持效能與回應能力,會逐步降低採樣率。

此模型用於多種資料來源,包括安全事件 (也稱為防火牆事件) 和安全事件日誌。 使用自適應取樣的資料節點可透過節點名稱中的 Adaptive 後綴輕鬆識別,如 firewallEventsAdaptive

固定取樣

下列資料節點以固定取樣為基礎,取樣率不會改變:

固定取樣
資料集 速率 附註
防火牆規則預覽

節點firewallRulePreviewGroups

1% 請謹慎使用。 對於小於某個臨界值的資料集,1% 的取樣率無法提供精確的估算,這是 CIS dashboard 明確呼叫的情況,但 API 沒有。
網路指標

節點:

ipFlows1mGroups
ipFlows1hGroups
ipFlows1dGroups
ipFlows1mAttacksGroups

0.012% 取樣率以封包數計算 (每 8,192 個封包取 1 個)。

其他注意事項

需要牢記的注意事項:

存取原始資料
由於取樣主要是適應性的,會自動調整以提供精確的估計,因此無法直接控制取樣率。 企業客戶可透過 CIS 日誌 存取原始資料。
取樣發生時
取樣通常應用於高流量的資料集,在這些資料集中,完整的資料指標並不可行。 對於較小的資料集,通常不需取樣即可進行完整的資料分析。
取樣率
取樣率因資料集和產品而異。 CIS 有助於確保單一資料集內的取樣率一致,以維持各查詢的精確度。
對指標的影響
雖然抽樣可減少處理資料的數量,但總數、平均值和百分位數等聚合指標都是根據樣本數量推算出來的。 這可確保所報告的度量準確地代表整個資料集。
限制
取樣可能無法捕捉到發生率極低的極罕見事件。