Utilizzo del campionamento per ottimizzare le metriche
Utilizzare il campionamento per analizzare un sottoinsieme di dati piuttosto che elaborare ogni singolo punto di dati. Aiuta a mantenere le prestazioni e la scalabilità, fornendo al contempo informazioni accurate. Dato il volume di dati che CIS gestisce - oltre 700 milioni di eventi al secondo - il campionamento è essenziale per fornire metriche rapide e convenienti su grandi insiemi di dati.
In un piccolo numero di casi, le metriche fornite nella dashboard di CIS e nell'API di GraphQL si basano su un campione, un sottoinsieme del set di dati. In questi casi, le metriche di CIS restituiscono una stima derivata dal valore campionato. Ad esempio, se durante un attacco la frequenza di campionamento è del 10% e vengono campionati 5.000 eventi, CIS stima il numero totale di eventi in 50.000 (5.000 × 10) e riporta questo valore.
CIS utilizza principalmente il campionamento adattivo, compreso un metodo chiamato Adaptive Bit Rate (ABR), che regola il livello di dettaglio dei dati restituiti in base alla complessità e al volume della query. Quando il numero di record è ridotto o la query è semplice, vengono utilizzati i dati a piena risoluzione (100%). Man mano che il set di dati cresce o l'interrogazione diventa più complessa, si applicano tassi di campionamento progressivamente più bassi (come il 10% o l'1%), per garantire un completamento efficiente dell'interrogazione.
Questo approccio impedisce alle query di grandi dimensioni di consumare risorse di calcolo eccessive, garantendo una distribuzione equa e prestazioni coerenti per tutti gli utenti. I dati sono memorizzati a risoluzioni multiple (100%, 10% e 1%), consentendo al sistema di selezionare la risoluzione appropriata in base alla complessità e alle dimensioni della query, aiutando ABR a fornire risultati rapidi e accurati.
CIS GraphQL L'API espone insiemi di dati alimentati dal campionamento adattivo. Questi nodi hanno Adaptive nel nome e possono essere scoperti attraverso l'introspezione.
Perché si applica il campionamento
CIS le metriche sono progettate per fornire dati al livello di dettaglio appropriato nel più breve tempo possibile. Il campionamento aiuta a raggiungere questo obiettivo riducendo la quantità di dati elaborati, consentendo a CIS di restituire le metriche in pochi secondi, anche in caso di picchi di volume, come un'esplosione di eventi firewall durante un attacco. Senza il campionamento, le query possono richiedere minuti o più per essere completate, un tempo troppo lungo per convalidare gli sforzi di mitigazione o risolvere i problemi.
CIS elabora oltre 700 milioni di eventi al secondo attraverso la sua rete globale. Memorizzare ed elaborare tutti questi dati in tempo reale richiederebbe troppo tempo e potenza di calcolo per essere pratico. Il campionamento bilancia l'accuratezza con le prestazioni, rendendo le metriche più veloci, più scalabili e più efficienti. Poiché i set di dati sono così ampi, i valori campionati rimangono statisticamente significativi e forniscono approfondimenti affidabili.
Questo approccio è simile a quello di altri domini:
- Google Mappe: Le immagini a bassa risoluzione quando vengono ingrandite rispecchiano il modo in cui CIS regola le frequenze di campionamento per fornire approfondimenti rapidi e pertinenti in base alle dimensioni della query.
- Sondaggi d'opinione: Un campione piccolo e rappresentativo può riflettere le tendenze dell'intero sistema.
- Fotogrammi del filmato: La visione a 30 fotogrammi al secondo (fps) invece che a 60 fps racconta comunque l'intera storia. Allo stesso modo, il campionamento mantiene i modelli chiave dei dati.
Sebbene la risoluzione del campionamento ABR non sia sempre visibile, il numero di righe lette è un buon indicatore: più righe vengono lette, maggiore è la risoluzione e l'affidabilità dei risultati.
Tipi di campionamento
CIS le metriche utilizzano due tipi principali di campionamento: il campionamento adattivo e il campionamento fisso. Il metodo applicato dipende dal set di dati e dal modo in cui i dati vengono interrogati.
Campionamento adattivo
CIS le metriche si basano principalmente sul campionamento adattivo, il che significa che la frequenza di campionamento fluttua in base al volume di dati ingeriti o interrogati. Se il numero di record è relativamente basso, in genere non si ricorre al campionamento, consentendo la restituzione dei dati completi. Tuttavia, con l'aumentare del volume dei record, vengono applicate frequenze di campionamento progressivamente più basse per mantenere le prestazioni e la reattività.
Questo modello è utilizzato in diverse fonti di dati, tra cui gli Eventi di sicurezza (noti anche come Eventi firewall) e il Registro eventi di sicurezza. I nodi di dati che utilizzano il campionamento adattivo sono facilmente identificabili
dal suffisso Adaptive nel nome del nodo, come in firewallEventsAdaptive.
Campionamento fisso
I seguenti nodi dati si basano su un campionamento fisso, in cui la frequenza di campionamento non varia:
| Dataset | Tariffa | Note |
|---|---|---|
| Regole firewall Anteprima
Nodi: |
1% | Utilizzare con cautela. Una frequenza di campionamento dell'1% non fornisce stime accurate per set di dati inferiori a una certa soglia, uno scenario che il dashboard dell' CIS e richiama esplicitamente, ma l'API no. |
| Metriche di rete
Nodi:
|
0.012% | La frequenza di campionamento è in termini di conteggio dei pacchetti (1 ogni 8.192 pacchetti). |
Altre considerazioni
Considerazioni da tenere presenti:
- Accesso ai dati grezzi
- Poiché il campionamento è principalmente adattivo e si regola automaticamente per fornire una stima accurata, la frequenza di campionamento non può essere controllata direttamente. I clienti Enterprise hanno accesso ai dati grezzi attraverso i log di CIS.
- Quando si verifica il campionamento
- Il campionamento è tipicamente applicato a insiemi di dati ad alto traffico in cui le metriche dei dati completi non sono praticabili. Per gli insiemi di dati più piccoli, l'analisi completa dei dati viene spesso eseguita senza campionamento.
- Tassi di campionamento
- I tassi di campionamento variano a seconda del set di dati e del prodotto. CIS aiuta a garantire che i tassi di campionamento siano coerenti all'interno di un singolo set di dati per mantenere l'accuratezza tra le query.
- Impatto sulle metriche
- Mentre il campionamento riduce il volume dei dati elaborati, le metriche aggregate come totali, medie e percentili vengono estrapolate in base alla dimensione del campione. Ciò garantisce che le metriche riportate rappresentino accuratamente l'intero set di dati.
- Limitazioni
- Il campionamento potrebbe non catturare eventi estremamente rari con tassi di occorrenza molto bassi.