Analisi dei file CSV
È possibile aggiungere i dati da analizzare come file in formato CSV (comma-separated value).
Il progetto di estrazione dei contenuti funziona bene con i file CSV. Quando il file CSV viene ingerito, ogni riga del foglio di calcolo viene memorizzata come documento separato nell'indice della raccolta. Ogni colonna diventa un campo di livello superiore nel documento.
Seguite queste linee guida quando create un file CSV da utilizzare nel progetto:
-
Aggiungere ogni record che si desidera analizzare come riga nel foglio di calcolo.
-
Includere una colonna per ogni punto di dati significativo.
-
Specificare le intestazioni delle colonne.
Il campo di livello principale che viene aggiunto al documento riceve il nome dell'intestazione della colonna. Se non esiste un'intestazione, alle colonne vengono applicati nomi codificati, come column_0 e column_1. Specificare i nomi delle colonne per garantire che i campi del documento risultante abbiano nomi significativi.
-
Se si desidera individuare le tendenze nel tempo, assicurarsi che ogni record contenga informazioni sulla data che possono essere utilizzate per tracciare le informazioni su una linea temporale.
Discovery riconosce automaticamente i seguenti formati di data:
yyyy-MM-dd'T'HH:mm:ssZ yyyy-MM-dd'T'HH:mm:ssXXX yyyy-MM-dd'T'HH:mm:ss.SSSZ yyyy-MM-dd'T'HH:mm:ss.SSSX yyyy-MM-dd M/d/yy yyyyMMdd yyyy/MM/ddSe si memorizzano date in altri formati, è possibile aggiungere il formato all'elenco dei formati supportati.
Dall'interfaccia utente Discovery, aprire la pagina Gestione collezione. Fare clic sul riquadro della raccolta. Dalla pagina Gestione campi della raccolta, aggiungere un formato al campo Formati data. Specificare un formato di data supportato dalla classe Java SimpleDateFormat.
Ad esempio, se i record memorizzano solo i valori dell'anno per le date, aggiungere
yyyyall'elenco dei formati di data supportati. È quindi possibile impostare il tipo di dati per il campo che contiene il valore dell'anno su Date e rielaborare la raccolta. Di conseguenza, un'occorrenza di2019nel campo data viene memorizzata come2019-01-01T05:00:00Znell'indice.
File CSV di esempio
L'immagine seguente mostra un estratto di un file CSV con dati adatti all'analisi con l'applicazione Content Mining. I dati provengono dai registri del traffico del 2010 pubblicati dalla National Highway Traffic Safety Administration (NHTSA). Ogni record include informazioni sulla marca, il modello e l'anno dell'auto, la data dell'incidente stradale e il testo della dichiarazione del conducente, oltre ad altri dati utili.
{: caption="
Per ulteriori informazioni sui dati di esempio, vedere https://www.nhtsa.gov/data/traffic-records.