Analisi dei file CSV

È possibile aggiungere i dati da analizzare come file in formato CSV (comma-separated value).

Il progetto di estrazione dei contenuti funziona bene con i file CSV. Quando il file CSV viene ingerito, ogni riga del foglio di calcolo viene memorizzata come documento separato nell'indice della raccolta. Ogni colonna diventa un campo di livello superiore nel documento.

Seguite queste linee guida quando create un file CSV da utilizzare nel progetto:

  • Aggiungere ogni record che si desidera analizzare come riga nel foglio di calcolo.

  • Includere una colonna per ogni punto di dati significativo.

  • Specificare le intestazioni delle colonne.

    Il campo di livello principale che viene aggiunto al documento riceve il nome dell'intestazione della colonna. Se non esiste un'intestazione, alle colonne vengono applicati nomi codificati, come column_0 e column_1. Specificare i nomi delle colonne per garantire che i campi del documento risultante abbiano nomi significativi.

  • Se si desidera individuare le tendenze nel tempo, assicurarsi che ogni record contenga informazioni sulla data che possono essere utilizzate per tracciare le informazioni su una linea temporale.

    Discovery riconosce automaticamente i seguenti formati di data:

    yyyy-MM-dd'T'HH:mm:ssZ
    yyyy-MM-dd'T'HH:mm:ssXXX
    yyyy-MM-dd'T'HH:mm:ss.SSSZ
    yyyy-MM-dd'T'HH:mm:ss.SSSX
    yyyy-MM-dd
    M/d/yy
    yyyyMMdd
    yyyy/MM/dd
    

    Se si memorizzano date in altri formati, è possibile aggiungere il formato all'elenco dei formati supportati.

    Dall'interfaccia utente Discovery, aprire la pagina Gestione collezione. Fare clic sul riquadro della raccolta. Dalla pagina Gestione campi della raccolta, aggiungere un formato al campo Formati data. Specificare un formato di data supportato dalla classe Java SimpleDateFormat.

    Ad esempio, se i record memorizzano solo i valori dell'anno per le date, aggiungere yyyy all'elenco dei formati di data supportati. È quindi possibile impostare il tipo di dati per il campo che contiene il valore dell'anno su Date e rielaborare la raccolta. Di conseguenza, un'occorrenza di 2019 nel campo data viene memorizzata come 2019-01-01T05:00:00Z nell'indice.

File CSV di esempio

L'immagine seguente mostra un estratto di un file CSV con dati adatti all'analisi con l'applicazione Content Mining. I dati provengono dai registri del traffico del 2010 pubblicati dalla National Highway Traffic Safety Administration (NHTSA). Ogni record include informazioni sulla marca, il modello e l'anno dell'auto, la data dell'incidente stradale e il testo della dichiarazione del conducente, oltre ad altri dati utili.

Mostra un estratto di un file csv con le colonne: MAKETXT, MODELTXT, YEARTXT, CRASH, FAILDATE, FIRE, COMPDESC, CITY, STATE, DATEA, LDATE, MILES, " caption-side="bottom"} CSV di{: caption="

Per ulteriori informazioni sui dati di esempio, vedere https://www.nhtsa.gov/data/traffic-records.