Análisis de archivos CSV

Puede añadir los datos que desea analizar como un archivo con formato de valores separados por comas (CSV).

El proyecto de minería de contenidos funciona bien con archivos CSV. Cuando se ingiere el archivo CSV, cada fila de la hoja de cálculo se almacena como un documento independiente en el índice de colecciones. Cada columna se convierte en un campo raíz del documento.

Siga estas directrices cuando cree un archivo CSV para utilizarlo en el proyecto:

  • Añada cada registro que desee analizar como una fila en la hoja de cálculo.

  • Incluya una columna para cada punto de datos significativo.

  • Especifique las cabeceras de las columnas.

    El campo raíz que se añade al documento recibe el nombre de cabecera de columna. Si no existe cabecera, se aplican a las columnas nombres codificados, como column_0 y column_1. Especifique los nombres de las columnas para garantizar que los campos del documento resultante tengan nombres significativos.

  • Si desea encontrar tendencias a lo largo del tiempo, asegúrese de que cada registro tiene alguna información de fecha que pueda utilizarse para trazar la información en una línea de tiempo.

    Discovery reconoce automáticamente los siguientes formatos de fecha:

    yyyy-MM-dd'T'HH:mm:ssZ
    yyyy-MM-dd'T'HH:mm:ssXXX
    yyyy-MM-dd'T'HH:mm:ss.SSSZ
    yyyy-MM-dd'T'HH:mm:ss.SSSX
    yyyy-MM-dd
    M/d/yy
    yyyyMMdd
    yyyy/MM/dd
    

    Si almacena fechas en otros formatos, puede añadir el formato a la lista de formatos admitidos.

    Desde la interfaz de usuario Discovery, abra la página Gestionar colección. Haz clic en el mosaico de tu colección. Desde la página Administrar campos de la colección, añade un formato al campo Formatos de fecha. Especifica un formato de fecha soportado por la clase Java SimpleDateFormat.

    Por ejemplo, si sus registros sólo almacenan valores de año para las fechas, añada yyyy a la lista de formatos de fecha admitidos. A continuación, puede establecer el tipo de datos para el campo que contiene un valor de año en Fecha, y volver a procesar su colección. Como resultado, una aparición de 2019 en el campo de fecha se almacena como 2019-01-01T05:00:00Z en el índice.

Archivo CSV de ejemplo

La siguiente imagen muestra un extracto de un archivo CSV con datos muy adecuados para su análisis con la aplicación Content Mining. Los datos proceden de los registros de tráfico de 2010 publicados por la National Highway Traffic Safety Administration (NHTSA). Cada registro incluye información sobre la marca, el modelo y el año del coche, la fecha del incidente de tráfico y el texto de la declaración del conductor, junto con otros datos útiles.

Muestra un extracto de un archivo csv con las columnas: MAKETXT, MODELTXT, YEARTXT, CRASH, FAILDATE, FIRE, COMPDESC, CITY, STATE, DATEA, LDATE, MILES,
CSV de

Para más información sobre los datos de muestra, véase https://www.nhtsa.gov/data/traffic-records.