Análisis de archivos CSV
Puede añadir los datos que desea analizar como un archivo con formato de valores separados por comas (CSV).
El proyecto de minería de contenidos funciona bien con archivos CSV. Cuando se ingiere el archivo CSV, cada fila de la hoja de cálculo se almacena como un documento independiente en el índice de colecciones. Cada columna se convierte en un campo raíz del documento.
Siga estas directrices cuando cree un archivo CSV para utilizarlo en el proyecto:
-
Añada cada registro que desee analizar como una fila en la hoja de cálculo.
-
Incluya una columna para cada punto de datos significativo.
-
Especifique las cabeceras de las columnas.
El campo raíz que se añade al documento recibe el nombre de cabecera de columna. Si no existe cabecera, se aplican a las columnas nombres codificados, como column_0 y column_1. Especifique los nombres de las columnas para garantizar que los campos del documento resultante tengan nombres significativos.
-
Si desea encontrar tendencias a lo largo del tiempo, asegúrese de que cada registro tiene alguna información de fecha que pueda utilizarse para trazar la información en una línea de tiempo.
Discovery reconoce automáticamente los siguientes formatos de fecha:
yyyy-MM-dd'T'HH:mm:ssZ yyyy-MM-dd'T'HH:mm:ssXXX yyyy-MM-dd'T'HH:mm:ss.SSSZ yyyy-MM-dd'T'HH:mm:ss.SSSX yyyy-MM-dd M/d/yy yyyyMMdd yyyy/MM/ddSi almacena fechas en otros formatos, puede añadir el formato a la lista de formatos admitidos.
Desde la interfaz de usuario Discovery, abra la página Gestionar colección. Haz clic en el mosaico de tu colección. Desde la página Administrar campos de la colección, añade un formato al campo Formatos de fecha. Especifica un formato de fecha soportado por la clase Java SimpleDateFormat.
Por ejemplo, si sus registros sólo almacenan valores de año para las fechas, añada
yyyya la lista de formatos de fecha admitidos. A continuación, puede establecer el tipo de datos para el campo que contiene un valor de año en Fecha, y volver a procesar su colección. Como resultado, una aparición de2019en el campo de fecha se almacena como2019-01-01T05:00:00Zen el índice.
Archivo CSV de ejemplo
La siguiente imagen muestra un extracto de un archivo CSV con datos muy adecuados para su análisis con la aplicación Content Mining. Los datos proceden de los registros de tráfico de 2010 publicados por la National Highway Traffic Safety Administration (NHTSA). Cada registro incluye información sobre la marca, el modelo y el año del coche, la fecha del incidente de tráfico y el texto de la declaración del conductor, junto con otros datos útiles.
Para más información sobre los datos de muestra, véase https://www.nhtsa.gov/data/traffic-records.