Analyse des fichiers CSV
Vous pouvez ajouter les données que vous souhaitez analyser sous la forme d'un fichier au format CSV (comma-separated value).
Le projet d'exploration de contenu fonctionne bien avec les fichiers CSV. Lorsque votre fichier CSV est ingéré, chaque ligne de la feuille de calcul est stockée comme un document distinct dans l'index de la collection. Chaque colonne devient un champ de niveau racine dans le document.
Suivez ces instructions lorsque vous créez un fichier CSV à utiliser dans le projet :
-
Ajoutez chaque enregistrement que vous souhaitez analyser en tant que ligne dans la feuille de calcul.
-
Inclure une colonne pour chaque point de données significatif.
-
Spécifiez les en-têtes de colonne.
Le champ de niveau racine qui est ajouté au document reçoit le nom de l'en-tête de colonne. S'il n'existe pas d'en-tête, des noms codés en dur, tels que column_0 et column_1, sont appliqués aux colonnes. Spécifiez les noms des colonnes pour vous assurer que les champs du document qui en résultent ont des noms significatifs.
-
Si vous souhaitez dégager des tendances dans le temps, veillez à ce que chaque enregistrement contienne des informations sur la date qui peuvent être utilisées pour représenter les informations sur une ligne de temps.
Discovery reconnaît automatiquement les formats de date suivants :
yyyy-MM-dd'T'HH:mm:ssZ yyyy-MM-dd'T'HH:mm:ssXXX yyyy-MM-dd'T'HH:mm:ss.SSSZ yyyy-MM-dd'T'HH:mm:ss.SSSX yyyy-MM-dd M/d/yy yyyyMMdd yyyy/MM/ddSi vous enregistrez des dates dans d'autres formats, vous pouvez ajouter le format à la liste des formats pris en charge.
Dans l'interface utilisateur Discovery, ouvrez la page Gestion de la collection. Cliquez sur la tuile de votre collection. Dans la page Gestion des champs de la collection, ajoutez un format au champ Formats de date. Spécifiez un format de date pris en charge par la classe Java SimpleDateFormat.
Par exemple, si vos enregistrements ne stockent que des valeurs annuelles pour les dates, ajoutez
yyyyà la liste des formats de date pris en charge. Vous pouvez ensuite définir le type de données pour le champ qui contient une valeur d'année sur Date, et retraiter votre collection. Par conséquent, une occurrence de2019dans le champ de la date est stockée comme2019-01-01T05:00:00Zdans l'index.
Exemple de fichier CSV
L'image suivante montre un extrait d'un fichier CSV contenant des données qui se prêtent bien à une analyse avec l'application Content Mining. Les données proviennent des registres de circulation de 2010 publiés par la National Highway Traffic Safety Administration (NHTSA). Chaque enregistrement comprend des informations sur la marque, le modèle et l'année de la voiture, la date de l'incident de circulation et le texte de la déclaration du conducteur, ainsi que d'autres données utiles.
Pour plus d'informations sur les données de l'échantillon, voir https://www.nhtsa.gov/data/traffic-records.