Analysieren von CSV-Dateien

Sie können die Daten, die Sie analysieren möchten, als kommagetrennte Datei (CSV) hinzufügen.

Das Content-Mining-Projekt funktioniert gut mit CSV-Dateien. Wenn Ihre CSV-Datei eingelesen wird, wird jede Zeile der Kalkulationstabelle als separates Dokument im Sammelindex gespeichert. Jede Spalte wird zu einem Stammfeld des Dokuments.

Befolgen Sie diese Richtlinien, wenn Sie eine CSV-Datei zur Verwendung im Projekt erstellen:

  • Fügen Sie jeden Datensatz, den Sie analysieren möchten, als Zeile in die Kalkulationstabelle ein.

  • Fügen Sie für jeden signifikanten Datenpunkt eine Spalte ein.

  • Geben Sie Spaltenüberschriften an.

    Das Feld der Stammebene, das dem Dokument hinzugefügt wird, erhält den Namen der Spaltenüberschrift. Ist keine Überschrift vorhanden, werden die Spalten mit hart kodierten Namen wie column_0 und column_1 versehen. Geben Sie Spaltennamen an, um sicherzustellen, dass die resultierenden Dokumentfelder sinnvolle Namen haben.

  • Wenn Sie Trends im Laufe der Zeit feststellen möchten, sollten Sie sicherstellen, dass jeder Datensatz eine Datumsangabe enthält, mit der Sie die Informationen auf einer Zeitachse darstellen können.

    Discovery erkennt die folgenden Datumsformate automatisch:

    yyyy-MM-dd'T'HH:mm:ssZ
    yyyy-MM-dd'T'HH:mm:ssXXX
    yyyy-MM-dd'T'HH:mm:ss.SSSZ
    yyyy-MM-dd'T'HH:mm:ss.SSSX
    yyyy-MM-dd
    M/d/yy
    yyyyMMdd
    yyyy/MM/dd
    

    Wenn Sie Datumsangaben in anderen Formaten speichern, können Sie das Format zur Liste der unterstützten Formate hinzufügen.

    Öffnen Sie in der Benutzeroberfläche Discovery die Seite Sammlung verwalten. Klicken Sie auf Ihre Sammlungskachel. Fügen Sie auf der Seite Felder verwalten für die Sammlung ein Format zum Feld Datumsformate hinzu. Geben Sie ein Datumsformat an, das von der Java SimpleDateFormat Klasse unterstützt wird.

    Wenn Ihre Datensätze zum Beispiel nur Jahreswerte für Datumsangaben speichern, fügen Sie yyyy zur Liste der unterstützten Datumsformate hinzu. Sie können dann den Datentyp für das Feld, das einen Jahreswert enthält, auf Datum setzen und Ihre Sammlung erneut verarbeiten. Daher wird ein Vorkommen von 2019 im Datumsfeld als 2019-01-01T05:00:00Z im Index gespeichert.

CSV-Beispieldatei

Das folgende Bild zeigt einen Auszug aus einer CSV-Datei mit Daten, die sich gut für die Analyse mit der Anwendung Content Mining eignen. Die Daten stammen aus Verkehrsaufzeichnungen aus dem Jahr 2010, die von der National Highway Traffic Safety Administration (NHTSA) veröffentlicht wurden. Jeder Datensatz enthält Informationen zur Automarke, zum Modell und zum Baujahr des Fahrzeugs, das Datum des Verkehrsvorfalls, den Text der Aussage des Fahrers sowie weitere nützliche Daten.

Shows an excerpt from a csv file with the columns: MAKETXT, MODELTXT, YEARTXT, CRASH, FAILDATE, FIRE, COMPDESC, CITY, STATE, DATEA, LDATE, MILES, CDESCR
Sample CSV file

Weitere Informationen zu den Beispieldaten finden Sie unter https://www.nhtsa.gov/data/traffic-records.