分析 CSV 檔案

您可以以逗號分隔值 (CSV) 格式的檔案加入要分析的資料。

內容挖掘專案對 CSV 檔案運作良好。 當您的 CSV 檔案被擷取時,試算表中的每一行都會在集合索引中儲存為單獨的文件。 每一列都會成為文件中的根層欄位。

建立專案中使用的 CSV 檔案時,請遵循下列指引:

  • 在試算表中加入要分析的每條記錄作為一行。

  • 每個重要的資料點都包含一列。

  • 指定欄頭。

    新增到文件中的根級欄位會被賦予欄頭名稱。 If no header exists, hardcoded names, such as column_0 and column_1, are applied to the columns. 指定欄位名稱,以確保產生的文件欄位具有有意義的名稱。

  • 如果您想找出隨時間變化的趨勢,請確定每筆記錄都有一些日期資訊,可用來將資訊繪製在時間軸上。

    Discovery 自動識別下列日期格式:

    yyyy-MM-dd'T'HH:mm:ssZ
    yyyy-MM-dd'T'HH:mm:ssXXX
    yyyy-MM-dd'T'HH:mm:ss.SSSZ
    yyyy-MM-dd'T'HH:mm:ss.SSSX
    yyyy-MM-dd
    M/d/yy
    yyyyMMdd
    yyyy/MM/dd
    

    如果您以其他格式儲存日期,可以將格式新增至支援格式清單。

    From the Discovery user interface, open the 管理收藏 page. 按一下您的收藏磚。 From the 管理欄位 page for the collection, add a format to the 日期格式 field. 指定 Java SimpleDateFormat 類支援的日期格式。

    例如,如果您的記錄只儲存日期的年份值,請將 yyyy 加入支援的日期格式清單。 然後,您可以將包含年份值的欄位的資料類型設定為 日期,並重新處理您的集合。 As a result, an occurrence of 2019 in the date field is stored as 2019-01-01T05:00:00Z in the index.

範例 CSV 檔

下圖顯示 CSV 檔案的摘錄,其中的資料非常適合使用「內容挖掘」應用程式進行分析。 這些資料來自於美國國家公路交通安全管理局 (National Highway Traffic Safety Administration, NHTSA) 所公佈的 2010 年交通記錄。 每條記錄都包括汽車廠牌、型號和年份資訊、交通事故日期、駕駛人陳述的文字,以及其他有用的資料點。

顯示 csv 檔案的摘錄,其中包含以下列:MAKETXT、MODELTXT、YEARTXT、CRASH、FAILDATE、FIRE、COMDESC、CITY、STATE、DATEA、LDATE、MILES、CDESCR
範例 CSV 檔案

關於樣本資料的詳細資訊,請參閱 https://www.nhtsa.gov/data/traffic-records