關於資料吸收

資料攝取是將資料匯入並載入到IBM® watsonx.data的過程。 在watsonx.data的使用者介面 (UI) 中,您可以使用資料管理器頁面中的擷取資料模組來安全、輕鬆地載入資料。 或者,您也可以使用 「從檔案建立表格」 選項取得本機或遠端資料檔案來建立表格。

當您將資料檔汲取至 watsonx.data時,會在執行查詢時產生並推斷表格綱目。 要攝取的檔案必須具有相同的格式類型和相同的架構。watsonx.data會根據正在擷取的來源檔案自動發現架構。

以下是資料攝取的一些要求或行為:

  • 不支援綱目發展。
  • 目標表必須是iceberg格式的表格。
  • IBM Storage Ceph, IBM Cloud Object Storage(COS),AWS S3,和MinIO支援對象存儲。
  • 不支援物件儲存體的 pathStyleAccess 內容。
  • 支援.txt、.csv、Parquet、JSON、ORC 及 Avro.檔案格式作為原始資料檔案。
  • 對於本地攝取,檔案累積大小的最大限制必須在 500 MB 以內。
  • 超過 2 MB 的 Parquet、JSON、ORC 和 Avro. 檔案無法預覽,但仍會成功擷取。
  • 具有複雜巢狀物件和陣列的 JSON 檔案不應在 UI 中預覽。
  • 複雜的 JSON 檔案應按原樣攝取,從而產生數組作為表條目。 為了實現最佳數據視覺化和分析,不建議這樣做。
  • JSON 檔案中的鍵必須用引號括起來,以便正確解析和解釋。

透過 CLI 載入或汲取資料

watsonx.data 中的汲取工作可以使用 ibm-lh 工具來執行。 該工具必須從 ibm-lh-client 中取回,並安裝在本端系統中,才能透過 CLI 執行汲取工作。 如需安裝 ibm-lh-client 套件及使用 ibm-lh 工具進行汲取的詳細資料及指示,請參閱 安裝 ibm-lh-client設定 ibm-lh 指令行公用程式

ibm-lh-client 在 Client 套裝中已被廢棄,並將在未來的版本中移除。IBM IBM CPDCTL CLI 支援的 ./cpdctl wx-data ingestion 取代 ibm-lh 工具。 有關如何使用 IBM CPDCTL CLI 的詳細資訊,請參閱 IBM cpdctl

ibm-lh 工具和 ./cpdctl wx-data ingestion 指令支援下列功能:

  • 根據來源檔案或目標表格自動探索綱目。

  • CSV 檔的進階表格配置選項:

    • 定界字元
    • 標頭
    • 檔案編碼
    • 行定界字元
    • 跳出字元
  • 攝取S3和本機 Parquet 檔案的單一、多個檔案或單一資料夾(無子資料夾)。

  • 攝取S3和本機 CSV 檔案的單一、多個檔案或單一資料夾(無子資料夾)。