關於資料吸收
資料攝取是將資料匯入並載入到IBM® watsonx.data的過程。 在watsonx.data的使用者介面 (UI) 中,您可以使用資料管理器頁面中的擷取資料模組來安全、輕鬆地載入資料。 或者,您也可以使用 「從檔案建立表格」 選項取得本機或遠端資料檔案來建立表格。
當您將資料檔汲取至 watsonx.data時,會在執行查詢時產生並推斷表格綱目。 要攝取的檔案必須具有相同的格式類型和相同的架構。watsonx.data會根據正在擷取的來源檔案自動發現架構。
以下是資料攝取的一些要求或行為:
- 不支援綱目發展。
- 目標表必須是iceberg格式的表格。
- IBM Storage Ceph, IBM Cloud Object Storage(COS),AWS S3,和MinIO支援對象存儲。
- 不支援物件儲存體的
pathStyleAccess內容。 - 支援.txt、.csv、Parquet、JSON、ORC 及 Avro.檔案格式作為原始資料檔案。
- 對於本地攝取,檔案累積大小的最大限制必須在 500 MB 以內。
- 超過 2 MB 的 Parquet、JSON、ORC 和 Avro. 檔案無法預覽,但仍會成功擷取。
- 具有複雜巢狀物件和陣列的 JSON 檔案不應在 UI 中預覽。
- 複雜的 JSON 檔案應按原樣攝取,從而產生數組作為表條目。 為了實現最佳數據視覺化和分析,不建議這樣做。
- JSON 檔案中的鍵必須用引號括起來,以便正確解析和解釋。
透過 CLI 載入或汲取資料
watsonx.data 中的汲取工作可以使用 ibm-lh 工具來執行。 該工具必須從 ibm-lh-client 中取回,並安裝在本端系統中,才能透過 CLI 執行汲取工作。 如需安裝 ibm-lh-client 套件及使用 ibm-lh 工具進行汲取的詳細資料及指示,請參閱 安裝 ibm-lh-client 及 設定 ibm-lh 指令行公用程式。
ibm-lh-client 在 Client 套裝中已被廢棄,並將在未來的版本中移除。IBM IBM CPDCTL CLI 支援的 ./cpdctl wx-data ingestion 取代 ibm-lh 工具。 有關如何使用 IBM CPDCTL CLI 的詳細資訊,請參閱 IBM cpdctl。
ibm-lh 工具和 ./cpdctl wx-data ingestion 指令支援下列功能:
-
根據來源檔案或目標表格自動探索綱目。
-
CSV 檔的進階表格配置選項:
- 定界字元
- 標頭
- 檔案編碼
- 行定界字元
- 跳出字元
-
攝取S3和本機 Parquet 檔案的單一、多個檔案或單一資料夾(無子資料夾)。
-
攝取S3和本機 CSV 檔案的單一、多個檔案或單一資料夾(無子資料夾)。