Informationen zur Datenaufnahme
Die Datenaufnahme ist der Prozess des Importierens und Ladens von Daten in IBM® watsonx.data. Über die Benutzeroberfläche (UI) von watsonx.data können Sie das Modul Ingest data von der Seite Data manager verwenden, um Daten sicher und einfach zu laden. Alternativ können Sie auch lokale oder entfernte Datendateien zum Erstellen von Tabellen einlesen, indem Sie die Option Tabelle aus Datei erstellen verwenden.
Wenn Sie eine Datendatei in watsonx.dataaufnehmen, wird das Tabellenschema generiert und abgeleitet, wenn eine Abfrage ausgeführt wird. Die einzulesenden Dateien müssen denselben Formattyp und dasselbe Schema aufweisen. watsonx.data erkennt das Schema automatisch auf der Grundlage der einzulesenden Quelldatei.
Nachfolgend sind einige der Anforderungen oder Verhaltensweisen der Dateneingabe aufgeführt:
- Die Schemaweiterentwicklung wird nicht unterstützt.
- Die Zieltabelle muss eine Tabelle im Eisbergformat sein.
- IBM Storage Ceph, IBM Cloud Object Storage (COS), AWS S3, und MinIO Objektspeicher werden unterstützt.
- Die Eigenschaft
pathStyleAccessfür Objektspeicher wird nicht unterstützt. - als Quelldateien werden die Formate.txt,.csv, Parquet, JSON, ORC und Avro. unterstützt.
- Die Höchstgrenze für die kumulative Größe von Dateien muss bei der lokalen Aufnahme innerhalb von 500 MB liegen.
- Parquet-, JSON-, ORC- und Avro-Dateien, die größer als 2 MB sind, können nicht in der Vorschau angezeigt werden, werden aber dennoch erfolgreich importiert.
- JSON-Dateien mit komplexen verschachtelten Objekten und Arrays dürfen in der Benutzeroberfläche nicht in der Vorschau angezeigt werden.
- Komplexe JSON-Dateien werden unverändert eingelesen, was zu Arrays als Tabelleneinträgen führt. Dies ist für eine optimale Datenvisualisierung und -analyse nicht empfehlenswert.
- Schlüssel in JSON-Dateien müssen in Anführungszeichen gesetzt werden, damit sie richtig geparst und interpretiert werden können.
Daten über CLI laden oder aufnehmen
Ein Aufnahmejob in watsonx.data kann mit dem Tool ibm-lh ausgeführt werden. Das Tool muss aus dem ibm-lh-client extrahiert und auf dem lokalen System installiert werden, um den Aufnahmejob über die Befehlszeilenschnittstelle
auszuführen. Weitere Details und Anweisungen zur Installation des ibm-lh-client-Pakets und zur Verwendung des Tools ibm-lh für die Aufnahme finden Sie unter Installing ibm-lh-client und unter Setting up the ibm-lh command utility.
ibm-lh-client im Paket IBM Client ist jetzt veraltet und soll in einer zukünftigen Version entfernt werden. Das ibm-lh-Tool wird durch ./cpdctl wx-data ingestion ersetzt, das in der IBM CPDCTL CLI unterstützt
wird. Weitere Informationen über die Verwendung von IBM CPDCTL CLI finden Sie unter IBM cpdctl.
Das Werkzeug ibm-lh und der Befehl ./cpdctl wx-data ingestion unterstützen die folgenden Funktionen:
-
Automatische Erkennung des Schemas auf der Basis der Quellendatei oder der Zieltabelle
-
Erweiterte Tabellenkonfigurationsoptionen für die CSV-Dateien:
- Begrenzer
- Überschrift
- Dateicodierung
- Zeilenbegrenzer
- Escapezeichen
-
Ingestion einer einzelnen, mehrerer Dateien oder eines einzelnen Ordners (keine Unterordner) von S3 und lokalen Parquet-Dateien.
-
Ingestion einer einzelnen, mehrerer Dateien oder eines einzelnen Ordners (keine Unterordner) von S3 und lokalen CSV-Dateien.