Integration mit Data Product Hub
IBM Data Product Hub (DPH) as a Service ist eine Selbstbedienungslösung, die den Austausch von Datenprodukten zwischen Datenproduzenten und Datenkonsumenten vereinfachen soll. Diese leichtgewichtige Plattform bündelt Datenbestände wie SQL-Abfragen und Tabellen zu Datenprodukten, die einem bestimmten geschäftlichen Anwendungsfall dienen.
Die Integration von DPH und watsonx.data ermöglicht den Dateningenieuren einen nahtlosen Datenzugriff zwischen den beiden Diensten.
Datenbestände und Datenprodukte
Datenbestände können SQL-Abfragen, SQL-Tabellen, ML-Modelle oder BI-Dashboards sein.
Ein Datenprodukt ist eine Sammlung von Daten, die für einen bestimmten geschäftlichen Anwendungsfall zusammengestellt wurden.
Datenproduzenten und Datenkonsumenten
Die Datenproduzenten sind dafür verantwortlich, die Datenbestände in Datenprodukte zu verpacken, den Datenvertrag zu definieren und das Produkt für die Verbraucher zugänglich zu machen.
Datenkonsumenten sind die Nutzer, die diese Datenprodukte abonnieren. Datenkonsumenten können sowohl technische als auch geschäftliche Nutzer sein.
Merkmale der Integration
-
Zugriff auf die Datenquelle: DPH stellt eine Verbindung zu watsonx.data über einen Presto-Konnektor her, um aus den Metadaten einen Datenbestand zu erstellen, der wiederum in ein Datenprodukt verpackt wird. Diese Integration erweitert die Zugänglichkeit der Datenquelle in watsonx.data. Die Daten werden auf sichere Weise verpackt, da es sich nicht um eine tatsächliche Datenbewegung handelt.
Um auf Daten von watsonx.data zuzugreifen, gehen Sie wie folgt vor:
-
Erstellen Sie ein Verbindungs-Asset für den Zugriff auf die Daten in IBM watsonx.data. Um eine Verbindung herzustellen, siehe Presto Verbindung.
-
Erstellen Sie ein Datenprodukt, um das Asset zu verpacken. Informationen hierzu finden Sie unter Erstellen eines Datenprodukts direkt aus einer Quelle.
-
Veröffentlichen Sie das Datenprodukt, das von den Verbrauchern genutzt werden soll. Weitere Informationen finden Sie unter Veröffentlichung Ihres Datenprodukts.
-
-
Parametrisierte Abfragen: Sie können die Metadateninformationen von SQL-Abfragen in watsonx.data verpacken und die Ergebnisse in Formaten wie CSV oder Parquet liefern.
Datenproduzenten können ein Datenprodukt mit anpassbarer Abfrage erstellen. Informationen zum Erstellen solcher Datenprodukte finden Sie unter Erstellen eines Datenprodukts aus einer anpassbaren Abfrage.
Methoden der Datenübermittlung
-
Flight serviceFlight service bietet Lesezugriff auf verschiedene Datenquellen in watsonx.data. Diese Liefermethode wird nur vom Verbraucher technischer Daten verwendet. Zum Beispiel Datenwissenschaftler. Technische Benutzer können Jupyter Notebooks verwenden, um ein Skript für den Zugriff auf die Datenquellen in watsonx.data zu schreiben. Informationen über Flugdienste finden Sie unter Flugdienst.
-
Datenextrakt: Die Geschäftskunden nutzen den Datenveredelungsdienst, um eine CSV-Datenextraktdatei zu erstellen und sie herunterzuladen. Informationen zur Datenextraktliefermethode finden Sie unter Datenextraktliefermethode.
-
Deliver as a Table in watsonx.data: Die Delivery-Methode Deliver as a Table in watsonx.data ermöglicht es den Konsumenten, auf ihr Datenprodukt als Tabelle in watsonx.data zuzugreifen. Mit dieser Methode können Benutzer, die über die entsprechenden Berechtigungen verfügen, neue Tabellen erstellen oder an bestehende Tabellen anhängen. Weitere Informationen zur Auslieferung als Tabelle in watsonx.data finden Sie unter Auslieferung als Tabelle in watsonx.data in der Dokumentation Data Product Hub.
Voraussetzungen Um die Liefermethode „Deliver as a Table“ in watsonx.data nutzen zu können, benötigen Sie folgende Zugriffsrechte in watsonx.data:
- Der Benutzer muss Zugriff auf eine Spark-Engine haben, die mit dem Zielkatalog verbunden ist.
- Der Benutzer muss Zugang zu einer Presto Engine haben (dies ist nur erforderlich, um die Verbindung herzustellen).
- Der Benutzer muss Zugriff auf einen Iceberg-Zielkatalog mit einer Rolle für den gesamten Katalog oder eine Zugriffsrichtlinie haben, die eine gewisse Berechtigung zur Verwendung des Katalogs erteilt.
- Der Benutzer muss Schreibzugriff auf den für den Zielkatalog verwendeten Speicher haben.
- Der Benutzer muss Zugriff auf Cloud Object Storage haben: Hinzufügen als Komponente in der Instanz watsonx.data. Siehe IBM Cloud Object Storage. Der Datenextrakt landet hier, bevor er in watsonx.data importiert wird.
Zur Verwaltung des Zugriffs in watsonx.data siehe Verwalten der Datenrichtlinie.
-
Zugriff in watsonx.data: Die Zugriffsmethode in watsonx.data ermöglicht den Verbrauchern den Zugriff auf ihr Datenprodukt in watsonx.data. Weitere Informationen über den Zugriff in watsonx.data finden Sie in der Dokumentation Data Product Hub.