Intégrer avec Data Product Hub

IBM Data Product Hub (DPH) en tant que service est une solution en libre-service conçue pour rationaliser le partage des produits de données entre les producteurs et les consommateurs de données. Cette plateforme légère regroupe des données telles que des requêtes SQL et des tables en produits de données, qui répondent à un cas d'utilisation spécifique de l'entreprise.

L'intégration de DPH et de watsonx.data permet aux ingénieurs de données d'accéder aux données de manière transparente entre les deux services.

Actifs et produits de données

Les actifs de données peuvent être des requêtes SQL, des tables SQL, des modèles ML ou des tableaux de bord BI.

Un produit de données est un ensemble d'actifs rassemblés pour un cas d'utilisation spécifique.

Producteurs et consommateurs de données

Les producteurs de données sont chargés de regrouper les données en produits de données, de définir le contrat de données et de rendre le produit accessible aux consommateurs.

Les consommateurs de données sont les utilisateurs qui s'abonnent à ces produits de données. Les consommateurs de données peuvent être à la fois des utilisateurs techniques et des utilisateurs professionnels.

Caractéristiques de l'intégration

  • Accès à la source de données: le DPH se connecte à watsonx.data par l'intermédiaire d'un connecteur Presto pour créer une ressource de données à l'aide des informations de métadonnées, qui sont à leur tour regroupées dans un produit de données. Cette intégration élargit l'accessibilité des sources de données dans watsonx.data. Les données sont emballées de manière sécurisée car elles ne sont pas déplacées.

    Pour accéder aux données de watsonx.data, procédez comme suit :

    1. Créer un actif de connexion pour accéder aux données dans IBM watsonx.data. Pour créer une connexion, voir Presto connection.

    2. Créer un produit de données pour emballer l'actif. Pour plus d'informations, voir Création d'un produit de données directement à partir d'une source.

    3. Publier le produit de données qui sera utilisé par les consommateurs. Pour plus d'informations, voir Publication de votre produit de données.

  • Requête paramétrée: vous pouvez regrouper les informations de métadonnées des requêtes SQL dans watsonx.data et fournir les résultats dans des formats tels que CSV ou Parquet.

    Les producteurs de données peuvent créer un produit de données avec une requête personnalisable. Pour plus d'informations sur la création de tels produits de données, voir Création d'un produit de données à partir d'une requête personnalisable.

Méthodes de transmission des données

  • Flight service le site Flight service fournit un accès en lecture à diverses sources de données dans le site watsonx.data. Ce mode de livraison n'est utilisé que par le consommateur de données techniques. Par exemple, scientifique des données. Les consommateurs techniques peuvent utiliser les carnets Jupyter pour écrire un script afin d'accéder aux sources de données dans watsonx.data. Pour plus d'informations sur les services de vol, voir Service de vol.

  • Extraction de données: les consommateurs professionnels utilisent le service de raffinage de données pour créer un fichier d'extraction de données CSV et le télécharger. Pour plus d'informations sur la méthode de livraison de l'extrait de données, voir Méthode de livraison de l'extrait de données.

  • Deliver as a Table in watsonx.data: La méthode de livraison "deliver as a table in watsonx.data " permet aux consommateurs d'accéder à leur produit de données sous la forme d'une table dans watsonx.data. Cette méthode permet aux utilisateurs disposant des autorisations appropriées de créer de nouvelles tables ou d'ajouter des éléments à des tables existantes. Pour plus d'informations sur la livraison en tant que tableau dans watsonx.data, voir la méthode de livraison Livrer en tant que tableau dans watsonx.data dans la documentation Data Product Hub.

    Conditions préalables Pour utiliser la méthode de livraison "deliver as a table" dans watsonx.data, vous devez avoir les accès suivants dans watsonx.data:

    1. L'utilisateur doit avoir accès à un moteur Spark connecté au catalogue cible.
    2. L'utilisateur doit avoir accès à un moteur Presto (cela n'est nécessaire que pour établir la connexion).
    3. L'utilisateur doit avoir accès à un catalogue Iceberg cible avec un rôle dans le catalogue complet ou une politique d'accès qui donne une certaine permission d'utiliser le catalogue.
    4. L'utilisateur doit avoir un accès en écriture au stockage utilisé pour le catalogue cible.
    5. L'utilisateur doit avoir accès à Cloud Object Storage: Ajouter en tant que composant dans l'instance watsonx.data. Voir IBM Cloud Object Storage. L'extrait de données atterrira ici avant d'être ingéré dans watsonx.data.

    Pour la gestion de l'accès dans watsonx.data, voir Gestion de la politique des données.

  • Accès à watsonx.data: La méthode de livraison Access in watsonx.data permet aux consommateurs d'accéder à leur produit de données à watsonx.data. Pour plus d'informations sur l'accès à watsonx.data, voir la documentation de Data Product Hub.