Integración con Data Product Hub

IBM Data Product Hub (DPH) as a Service es una solución de autoservicio diseñada para agilizar el intercambio de productos de datos entre productores y consumidores de datos. Esta plataforma ligera empaqueta activos de datos como consultas SQL y tablas en productos de datos, que sirven para un caso de uso empresarial específico.

La integración de DPH y watsonx.data permite a los ingenieros de datos acceder sin problemas a los datos de ambos servicios.

Activos y productos de datos

Los activos de datos pueden ser consultas SQL, tablas SQL, modelos ML o cuadros de mando BI.

Un producto de datos es una colección de activos agrupados para un uso empresarial específico.

Productores y consumidores de datos

Los productores de datos son responsables de empaquetar los activos de datos en productos de datos, definir el contrato de datos y hacer el producto accesible a los consumidores.

Los consumidores de Datos son los usuarios que se suscriben a estos productos de Datos. Los consumidores de datos pueden ser tanto usuarios técnicos como empresariales.

Características de la integración

  • Acceso a la fuente de datos: DPH se conecta con watsonx.data a través de un conector Presto para crear un activo de datos utilizando la información de metadatos, que a su vez se empaqueta en un producto de datos. Esta integración amplía la accesibilidad de la fuente de datos en watsonx.data. Los datos se empaquetan de forma segura, ya que no implica movimiento real de datos.

    Para acceder a los datos de watsonx.data, haga lo siguiente:

    1. Cree un activo de conexión para acceder a los datos en IBM watsonx.data. Para crear una conexión, consulte Presto connection.

    2. Crear un producto de datos para empaquetar el activo. Para más información, consulte Creación de un producto de datos directamente a partir de una fuente.

    3. Publicar el producto de datos que utilizarán los consumidores. Para más información, consulte Publicación de su producto de datos.

  • Consultas parametrizadas: Puede empaquetar la información de metadatos de las consultas SQL en watsonx.data y entregar los resultados en formatos como CSV o Parquet.

    Los productores de datos pueden crear un producto de datos con una consulta personalizable. Para obtener información sobre la creación de este tipo de productos de datos, consulte Creación de un producto de datos a partir de una consulta personalizable.

Métodos de entrega de datos

  • Flight service: Flight service proporciona acceso de lectura a varias fuentes de datos en watsonx.data. Este método de entrega sólo lo utiliza el consumidor de datos técnicos. Por ejemplo, científico de datos. Los consumidores técnicos pueden utilizar Jupyter Notebooks para escribir un script que les permita acceder a las fuentes de datos en watsonx.data. Para más información sobre los servicios de Vuelo, véase Servicio de Vuelo.

  • Extracción de datos: Los consumidores empresariales utilizan el servicio de refinería de datos para crear un archivo CSV de extracción de datos y descargarlo. Para obtener información sobre el método de entrega de extracción de datos, consulte Método de entrega de extracción de datos.

  • Entregar como una tabla en watsonx.data: el método de entrega Entregar como una tabla en watsonx.data permite a los consumidores acceder a su producto de datos como una tabla en watsonx.data. Este método permite a los usuarios con los permisos adecuados crear nuevas tablas o añadirlas a las existentes. Para obtener más información sobre la entrega como tabla en watsonx.data, consulte el método de entrega Entrega como tabla en watsonx.data en la documentación de Data Product Hub.

    Requisitos previos Para utilizar el método de entrega como tabla en watsonx.data, debe tener los siguientes accesos en watsonx.data:

    1. El usuario debe tener acceso a un motor Spark conectado al catálogo de destino.
    2. El usuario debe tener acceso a un motor Presto (sólo es necesario para realizar la conexión).
    3. El usuario debe tener acceso a un catálogo Iceberg de destino con rol al catálogo completo o una política de acceso que otorgue algún permiso para utilizar el catálogo.
    4. El usuario debe tener acceso de escritura al almacenamiento utilizado para el catálogo de destino.
    5. El usuario debe tener acceso a Cloud Object Storage: Añadir como componente en la instancia watsonx.data. Véase IBM Cloud Object Storage. El extracto de datos aterrizará aquí antes de ser ingestado en watsonx.data.

    Para gestionar el acceso en watsonx.data, consulte Gestión de la política de datos.

  • Acceso en watsonx.data: El método de entrega de acceso en watsonx.data permite a los consumidores acceder a su producto de datos en watsonx.data. Para más información sobre el acceso en watsonx.data, consulte la documentación de Data Product Hub.