Acerca de la ingestión de datos

La ingestión de datos es el proceso de importación y carga de datos en IBM® watsonx.data. Desde la interfaz de usuario (UI) de watsonx.data, puede utilizar el módulo Ingest data de la página Administrador de datos para cargar datos de forma segura y sencilla. Como alternativa, también puede ingestar archivos de datos locales o remotos para crear tablas mediante la opción Crear tabla a partir de archivo.

Cuando ingiere un archivo de datos en watsonx.data, el esquema de tabla se genera y se infiere cuando se ejecuta una consulta. Los archivos que se van a ingestar deben tener el mismo tipo de formato y el mismo esquema. watsonx.data autodescubre el esquema basándose en el archivo fuente que se está ingestando.

A continuación se exponen algunos de los requisitos o comportamientos de la ingesta de datos:

  • La evolución del esquema no está soportada.
  • La tabla de destino debe ser una tabla con formato iceberg.
  • IBM Storage Ceph, IBM Cloud Object Storage (COS), AWS S3 y MinIO son compatibles con el almacenamiento de objetos.
  • La propiedad pathStyleAccess para el almacenamiento de objetos no está soportada.
  • como archivos de datos de origen se admiten los formatos.txt,.csv, Parquet, JSON, ORC y Avro.
  • El límite máximo para el tamaño acumulado de los archivos debe estar dentro de los 500 MB para la ingestión local.
  • Los archivos Parquet, JSON, ORC y Avro. de más de 2 MB no se pueden previsualizar, pero aún así se ingestarán correctamente.
  • Los archivos JSON con objetos anidados complejos y matrices no se previsualizarán en la interfaz de usuario.
  • Los archivos JSON complejos se ingestarán tal cual, dando lugar a matrices como entradas de tabla. Esto no es recomendable para una visualización y análisis óptimos de los datos.
  • Las claves de los archivos JSON deben ir entre comillas para que se puedan analizar e interpretar correctamente.

Carga o ingestión de datos a través de la CLI

Un trabajo de ingestión en watsonx.data se puede ejecutar con la herramienta ibm-lh. La herramienta debe extraerse del ibm-lh-client e instalarse en el sistema local para ejecutar el trabajo de ingestión a través de la CLI. Para obtener más detalles e instrucciones para instalar el paquete ibm-lh-client y utilizar la herramienta ibm-lh para la ingestión, consulte Instalación de ibm-lh-client y Configuración del programa de utilidad de línea de mandatos ibm-lh.

ibm-lh-client en el paquete IBM Client está obsoleto y se eliminará en una futura versión. La herramienta ibm-lh se sustituye por ./cpdctl wx-data ingestion soportada en la CLI IBM CPDCTL. Para obtener más información sobre cómo utilizar IBM CPDCTL CLI, consulte IBM CPDCTL.

La herramienta ibm-lh y ./cpdctl wx-data ingestion Comando admite las siguientes funciones:

  • Descubrimiento automático del esquema basado en el archivo de origen o la tabla de destino.

  • Opciones avanzadas de configuración de tabla para los archivos CSV:

    • Delimitador
    • Cabecera
    • Codificación de archivo
    • Delimitador de línea
    • Caracteres de escape
  • Ingestión de un único archivo, varios archivos o una única carpeta (sin subcarpetas) de S3 y archivos Parquet locales.

  • Ingestión de un único archivo, varios archivos o una única carpeta (sin subcarpetas) de S3 y archivos CSV locales.