Acerca de la ingestión de datos
La ingestión de datos es el proceso de importación y carga de datos en IBM® watsonx.data. Desde la interfaz de usuario (UI) de watsonx.data, puede utilizar el módulo Ingest data de la página Administrador de datos para cargar datos de forma segura y sencilla. Como alternativa, también puede ingestar archivos de datos locales o remotos para crear tablas mediante la opción Crear tabla a partir de archivo.
Cuando ingiere un archivo de datos en watsonx.data, el esquema de tabla se genera y se infiere cuando se ejecuta una consulta. Los archivos que se van a ingestar deben tener el mismo tipo de formato y el mismo esquema. watsonx.data autodescubre el esquema basándose en el archivo fuente que se está ingestando.
A continuación se exponen algunos de los requisitos o comportamientos de la ingesta de datos:
- La evolución del esquema no está soportada.
- La tabla de destino debe ser una tabla con formato iceberg.
- IBM Storage Ceph, IBM Cloud Object Storage (COS), AWS S3 y MinIO son compatibles con el almacenamiento de objetos.
- La propiedad
pathStyleAccesspara el almacenamiento de objetos no está soportada. - como archivos de datos de origen se admiten los formatos.txt,.csv, Parquet, JSON, ORC y Avro.
- El límite máximo para el tamaño acumulado de los archivos debe estar dentro de los 500 MB para la ingestión local.
- Los archivos Parquet, JSON, ORC y Avro. de más de 2 MB no se pueden previsualizar, pero aún así se ingestarán correctamente.
- Los archivos JSON con objetos anidados complejos y matrices no se previsualizarán en la interfaz de usuario.
- Los archivos JSON complejos se ingestarán tal cual, dando lugar a matrices como entradas de tabla. Esto no es recomendable para una visualización y análisis óptimos de los datos.
- Las claves de los archivos JSON deben ir entre comillas para que se puedan analizar e interpretar correctamente.
Carga o ingestión de datos a través de la CLI
Un trabajo de ingestión en watsonx.data se puede ejecutar con la herramienta ibm-lh. La herramienta debe extraerse del ibm-lh-client e instalarse en el sistema local para ejecutar el trabajo de ingestión a través
de la CLI. Para obtener más detalles e instrucciones para instalar el paquete ibm-lh-client y utilizar la herramienta ibm-lh para la ingestión, consulte Instalación de ibm-lh-client y Configuración del programa de utilidad de línea de mandatos ibm-lh.
ibm-lh-client en el paquete IBM Client está obsoleto y se eliminará en una futura versión. La herramienta ibm-lh se sustituye por ./cpdctl wx-data ingestion soportada en la CLI IBM CPDCTL. Para obtener
más información sobre cómo utilizar IBM CPDCTL CLI, consulte IBM CPDCTL.
La herramienta ibm-lh y ./cpdctl wx-data ingestion Comando admite las siguientes funciones:
-
Descubrimiento automático del esquema basado en el archivo de origen o la tabla de destino.
-
Opciones avanzadas de configuración de tabla para los archivos CSV:
- Delimitador
- Cabecera
- Codificación de archivo
- Delimitador de línea
- Caracteres de escape
-
Ingestión de un único archivo, varios archivos o una única carpeta (sin subcarpetas) de S3 y archivos Parquet locales.
-
Ingestión de un único archivo, varios archivos o una única carpeta (sin subcarpetas) de S3 y archivos CSV locales.