Carga de datos

Puede realizar una carga de documentos única desde el sistema de archivos local en cualquier momento para añadir datos a un proyecto.

Puede cargar hasta 200 archivos a la vez.

Para procesar conjuntos de documentos de más de 200 archivos, puede añadirlos a un origen de datos externo y utilizar un rastreador de orígenes de datos para cargarlos. Para despliegues de IBM Cloud Pak for Data, puede utilizar un origen de datos Sistema de archivos local para este fin.

Para obtener más información sobre el tamaño máximo permitido para cada archivo, consulte Límites de documentos.

Antes de cargar un archivo CSV en un proyecto de Content Mining, considere la posibilidad de añadir cabeceras al archivo de origen para que los campos generados a partir del archivo tengan nombres significativos. Sin cabeceras, a los campos se les asignan nombres genéricos como, por ejemplo, column_0, column_1, etc.

Para cargar datos, siga estos pasos:

  1. Abra el proyecto, vaya a la página Gestionar colecciones y, a continuación, pulse Nueva colección.

  2. Realice lo siguiente en función del tipo de despliegue:

    IBM Cloud Pak for Data IBM Software Hub

    1. Elija Cargar datos como origen de datos y, a continuación, pulse Siguiente.

      También puede conectarse a un origen de datos diferente en lugar de cargar datos como, por ejemplo, reutilizar datos de una colección o rastrear un origen de datos externo. Para obtener más información, consulte Reutilización de datos de una recopilación y Visión general de los orígenes de datos de Cloud Pak for Data.

    2. Asigne un nombre a la colección. Si el idioma de los documentos almacenados no es el inglés, seleccione el idioma adecuado. Para ver una lista de los idiomas admitidos, consulte Soporte de idiomas.

    3. Opcionalmente, pulse Más valores de proceso para expandir el menú. Puede seleccionar los siguientes ajustes:

      • Establezca el conmutador Aplicar reconocimiento óptico de caracteres (OCR) en Activado para habilitar OCR.

        Cuando OCR está habilitado y los documentos contienen imágenes, el proceso tarda más tiempo. Para obtener más información, consulte Reconocimiento de caracteres ópticos.

      • Establezca Utilizar lematización en lugar de lematización al indexar el conmutador en Activado para utilizar lematización en lugar de lematización para normalizar palabras en el índice y las consultas. Para obtener más información, consulte Habilitación de la lematización para datos no organizados.

    4. Pulse Siguiente

    5. Cargue los datos examinando los archivos que desea rastrear.

      Puede arrastrar los documentos que desea añadir a la colección.

      Para obtener más información sobre los tipos de archivo soportados, consulte Tipos de archivo soportados.

    6. Pulse Finalizar.

    IBM Cloud

    1. Asigne un nombre a la colección. Si el idioma de los documentos almacenados no es el inglés, seleccione el idioma adecuado. Para ver una lista de los idiomas admitidos, consulte Soporte de idiomas.

    2. Cargue los datos examinando los archivos que desea añadir.

      Puede arrastrar los documentos que desea añadir a la colección.

      Para obtener más información sobre los tipos de archivo soportados, consulte Tipos de archivo soportados.

      También puede conectarse a un origen de datos diferente en lugar de cargar datos como, por ejemplo, reutilizar datos de una colección o rastrear un origen de datos externo. Para conectarse a un origen de datos diferente, pulse el enlace situado junto a ¿Necesita conectarse a un origen de datos? . Para obtener más información, consulte Reutilización de datos de una recopilación y Visión general de orígenes de datos de nube.

    3. Opcionalmente, pulse Más valores de proceso para expandir el menú. Puede seleccionar lo siguiente:

      • Establezca el conmutador Aplicar reconocimiento óptico de caracteres (OCR) en Activado para habilitar OCR.

        Cuando OCR está habilitado y los documentos contienen imágenes, el proceso tarda más tiempo. Para obtener más información, consulte Reconocimiento de caracteres ópticos.

      • Establezca Utilizar lematización en lugar de lematización al indexar el conmutador en Activado para utilizar lematización en lugar de lematización para normalizar palabras en el índice y las consultas. Para obtener más información, consulte Habilitación de la lematización para datos no organizados

    4. Pulse Finalizar.

La carga del archivo se ha completado rápidamente. Los datos tardan más tiempo en procesarse a medida que se añaden a la colección. Después de cargar y procesar los archivos, la página Actividad muestra los resultados de la carga.

A diferencia de los orígenes de datos rastreados, no puede planificar actualizaciones regulares para los archivos cargados. Si desea añadir una versión posterior de un archivo, suprima la versión anterior del archivo y, a continuación, cargue la versión más reciente.

Para obtener información sobre cómo resolver los problemas que puede encontrar al añadir documentos a una colección, consulte Resolución de problemas de ingestión.

Para obtener más información sobre lo que sucede a continuación, consulte Cómo se procesa el origen de datos.