Aplicar un modelo de SDU preentrenado

Aplique un modelo de Smart Document Understanding (SDU) preconstruido que pueda extraer texto y esté entrenado para identificar tablas, listas y secciones en documentos.

Utilice el modelo entrenado previamente si los documentos contienen tablas con información valiosa que desea capturar. El modelo también puede conservar el significado inherente a la estructura de anidamiento de tablas, listas y secciones. El uso del modelo preentrenado acelera el proceso de captura de información de la estructura de un documento.

Si desea personalizar cómo se utiliza la estructura de documento para inferir el significado de un documento o desea dividir los documentos con un campo generado por un modelo SDU, cree un modelo entrenado por el usuario en su lugar. Para obtener más información, consulte Definir un modelo de SDU entrenado por el usuario.

Se aplica automáticamente un modelo entrenado previamente a los proyectos Recuperación de documentos para contratos. En lugar de anotar contenido relacionado con el contrato en los documentos, el proyecto aplica un modelo que ya sabe cómo reconocer términos y conceptos que son significativos para los contratos.

Preparación de documentos

Solo puede aplicar un modelo de SDU entrenado previamente a los siguientes tipos de archivo:

  • Archivos de imagen (PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Para obtener una lista completa de los tipos de archivo a los que Discovery da soporte, consulte Tipos de archivo soportados.

La herramienta Smart Document Understanding utiliza el reconocimiento óptico de caracteres (OCR) para extraer texto de imágenes en los archivos que analiza. Las imágenes deben cumplir los requisitos mínimos de calidad soportados por OCR. Para obtener más información, consulte Reconocimiento de caracteres ópticos.

La herramienta no puede leer documentos con las características siguientes; elimínelos de la colección antes de empezar:

  • Los documentos que parecen tener texto superpuesto a otro texto se consideran con doble superposición y no se pueden anotar.
  • Los documentos que contienen varias columnas de texto en una sola página no se pueden anotar.

Cuando aplicas un modelo de comprensión inteligente de documentos, el tiempo de conversión de tu colección puede aumentar debido a los recursos que se requieren para aplicar el modelo de IA a tus documentos.

Aplicar un modelo entrenado previamente

Para aplicar un modelo de Smart Document Understanding preentrenado a la colección, realice los pasos siguientes:

  1. Abra la página Gestionar colecciones desde el panel de navegación.

  2. Seleccione la colección a la que desea aplicar el modelo.

  3. Abra la página Identificar campos.

  4. Elija Modelos entrenados previamente

    La opción Sólo extracción de texto se utiliza de forma predeterminada. Con este modelo, cualquier texto que se reconozca en los documentos de origen se indexa en el campo text.

  5. Pulse Enviar y, a continuación, pulse Aplicar cambios y volver a procesar.

Descripción de la salida

Si el modelo SDU encuentra y procesa una estructura, como una tabla, en el documento, almacena una representación de la estructura en un campo denominado enriched_{field}, donde {field} es el campo donde se ha almacenado la estructura.

El extracto siguiente muestra la representación JSON de una tabla del campo enriched_html de un documento procesado por el modelo SDU preentrenado.

Muestra un fragmento de código JSON que contiene un campo enriched_html con un objeto de tabla que contiene secciones como section_title, row_headers, table_headers, location, etc.
JSON table representation

Si desea extraer texto de la estructura procesada, puede utilizar el campo location para buscar los valores de índice que identifican dónde empieza y termina la serie de texto.

Para obtener más información sobre la estructura de las tablas indexadas, consulte Visión general de las tablas.

Resolución de problemas

Siga estos métodos alternativos si experimenta problemas al trabajar con la herramienta Smart Document Understanding.

Recursos insuficientes para procesar el documento

Error
Cuando aplica un modelo entrenado previamente a la colección, el proceso de documentos no se completa correctamente y se muestra un mensaje Insufficient resources to process document.
Causa
El error se muestra porque se han producido errores de falta de memoria durante las fases de análisis, identificación de estructura o ensamblaje del proceso que crea el modelo de aprendizaje automático. Los recursos no son suficientes cuando uno o varios de los documentos de la colección son demasiado grandes o tienen demasiadas tablas complejas para que las maneje la herramienta.
Solución
Revise la colección en busca de documentos grandes o documentos con muchas tablas y dividiéndolos en documentos más pequeños antes de aplicar el modelo preentrenado a la colección. Los límites exactos difieren en función de la complejidad de sus documentos. En general, divida los documentos que tengan más de 400 páginas y evite incluir más de 20 tablas complejas en un único documento.