Aplicar um modelo SDU pré-treinado

Aplique um modelo Smart Document Understanding (SDU) pré-construído que possa extrair texto e que seja treinado para identificar tabelas, listas e seções em documentos

Use o modelo pré-treinado se seus documentos contêm tabelas com informações valiosas que você deseja capturar. O modelo também é capaz de preservar o significado inerente à estrutura de nidificação de tabelas, listas e seções. O uso do modelo pré-treinado acelera o processo de captura de informações da estrutura de um documento.

Se você deseja customizar como a estrutura do documento é usada para inferir significado a partir de um documento ou deseja dividir documentos com um campo que é gerado por um modelo SDU, crie um modelo treinado pelo usuário em vez disso. Para obter mais informações, consulte Definir um modelo SDU treinado pelo usuário.

Um modelo pré-treinado é aplicado em projetos Document Retrieval for Contracts automaticamente. Em vez de você anotar conteúdo relacionado a anticoncepcionais em seus documentos, o projeto aplica um modelo que já sabe reconhecer termos e conceitos que são significativos para os contratos.

Preparando documentos

Você pode aplicar um modelo SDU pré-treinado para os seguintes tipos de arquivo apenas:

  • Arquivos de imagem (PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Para uma lista completa de tipos de arquivo que Discovery suporta, consulte Tipos de arquivos suportados.

A Ferramenta Smart Document Entendendo utiliza reconhecimento de caracteres ópticos (OCR) para extrair texto de imagens nos arquivos que ele analisa. As imagens devem atender aos requisitos mínimos de qualidade que são suportados pela OCR. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.

A ferramenta não pode ler documentos com as seguintes características; removê-los da sua coleção antes de começar:

  • Os documentos que parecem ter texto que se sobrepõe a outro texto são considerados duplamente sobrepostos e não podem ser anotados.
  • Os documentos que contêm múltiplas colunas de texto em uma única página não podem ser anotados.

Quando você aplica um modelo de Smart Document Understanding, o tempo de conversão da sua coleção pode aumentar devido aos recursos necessários para aplicar o modelo de IA aos seus documentos.

Aplicar um modelo pré-treinado

Para aplicar um modelo de Smart Document Understanding pré-treinado para sua coleção, complete as seguintes etapas:

  1. Abra a página Gerenciar coleções a partir do painel de navegação.

  2. Selecione a coleção para a qual deseja aplicar o modelo.

  3. Abra a página Identificar campos.

  4. Escolha Modelos treinados pelo Pre

    A opção Apenas extração de texto é usada por padrão. Com este modelo, qualquer texto que seja reconhecido nos documentos de origem é indexado no campo text.

  5. Clique em Enviar e, em seguida, clique em Aplicar alterações e reprocesso.

Entendendo a saída

Se o modelo SDU localizar e processar uma estrutura, como uma tabela, no documento, ele armazenará uma representação da estrutura em um campo denominado enriched_{field}, em que {field} é o campo no qual a estrutura foi armazenada..

O extrato a seguir mostra a representação JSON de uma tabela do campo enriched_html de um documento que foi processado pelo modelo SDU pré-treinado.

Mostra um fragmento JSON que contém um campo enriched_html com um objeto de tabela que contém seções, como section_title, row_headers, table_headers, local, etc.
JSON table representation

Se você desejar extrair texto da estrutura processada, será possível usar o campo location para localizar os valores de índice que identificam onde a cadeia de texto começa e termina

Para obter mais informações sobre a estrutura de tabelas indexados, consulte Tabelas de entendimento

Questões de resolução de problemas

Siga estes workarounds se você experimentar problemas ao trabalhar com a ferramenta Smart Document Understanding.

Recursos insuficientes para processar documento

Erro
Quando você aplica um modelo pré-treinado à sua coleção, o processamento de documentos não é concluído com sucesso e uma mensagem Insufficient resources to process document é exibida.
Causa
O erro é exibido porque ocorrem erros de memória ocorridos durante o parse, identificação de estrutura ou fases de montagem do processo que constrói o modelo de aprendizado de máquina. Os recursos são insuficientes quando um ou mais dos documentos em sua coleção são muito grandes ou possuem mesas complexas demais para a ferramenta de manusear.
Solução
Reveja sua coleção para documentos grandes ou documentos com muitas tabelas e quebre-os em documentos mais menores antes de aplicar o modelo pré-treinado à coleção. Os limites exatos diferem com base na complexidade de seus documentos. Geralmente, separe documentos que tenham mais de 400 páginas e evite incluir mais de 20 tabelas complexas em um único documento.