Definir um modelo SDU treinado pelo usuário

Crie um modelo de Smart Document Understanding (SDU) que aprenda sobre o conteúdo de um documento com base na estrutura do documento.

Use a ferramenta Smart Document Understanding para adicionar campos personalizados a uma coleção para que você possa fazer as seguintes coisas:

  • Destinar-se a enriquecimentos pré-construídos ou customizados em seções específicas de um documento.
  • Quebre documentos grandes em documentos menores.

Para ajudar a decidir se SDU pode ajudar o seu caso de uso, leia Quando usar o Smart Document Understanding.

Se capturar informações de tabelas é fundamental para o seu caso de uso, considere usar um modelo pré-treinado. Para obter mais informações sobre a criação de um modelo SDU pré-treinado, consulte Aplicar um modelo SDU pré-treinado.

Quando usar o Smart Document Understanding

A Ferramenta Smart Document Entendendo (SDU) funciona melhor com alguns tipos de projeto.

  • A ferramenta é mais benéfica quando usada com projetos Document Retrieval. Use a ferramenta para quebrar seus documentos em pedaços menores e mais consumíveis de informações. Quando você ajuda Discovery indexar o conjunto correto de informações em seus documentos, você melhora as respostas que seu aplicativo pode encontrar e retornar.

    Por exemplo, seus documentos podem conter dicas que são mostradas em seções com um título H4. Se você deseja extrair as informações dessas dicas separadamente, você pode adicionar um campo que é nomeado tips, e ensinar o modelo a reconhecê-lo. Depois de aplicar o modelo em sua coleção, você pode aplicar um enriquecimento somente no campo tips. Posteriormente, é possível limitar a pesquisa para retornar conteúdo de apenas o campo tips.

    Ou talvez você tenha documentos extra grandes que contêm subseções. Você pode ensinar o modelo SDU a reconhecer essas subseções, e depois dividir o grande documento em documentos múltiplos, menores e mais fáceis de gerenciar que começam com uma dessas subseções.

  • A melhor maneira de preparar uma coleção para uso em projetos Pesquisa Conversacional é identificar pares de questionamento e resposta discretos. Você pode usar a ferramenta SDU para localizá-los e anotá-los. Se você configurar o projeto para conter respostas em um campo de resposta, você deve atualizar a configuração da pesquisa em watsonx Assistant para obter o corpo da resposta do campo de resposta personalizado.

  • Um modelo SDU pré-treinado é aplicado em projetos de Retrieval de Documentos para Contratos automaticamente. O modelo SDU pré-treinado sabe reconhecer termos e conceitos que são significativos para os contratos. Como resultado, você não pode aplicar um modelo SDU treinado pelo usuário para este tipo de projeto, mas também não precisa.

  • A ferramenta SDU raramente é usada com projetos Content Mining.

Você pode usar a ferramenta SDU para anotar os seguintes tipos de arquivo apenas:

  • Arquivos de imagem (PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Para uma lista completa de tipos de arquivo que Discovery suporta, consulte Tipos de arquivos suportados.

A Ferramenta Smart Document Entendendo utiliza reconhecimento de caracteres ópticos (OCR) para extrair texto de imagens nos arquivos que ele analisa. As imagens devem atender aos requisitos mínimos de qualidade que são suportados pela OCR. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.

A ferramenta não pode ler documentos com as seguintes características; removê-los da sua coleção antes de começar:

  • Os documentos que parecem ter texto que se sobrepõe a outro texto são considerados duplamente sobrepostos e não podem ser anotados.
  • Os documentos que contêm múltiplas colunas de texto em uma única página não podem ser anotados.

Quando você cria um modelo personalizado de Smart Document Understanding, o tempo de conversão da sua coleção pode aumentar devido aos recursos necessários para aplicar o modelo de IA aos seus documentos.

Início com documentos representativos

Os documentos vêm em todas as formas e tamanhos. Sua coleção pode ter uma mistura de estruturas de documentos diferentes. O Smart Document Entendendo funciona melhor quando os documentos em uma única coleção possuem características de estilo semelhantes. Por exemplo, os documentos usam tamanhos de fonte consistentes e cores para títulos e cabeçalhos, e tabelas no documento possuem layouts semelhantes. Para criar o melhor modelo para sua coleção, tome esta etapa de pré-requisito:

  1. Revise seus documentos para procurar padrões de estilo e layout e, em seguida, separe os documentos em grupos com base em seu estilo.

    Por exemplo, se seus dados contém documentos que seguem quatro estilos de formatação diferentes, quebre os documentos em quatro coleções separadas, uma para cada estilo. Adiciam documentos com layout uniforme e estilo a cada coleção. Um bom tamanho de destino por coleção é de 40 documentos.

  2. Use a ferramenta SDU para anotar este conjunto representativo de documentos e treinar o Watson para reconhecer conteúdo personalizado em seus dados.

  3. Aplique o modelo SDU personalizado para a coleção completa. Para obter mais informações, consulte Modelos de SDU Reutilizando.

Criando o modelo

Para aplicar um modelo Smart Document Understanding treinado pelo usuário para sua coleção, complete as seguintes etapas:

  1. Abra a página Gerenciar coleções a partir do painel de navegação.

  2. Se o seu projeto tiver mais de uma coleção, selecione a coleção com documentos que você deseja anotar.

  3. Abra a página Identificar campos.

  4. Escolha Modelos treinados pelo usuário.

    A opção Apenas extração de texto é usada por padrão. Com este modelo, qualquer texto que seja reconhecido nos documentos de origem é indexado no campo text.

  5. Clique em Enviar e, em seguida, clique em Aplicar alterações e reprocesso.

Um subconjunto de documentos está disponível para você anotar. Um conjunto de 20-50 documentos é exibido em uma lista. O número de documentos que estão disponíveis difere com base em vários fatores, incluindo o número geral de documentos em sua coleção e quantas delas são tipos de arquivo suportados.

Se algum documento de treinamento, que é usado para treinar um modelo de SDU, sofrer alterações de layout ou estrutura em Discovery, as anotações anteriores não serão mais válidas. Para atualizar o modelo SDU, você deve anotar os documentos atualizados novamente depois de ingeri-los. Caso contrário, as anotações anteriores serão mapeadas incorretamente com o conteúdo do texto, e as páginas de anotação correspondentes na interface do usuário ficarão confusas.

Vídeo de rotulagem

O vídeo a seguir mostra como selecionar um rótulo e, em seguida, aplicá-lo em uma representação do texto em seu documento.

No vídeo, o usuário clica no rótulo do campo title e, em seguida, clica no bloco de texto que representa o título da página Índice para rotular o texto como título. Em seguida, o usuário clica no rótulo do campo table_of_contents e seleciona o bloco de texto do índice para rotulá-lo.. Em seguida, o usuário clica no rótulo do campo footer e no bloco de texto que representa o rodapé da página. Depois que o texto é rotulado, o usuário clica no botão Enviar página

Etiquetar os documentos

Antes de começar, consiga uma sensação para a estrutura do documento que planeja anotar. Existem seções legendadas que você quer que o Discovery volte por resposta? Se sim, identifique todas as legendas. Mais tarde é possível dividir o documento em subdocumentos discretos, cada um começando com um subtítulo. Para obter mais informações, consulte Quando utilizar o Smart Document Understanding.

Para rotular documentos, preencha as seguintes etapas:

  1. Revise a pré-visualização do documento.

    Uma visualização do documento original é exibida juntamente com uma representação do documento, em que o texto é substituído por blocos.

    Os blocos são toda a cor da etiqueta de campo text porque todo o texto atual é considerado como texto padrão e será indexado no campo text.

    Blocos de etiquetas que representam tipos específicos de informação, como títulos ou rodapé de página, com outras etiquetas de campo. Por exemplo, quando você aplica o rótulo de campo de título a um título de documento que, de outra forma, seria indexado como texto, você está definindo uma representação mais precisa do conteúdo do documento.

    O processo de utilização de etiquetas para identificar diferentes partes da estrutura do documento é chamado de anotar o documento.

  2. Revise os rótulos de campo que podem ser usados para anotar o documento. Eles são exibidos no painel Rótulos de campo.

    Consulte a tabela Rótulos de campo padrão para obter uma lista dos campos e suas descrições.

  3. Para criar um rótulo de campo customizado, clique em Criar novo.

    • Especifique um rótulo de campo sem espaços.. Por exemplo, complex_task é um rótulo de campo válido.

      Evite usar um nome de rótulo de campo ou incluir caracteres, como um sinal de número (#) ou ponto (.), no nome que tenham significado especial para Discovery. Para obter mais informações, consulte Como os campos são tratados.

    • Se você deseja alterar a cor que é usada para representar o campo, clique repetidamente no bloco de cores Praça bloco de cor com duas setas que apontem em um círculo até ser exibido na cor que você deseja usar.

      Não é possível alterar a cor do rótulo de campo posteriormente.

    • Clique em Criar.

  4. Primeiro, clique em um rótulo de campo para ativá-lo.

  5. Em seguida, clique no bloco que representa o conteúdo que deseja rotular como o tipo de campo.

    O bloco muda para a cor da etiqueta de campo. Você rotulou com sucesso o campo!

  6. Repita esse processo para anotar mais campos no documento.

    Não se preocupe. Você não precisa rotular cada página. À medida que você aplica etiquetas e submete páginas, Watson aprende com o que você anota e começa a prever anotações.

    Siga estas instruções:

    • Se não houver nada de especial sobre uma seção, deixe-a rotulada como text, que é aplicada por padrão.
    • Uma etiqueta não pode abranger várias páginas.
    • Não trate o texto em negrito, itálico ou sublinhado de forma diferente. Rotule com base no contexto, não no estilo.
    • Use etiquetas consistentes em todos os documentos.
    • Trabalhe a partir da primeira página de um documento multipágina até o último.
    • Para remover uma anotação única, escolha outro rótulo (como text) e aplique-o no item para sobrescrever a anotação anterior.
    • Para remover anotações que adicionou em uma página inteira, clique no ícone Limpar mudanças na barra de ferramentas.
    • Para anotar uma tabela, clique no texto no início da tabela e, em seguida, arraste para selecionar o texto em toda a tabela.
    • Ao rotular uma ou mais tabelas, o enriquecimento Table Understanding é ativado para a coleta inteira automaticamente. Para mais informações, consulte tabelas Understanding.
    • As imagens dos documentos de origem não são renderizada na preview. Se Reconhecimento de Caracteres Ópticos (OCR) estiver ativado, qualquer texto da imagem ou diagrama é extraído e renderizado no preview.
    • Não rotular o espaço em branco.
  7. Quando tudo o que você deseja rotular é rotulado, envie a página. Clique em Enviar página.

    Continue a anotar documentos até que o Watson possa mapear corretamente e consistentemente mapear diferentes tipos de conteúdo para os campos apropriados para você.

  8. Depois de ensinar o Watson a identificar campos, clique em Aplicar alterações e reprocessar.

Os campos personalizados que você define usando a ferramenta SDU são indexados como campos de nível raiz.

O que fazer a seguir

Quando você constrói um modelo treinado pelo usuário, você muda onde as informações são armazenadas em seus documentos. Em seguida, altere como os resultados da pesquisa estão configurados. Por padrão, os resultados da pesquisa são recuperados a partir de passagens ou do campo de texto. Você pode ter um campo melhor para usar como a origem do corpo do resultado. Para mais informações, consulte Alterando o conteúdo do resultado.

Se o seu projeto estiver sendo usado por um assistente virtual, atualize a configuração de habilidade de busca para puxar o corpo de resposta de um campo diferente. Para obter mais informações, consulte Configurar a pesquisa.

Você pode aplicar enriquecimentos, customizados ou enriquecimentos pré-construídos, para os novos campos raiz que são gerados pelo modelo SDU.

Se você deseja retornar trecho de texto mais curto com um resultado de pesquisa, você pode dividir seus documentos com base em um dos novos campos que você definiu, como capítulo ou seção.

Campos disponíveis

Os campos a seguir estão disponíveis para você se candidar a documentos usando a ferramenta Smart Document Understanding.

Os campos são arbitrários. Você pode aplicar o campo image a cada título no documento se desejar. Embora, pode ser difícil saber qual campo pesquisar posteriormente para obter informações que você precisa se os nomes de campo não combinam com o conteúdo. O conjunto padrão são tipos de campo representativos que são feitos para ajudá-lo a ser iniciado. Apenas os campos text e table têm significado especial. Não os utilize para identificar qualquer coisa que não seja texto e tabelas.

Etios de campo padrão
Campo Definição
answer Em um par de perguntas e respostas (geralmente em uma FAQ), a resposta à pergunta.
author Nome do autor ou autores.
footer Use essa tag para indicar meta-informações sobre o documento (como o número da página ou referências), que aparecem no final da página.
header Use essa tag para indicar meta-informações sobre o documento que aparecem no início da página.
question Em um par de perguntas e respostas (geralmente em uma FAQ), a pergunta.
subtitle O título secundário do documento.
table_of_contents Use essa tag em listas no índice do documento.
text Por padrão, cada bloco de texto no documento é rotulado como texto. Aplique etiquetas diferentes apenas a blocos de texto com significado especial.
title O título principal do documento.
table Use essa tag para anotar tabelas em seu documento.
image As imagens não são mostradas no preview do documento. Se você ativar OCR, texto a partir de uma imagem ou diagrama é exibido na preview em vez disso. Se você deseja evitar que textos de algumas imagens sejam incluídos em resultados de pesquisa, marque o texto da imagem como uma imagem. Você pode excluir o campo de imagem do índice posteriormente.

Reutilizando modelos SDU

Depois de definir um modelo com a ferramenta SDU, você pode salvá-lo e reutilizá-lo em outras coleções, exportando-o de uma coleção e importando-a para outra.

Importar um novo modelo sobrescreve o modelo existente em uma coleção. Se o modelo existente já tiver sido treinado, como por meio de rótulos e anotações de campo customizados, a importação de um novo modelo afetará a coleção e poderá resultar em perda de dados

Para reutilizar um modelo, conclua as etapas a seguir:

  1. Exporte o modelo que você deseja reutilizar. A partir do menu da barra de ferramentas SDU, selecione Modelo de Exportação.

    Menu de importação e
    de importação e

  2. Crie a coleção onde deseja reutilizar o modelo. Adicione apenas um documento à coleção no início.

  3. Importe o modelo a partir da barra de ferramentas SDU. O modelo exportado tem uma extensão de arquivo de .sdumodel.

  4. Acrescente o restante dos documentos para a coleta. Abra a guia Atividade da página Gerenciar coleções e, em seguida, clique em Upload de dados para adicionar mais arquivos na coleção.

Use o modelo importado como-é. Não faça mais anotações. Se você fizer anotações depois de importar o arquivo .sdumodel, o modelo importado será sobrescrito.

Documento Inteligente Compreendendo limites

O número de campos personalizados que você pode criar por modelo Smart Document Understanding depende do seu tipo de plano Discovery.

Limites de campo personalizados
Plano Campos personalizados por modelo SDU
Cloud Pak for Data Ilimitada
Premium 100
Enterprise 100
Mais (inclui Trial) 40

O número máximo de documentos que você pode anotar para treinar um modelo SDU por coleção depende do seu tipo de plano Discovery.

Limites de conjunto de treinamento
Plano Documentos por coleção
Cloud Pak for Data 40
Premium 40
Enterprise 40
Mais (inclui Trial) 40

Gerenciando campos

A guia Gerenciar campos contém várias opções:

Identificar campos para indexar
Para obter mais informações, consulte Excluir conteúdo dos resultados da consulta.
Melhore os resultados da consulta dividindo seus documentos
Para obter mais informações, consulte Divestes documentos para tornar os resultados da consulta mais sucintos.
Configurações do formato de data
Para obter mais informações, consulte Configurações de formato de data.

Para acessar a página Gerenciar campos, clique no ícone Gerenciar coleções no painel de navegação e abra uma coleção. Clique na guia Gerenciar campos. Para obter mais informações sobre coleções, consulte Criando coleções.