Separe documentos para tornar os resultados da consulta mais sucinto

Divida seus documentos para que a função de busca possa encontrar informações mais concisas para retornar em resultados de consulta.

Para obter mais informações sobre os benefícios da divisão de documentos, leia a postagem do blog Usando IBM Watson Discovery no Medium.com.

É possível dividir apenas documentos aos quais um modelo Smart Document Understanding treinado pelo usuário é aplicado.

Quando se divide um documento, o documento original é quebrado em segmentos. Cada segmento contém um conjunto mais uniforme de informações. Ao dividir o conteúdo em seus documentos em grupos segmentados, você pode enriquecer e indexar seus dados em um nível mais granular.

Para controlar como os seus documentos são divididos, você especifica um campo, como subtitle ou question, para usar como marcador de quebra de página. As opções de quebra de página são preenchidas com campos que são criados quando você aplica um modelo Smart Document Understanding (SDU) treinado pelo usuário aos documentos. Para obter mais informações, consulte Usando o Smart Document Understanding Não é possível dividir documentos com campos gerados por um modelo de Smart Document Understanding pré-treinados.

Como um documento é reprocessado, ele é avaliado do início ao fim. Sempre que ocorre o campo marcador de quebra de página, o documento original é dividido e um novo segmento é criado. A divisão continua em cada campo marcador até que o documento original seja quebrado em diversos segmentos.

Antes de começar, decida qual campo usar como marcador de quebra de página.

  • Você pode usar qualquer um dos campos indexados por padrão. Para ver suas escolhas, marque a lista Campos para indexar. Campos que possuem um valor Tipo são armazenados no índice.
  • O número de segmentos por documento é limitado a 1,000. Após o número do segmento 999 ser criado, qualquer conteúdo de documento restante é armazenado dentro do segmento 1,000.
  • Os metadados dos documentos PDF e Microsoft Word e quaisquer metadados personalizados são extraídos e incluídos no índice com cada segmento.

Tenha cuidado com documentos que contenham seções de repetição, como um catálogo que tenha uma seção de descrição e especificações para cada entrada de produto. Se você dividir o documento em um nível demasiado granular, as subseções, como uma seção com detalhes de especificação, podem ser desassociadas do produto ao qual ele pertence.

Para dividir os documentos em uma coleção, preencha as seguintes etapas:

  1. Clique em Gerenciar coleções no painel de navegação, em seguida, clique para abrir uma coleção.

  2. Abra a página Gerenciar campos.

    É exibida uma lista dos campos identificados.

  3. Na seção Melhorar os resultados da consulta dividindo os documentos, clique em Dividir documento.

  4. Escolha o campo que você deseja usar como seu marcador de quebra de página a partir do dropdown campo Select.

    A lista que você pode escolher entre inclui um subconjunto de todos os campos identificados.

  5. Clique em Aplicar mudanças e processar novamente.

Você pode verificar o status do processo de divisão a partir da página Atividade.

O campo de metadados inclui o ID do documento pai. Cada segmento resultante do documento original pode conter informações diferentes.. Por exemplo, se você dividir o documento com base no campo de subtítulo, o primeiro segmento poderá conter apenas um campo de título O próximo segmento pode conter um subtítulo e um campo de texto.. O terceiro pode conter um campo de subtítulo, um campo de texto e um campo de rodapé

Atualização de documentos que foram divididos

Se um documento que foi dividido muda e você deseja fazer o upload do documento novamente, trabalhe com um desenvolvedor para substituir o documento usando a API. Um desenvolvedor pode usar o método Atualizar um documento para substituir o documento pai original. Para obter mais informações, consulte a referência da API. Para fornecer a variável de caminho {document_id} que deve ser enviada com a solicitação, copie o conteúdo do campo parent_document_id de um dos segmentos do documento.

Ao substituir o documento original, todos os segmentos são sobrescritos, a menos que a versão atualizada do documento tenha menos segmentos totais do que o original. Esses segmentos mais antigos permanecem no índice.

Como excluir segmentos de documentos do índice

Você pode excluir documentos em uma coleção a partir da página Gerenciar dados. Para encontrar todos os segmentos de documentos que foram gerados a partir de um único documento, verifique se há documentos com o mesmo valor de campo metadata.parent_document_id. Para obter mais informações, consulte Excluir conteúdo dos resultados da consulta.

IBM Cloud Pak for Data IBM Cloud Pak for Data antes da 4.6.5

A página Gerenciar dados está disponível em implementações instaladas começando com a liberação 4.6.5. Em liberações anteriores, um desenvolvedor pode excluir segmentos do documento usando a API. Para obter mais informações, consulte a API de documentos de exclusão.