Como seus dados são processados

Quando você se conecta a uma fonte de dados, Discovery processos as informações da fonte de dados para criar uma coleção.

O objetivo do processamento de uma fonte de dados é identificar informações significativas e marcá-la conforme ele é adicionado à coleção para que seja mais fácil encontrar e recuperar as informações posteriormente.

O processamento que é aplicado a todas as fontes de dados inclui as seguintes etapas:

  • Identificar documentos individuais na fonte de dados
  • Encontre campos nos documentos
  • Índice os campos

Você pode ver uma lista dos campos que foram indexados a partir da página Gerenciar campos.

  1. Vá até a página Gerenciar coleções e, em seguida, escolha a coleção.

    Certise-se de que o processamento da coleção esteja concluído primeiro. A página Atividade mostra o status de processamento.

  2. Clique na guia Gerenciar campos.

Os campos que são mostrados podem diferir com base em seus dados. No entanto, um subconjunto de campos é sempre listado. Esses campos, com nomes como footer e header, são derivados da ferramenta Smart Document Understanding (SDU), e são listados mesmo quando você não aplica explicitamente um modelo SDU para a coleção. (Para a lista completa de campos gerados SDU, veja Campos disponíveis.) Apenas os campos com um tipo de dado especificado são armazenados no índice da coleção.

Um dos campos gerados pelo SDU que é armazenado no índice é o campo text. O campo text geralmente contém o corpo principal de texto a partir do documento original. A maior parte do conteúdo que é retornado nos resultados da procura que você envia da página Melhorar e customizar se origina desse campo. Como analisar e retornar apenas pedaços relevantes de informações deste campo é determinado pela configuração de resultado da consulta que é utilizada pelo projeto. Para obter mais informações, consulte Visualizar os resultados da consulta padrão.

Mais processamento adiciam mais campos. E mais processamento é aplicado automaticamente dependendo do tipo de projeto. Quando os processos são executados em documentos em uma coleção, campos extras são adicionados para armazenar informações que estão associadas ao processo. Por exemplo, quando o enriquecimento de Entidades embutidas é aplicado em uma coleção, ele inicia um processo que adiciina campos com nomes que começam com enriched_{field_name}.entities aos documentos na coleção.

Como os campos são tratados

Para a maioria dos tipos de arquivo não estruturados, a maior parte do conteúdo do arquivo é adicionada a um campo denominado text. Para tipos de arquivos que possuem uma estrutura de dados inerente, tais arquivos JSON, nomes do arquivo de origem são usados para nomear os campos nos quais o conteúdo é armazenado. Ao fazer o upload de arquivos desse tipo, esteja ciente de algumas limitações de nomenclatura que existem para campos.

Os seguintes nomes de campo têm um significado especial. Se possível, não use esses nomes em seus arquivos de origem estruturados

  • document_id
  • highlight
  • html
  • metadata
  • parent_document_id
  • result_metadata
  • score
  • spans

Evite nomes de campo que atendam às seguintes condições. Os nomes de campo com esses caracteres restritos não são consultados.

  • Comece com os caracteres _, + e -. Por exemplo, +extracted-content.
  • Conter os caracteres ., , e #, ?, (, ) ou : ou espaços. Por exemplo, extracted content ou new:extracted-content
  • Termine com os números, por exemplo, extracted-content2

Para processar documentos no Discovery, todos os documentos em uma coleta devem ter o mesmo tipo de dado para um campo específico. Quando um tipo de dados de um campo específico varia entre documentos, o processo de indexação de campo falha e uma mensagem de erro de índice com falha é exibida na seção Avisos e erros em uma visão rápida da página Atividade para a coleta.

Campos HTML

O campo html no índice do documento armazena informações estruturais sobre o documento..

  • Se você usar a ferramenta Smart Document Understanding para anotação de uma coleção, a representação de documento será indexada no campo html
  • Se você usar a ferramenta Smart Document Understanding para aplicar um modelo pré-treinado a uma coleção, a representação de documento será indexada no campo html e no campo text..
  • O campo html possui um limite de tamanhos. Para obter mais informações, consulte Limites de campo

Nota sobre o aprimoramento de dados:

  • Se você desejar aplicar um enriquecimento que possa entender as tabelas em um documento, o documento deverá conter um campo html

Como as datas são tratadas

As datas são capturadas de diferentes maneiras por diferentes tipos de arquivo

Arquivos não estruturados

A melhor maneira de capturar informações de data do corpo de um documento com dados não estruturados é utilizar um enriquecimento do modelo de processamento de linguagem natural. Por exemplo, o enriquecimento de Entidades pré-construídas reconhece datas e as anota no campo text (ou outros campos do corpo com o tipo de dados String ). Em um documento onde o enriquecimento é aplicado, é possível encontrar datas procurando por campos que são rotulados como enriched_{fieldname}.entities.type=Date.

Dates from metadata date fields, such as extracted_metadata.publicationdate, are stored in the index as dates as long as the date format matches one of the supported date data type formats. You can't see nested fields from the Manage fields page. And when you view a search result as JSON, date field values are displayed as string values because the JSON editor shows the date as a string. However, values from date fields behave like dates. You can use greater than (>) or less than (<) operators with such fields in Discovery Query Language queries, for example.

Arquivos estruturados

Os arquivos de estrutura que você importar, como arquivos CSV ou JSON, podem conter campos de data que você deseja armazenar como tipos de dados de data. Discovery pode reconhecer muitos formatos de data. No entanto, você pode precisar adicionar um formato à lista. Para obter mais informações, consulte Configurações de formato de data.

Configurações do formato de data

Se os seus documentos tiverem um campo de nível raiz com informações de data nele, você poderá configurar o campo para ser um campo tipo de dados Date no índice.

Discovery reconhece os formatos de data a seguir automaticamente:

yyyy-MM-dd'T'HH:mm:ssZ
yyyy-MM-dd'T'HH:mm:ssXXX
yyyy-MM-dd'T'HH:mm:ss.SSSZ
yyyy-MM-dd'T'HH:mm:ss.SSSX
yyyy-MM-dd
M/d/yy
yyyyMMdd
yyyy/MM/dd

Se você armazenar datas em outros formatos, você pode adicionar o formato à lista de formatos suportados.

Para adicionar mais formatos de data, complete as seguintes etapas:

  1. A partir da página Gerenciar campos para a coleção, inclua um formato como uma nova linha no campo formatos de data.

    Especifique um formato de data que seja compatível com a classe Java SimpleDateFormat.

    Por exemplo, se os seus registros armazenam apenas os valores de ano para datas, inclua yyyy na lista de formatos de data suportados. Você pode então configurar o tipo de dados para o campo que contém um valor de um ano para Data, e reprocessar sua coleção. Como resultado, uma ocorrência de 2019 no campo de data é armazenada como 2019-01-01T05:00:00Z no índice.

    Ao incluir um formato de data, você deve especificar um fuso horário associado para a data.

  2. Especificar um fuso horário.

  3. Opcionalmente, selecione um locale de data.

    O código do idioma escolhido é usado para analisar um valor de sequência que representa a data para os campos do conjunto de dados de tipo de data. Por exemplo, ao usar o formato EEE, MM dd, yyyy, a localidade inglesa (Estados Unidos) pode analisar o valor da cadeia de caracteres "Wednesday, 07 01, 2020" e a localidade japonesa (Japão) pode analisar o mesmo valor da cadeia de caracteres "水曜日, 07 01, 2020".

  4. Se você já importou documentos com datas em formatos que não foram reconhecidos, reprocesse os documentos.

Discovery não pode armazenar uma data que é mencionada dentro de um campo de texto como um campo Date no índice. No entanto, é possível usar um enriquecimento como o enriquecimento Entidades para identificar datas que são mencionadas no texto.

Como os tipos de arquivos são tratados

Quando você faz o upload de um documento, dados no arquivo são indexados. Diferentes tipos de arquivos são tratados de forma diferente por Discovery.

arquivos CSV

Notas sobre a inclusão de dados:

  • Cada linha que é definida no arquivo CSV é adicionada ao índice como um documento separado, cada um com o mesmo parent_document_id.

    Os documentos-filhos geralmente têm um ID do documento com a sintaxe {parent-ID}_n em que {parent-ID} é o ID do documento do arquivo original que foi incluído e n é um número sequencial. Por exemplo, se você fizer upload de um arquivo CSV com 5 linhas, cinco documentos serão incluídos na coleção com IDs de documentos, como f5214225c1e03e25190ffcdfad8e84ff_0 por meio f5214225c1e03e25190ffcdfad8e84ff_4.

  • Não é possível ativar o recurso Optical Character Recognition (OCR) para arquivos CSV.

  • Se o arquivo CSV tiver cabeçalhos, os nomes de cabeçalho são usados para nomear os campos em que o conteúdo da coluna correspondente é armazenado. Não use nomes que tenham significado especial em Discovery. Certifique-se de que os nomes de campo estão em conformidade com as regras de nomenclatura, como não possuir espaços e nenhum número anexado. Por exemplo, você pode renomear o cabeçalho start date para start_date e label1 para label-one antes de adicionar o arquivo. Para obter mais informações, consulte Como os campos são tratados.

  • Quando um nome de cabeçalho de arquivo CSV contém caracteres restritos, o conversor de documentos remove automaticamente os caracteres restritos do nome do campo quando ele adicionar o campo resultante para o índice.

Nota sobre o aprimoramento de dados:

  • Não é possível aplicar modelos de Entendimento de Documento Smart pré-construídos ou treinados pelo usuário a arquivos CSV.

Arquivos HTML

Se você fizer upload de um arquivo HTML ou efetuar crawl de uma origem de dados com arquivos HTML, como um website, um campo html será gerado juntamente com o campo text Para obter mais informações, consulte Campos HTML..

Arquivos JSON

Notas sobre a inclusão de dados:

  • Nomes de objetos do arquivo JSON de origem são usados para nomear os campos em que o conteúdo é armazenado. Não use nomes que tenham significado especial em Discovery. Tenha certeza de que os nomes estão em conformidade com as regras de nomenclatura, como não ter espaços e nem números anexados. Por exemplo, você pode renomear o objeto updated on para updated_on e answer2 para answer-two antes de adicionar o arquivo. Para obter mais informações, consulte Como os campos são tratados.

  • Se um campo de nível raiz é uma matriz mas não contém nenhum item, o campo é omitido do índice.

  • Se um campo de nível raiz é uma matriz e contém apenas um item, a matriz é indexada como o tipo de dado de um item. Por exemplo, uma matriz string com uma string é indexada como uma string.

  • Se um campo aninhado contém uma matriz, mesmo que a matriz tenha apenas um valor, ela é indexada como uma matriz.

  • Se um campo de nível raiz é uma matriz e contém mais de um item, os dados são indexados como uma matriz.

  • Se você copiar JSON que é gerado por Discovery e então fazer o upload como um arquivo JSON, remova esses campos gerados pelo arquivo primeiro do arquivo: document_id, parent_document_id, filename e title.

  • Não é possível ativar o recurso Optical Character Recognition (OCR) para arquivos JSON.

  • Se seu documento de origem tiver um campo com o nome document_id, o campo será ignorado e não incluído no índice na coleção.

    Como o campo document_id em um arquivo JSON é manipulado mudou com a atualização da versão do 2023-03-31 da API. Antes da atualização, quando você fez upload de um arquivo JSON da interface com o usuário do produto ou usou a API para incluí-lo com o método Incluir documento, o valor no campo document_id do arquivo foi mostrado como o valor document_id nos resultados da consulta. No entanto, um ID do documento diferente foi designado a ele e armazenado no campo parent_document_id O ID do documento atribuído é o que foi retornado quando você chamou o método List documents e é o que teve de ser usado como document_id no endpoint URL para uma solicitação do método Delete document. Ao usar o método Atualizar documento para designar um novo document_id, o ID original continuou a ser retornado nos resultados da consulta. No entanto, o ID designado precisou ser usado para excluir o documento. Se você tiver um aplicativo que dependa do comportamento anterior, será possível especificar um número de versão anterior a 2023-03-31, como 2020-08-30, em suas chamadas da API.

Notas sobre o aprimoramento de dados:

  • Não é possível aplicar modelos de Understanding de Smart Document pré-construídos ou treinados pelo usuário a arquivos JSON.

  • Quando você aplica um enriquecimento em um campo a partir do arquivo JSON, o tipo de dados de campo é convertido em uma matriz. O campo é convertido em uma matriz mesmo que ele contenha um valor único. Por exemplo, "field1": "Discovery" torna-se "field1": ["Discovery"].

  • Apenas os primeiros 50.000 caracteres de um campo personalizado a partir de um arquivo JSON são enriquecidos.

  • Em tipos de projetos em que o enriquecimento Part of Speech (POS) é aplicado automaticamente, o enriquecimento é aplicado ao campo que contém a maior parte do conteúdo do arquivo no primeiro arquivo JSON incluído na coleção. Esse campo é determinado pelas seguintes regras:

    • Se um campo é denominado text, o enriquecimento POS é aplicado a ele.
    • O campo com o maior valor de cadeia e maior número de valores distintos é escolhido.
    • Se mais de um campo atender à condição anterior, um dos campos é escolhido aleatoriamente.
  • Se você deseja aplicar um enriquecimento em um campo aninhado, deve-se criar um projeto de Mineração de Conteúdo e, em seguida, aplicar o enriquecimento em campo. Se desejar usar um tipo de projeto diferente do Content Mining, será possível reutilizar a coleção criada com o tipo de projeto Content Mining em outro lugar. Para obter mais informações, consulte Aprespondendo enriquecimentos.

É possível especificar os objetos normalizations e conversions no método Atualizar uma coleção da API para mover ou mesclar campos JSON.

Como as passagens são derivadas

Discovery usa algoritmos sofisticados para determinar as melhores passagens de texto de todos os documentos que são retornados por uma consulta. Passagens são retornadas por documento por padrão. Eles são exibidos como uma seção dentro de cada resultado de consulta de documentos e são ordenados por relevância de passagem.

Discovery usa a detecção de limite de sentença para escolher uma passagem que inclui uma sentença completa. Ele procura passagens que possuem um comprimento aproximado de 200 caracteres, em seguida, olha para pedaços de conteúdo que são duas vezes esse comprimento para encontrar passagens que contêm sentenças completas. A detecção de limite de sentença funciona para todos os idiomas suportados e usa a lógica específica do idioma.

Para todos os tipos de projeto, exceto Pesquisa Conversacional, é possível alterar como as passagens são exibidas nos resultados da pesquisa a partir da página Customize display> Resultados da pesquisa. Por exemplo, é possível configurar o número de passagens que são mostradas por documento e o tamanho máximo de caracteres por passagem.