Como seus dados são processados
Quando você se conecta a uma fonte de dados, Discovery processos as informações da fonte de dados para criar uma coleção.
O objetivo do processamento de uma fonte de dados é identificar informações significativas e marcá-la conforme ele é adicionado à coleção para que seja mais fácil encontrar e recuperar as informações posteriormente.
O processamento que é aplicado a todas as fontes de dados inclui as seguintes etapas:
- Identificar documentos individuais na fonte de dados
- Encontre campos nos documentos
- Índice os campos
Você pode ver uma lista dos campos que foram indexados a partir da página Gerenciar campos.
-
Vá até a página Gerenciar coleções e, em seguida, escolha a coleção.
Certise-se de que o processamento da coleção esteja concluído primeiro. A página Atividade mostra o status de processamento.
-
Clique na guia Gerenciar campos.
Os campos que são mostrados podem diferir com base em seus dados. No entanto, um subconjunto de campos é sempre listado. Esses campos, com nomes como footer e header, são derivados da ferramenta Smart Document Understanding
(SDU), e são listados mesmo quando você não aplica explicitamente um modelo SDU para a coleção. (Para a lista completa de campos gerados SDU, veja Campos disponíveis.)
Apenas os campos com um tipo de dado especificado são armazenados no índice da coleção.
Um dos campos gerados pelo SDU que é armazenado no índice é o campo text. O campo text geralmente contém o corpo principal de texto a partir do documento original. A maior parte do conteúdo que é retornado nos resultados
da procura que você envia da página Melhorar e customizar se origina desse campo. Como analisar e retornar apenas pedaços relevantes de informações deste campo é determinado pela configuração de resultado da consulta que é utilizada
pelo projeto. Para obter mais informações, consulte Visualizar os resultados da consulta padrão.
Mais processamento adiciam mais campos. E mais processamento é aplicado automaticamente dependendo do tipo de projeto. Quando os processos são executados em documentos em uma coleção, campos extras são adicionados para armazenar informações que
estão associadas ao processo. Por exemplo, quando o enriquecimento de Entidades embutidas é aplicado em uma coleção, ele inicia um processo que adiciina campos com nomes que começam com enriched_{field_name}.entities aos documentos
na coleção.
- Para obter mais informações sobre os enriquecimentos que são aplicados por padrão, consulte Configurações de projeto padrão.
Como os campos são tratados
Para a maioria dos tipos de arquivo não estruturados, a maior parte do conteúdo do arquivo é adicionada a um campo denominado text. Para tipos de arquivos que possuem uma estrutura de dados inerente, tais arquivos JSON, nomes do
arquivo de origem são usados para nomear os campos nos quais o conteúdo é armazenado. Ao fazer o upload de arquivos desse tipo, esteja ciente de algumas limitações de nomenclatura que existem para campos.
Os seguintes nomes de campo têm um significado especial. Se possível, não use esses nomes em seus arquivos de origem estruturados
document_idhighlighthtmlmetadataparent_document_idresult_metadatascorespans
Evite nomes de campo que atendam às seguintes condições. Os nomes de campo com esses caracteres restritos não são consultados.
- Comece com os caracteres
_,+e-. Por exemplo,+extracted-content. - Conter os caracteres
.,,e#,?,(,)ou:ou espaços. Por exemplo,extracted contentounew:extracted-content - Termine com os números, por exemplo,
extracted-content2
Para processar documentos no Discovery, todos os documentos em uma coleta devem ter o mesmo tipo de dado para um campo específico. Quando um tipo de dados de um campo específico varia entre documentos, o processo de indexação de campo falha e uma mensagem de erro de índice com falha é exibida na seção Avisos e erros em uma visão rápida da página Atividade para a coleta.
Campos HTML
O campo html no índice do documento armazena informações estruturais sobre o documento..
- Se você usar a ferramenta Smart Document Understanding para anotação de uma coleção, a representação de documento será indexada no campo
html - Se você usar a ferramenta Smart Document Understanding para aplicar um modelo pré-treinado a uma coleção, a representação de documento será indexada no campo
htmle no campotext.. - O campo
htmlpossui um limite de tamanhos. Para obter mais informações, consulte Limites de campo
Nota sobre o aprimoramento de dados:
- Se você desejar aplicar um enriquecimento que possa entender as tabelas em um documento, o documento deverá conter um campo
html
Como as datas são tratadas
As datas são capturadas de diferentes maneiras por diferentes tipos de arquivo
- Arquivos não estruturados
-
A melhor maneira de capturar informações de data do corpo de um documento com dados não estruturados é utilizar um enriquecimento do modelo de processamento de linguagem natural. Por exemplo, o enriquecimento de Entidades pré-construídas reconhece datas e as anota no campo
text(ou outros campos do corpo com o tipo de dadosString). Em um documento onde o enriquecimento é aplicado, é possível encontrar datas procurando por campos que são rotulados comoenriched_{fieldname}.entities.type=Date.Dates from metadata date fields, such as
extracted_metadata.publicationdate, are stored in the index as dates as long as the date format matches one of the supported date data type formats. You can't see nested fields from the Manage fields page. And when you view a search result as JSON, date field values are displayed as string values because the JSON editor shows the date as a string. However, values from date fields behave like dates. You can use greater than (>) or less than (<) operators with such fields in Discovery Query Language queries, for example. - Arquivos estruturados
-
Os arquivos de estrutura que você importar, como arquivos CSV ou JSON, podem conter campos de data que você deseja armazenar como tipos de dados de data. Discovery pode reconhecer muitos formatos de data. No entanto, você pode precisar adicionar um formato à lista. Para obter mais informações, consulte Configurações de formato de data.
Configurações do formato de data
Se os seus documentos tiverem um campo de nível raiz com informações de data nele, você poderá configurar o campo para ser um campo tipo de dados Date no índice.
Discovery reconhece os formatos de data a seguir automaticamente:
yyyy-MM-dd'T'HH:mm:ssZ
yyyy-MM-dd'T'HH:mm:ssXXX
yyyy-MM-dd'T'HH:mm:ss.SSSZ
yyyy-MM-dd'T'HH:mm:ss.SSSX
yyyy-MM-dd
M/d/yy
yyyyMMdd
yyyy/MM/dd
Se você armazenar datas em outros formatos, você pode adicionar o formato à lista de formatos suportados.
Para adicionar mais formatos de data, complete as seguintes etapas:
-
A partir da página Gerenciar campos para a coleção, inclua um formato como uma nova linha no campo formatos de data.
Especifique um formato de data que seja compatível com a classe Java SimpleDateFormat.
Por exemplo, se os seus registros armazenam apenas os valores de ano para datas, inclua
yyyyna lista de formatos de data suportados. Você pode então configurar o tipo de dados para o campo que contém um valor de um ano para Data, e reprocessar sua coleção. Como resultado, uma ocorrência de2019no campo de data é armazenada como2019-01-01T05:00:00Zno índice.Ao incluir um formato de data, você deve especificar um fuso horário associado para a data.
-
Especificar um fuso horário.
-
Opcionalmente, selecione um locale de data.
O código do idioma escolhido é usado para analisar um valor de sequência que representa a data para os campos do conjunto de dados de tipo de data. Por exemplo, ao usar o formato
EEE, MM dd, yyyy, a localidade inglesa (Estados Unidos) pode analisar o valor da cadeia de caracteres"Wednesday, 07 01, 2020"e a localidade japonesa (Japão) pode analisar o mesmo valor da cadeia de caracteres"水曜日, 07 01, 2020". -
Se você já importou documentos com datas em formatos que não foram reconhecidos, reprocesse os documentos.
Discovery não pode armazenar uma data que é mencionada dentro de um campo de texto como um campo Date no índice. No entanto, é possível usar um enriquecimento como o enriquecimento Entidades para identificar datas que são mencionadas no texto.
Como os tipos de arquivos são tratados
Quando você faz o upload de um documento, dados no arquivo são indexados. Diferentes tipos de arquivos são tratados de forma diferente por Discovery.
arquivos CSV
Notas sobre a inclusão de dados:
-
Cada linha que é definida no arquivo CSV é adicionada ao índice como um documento separado, cada um com o mesmo
parent_document_id.Os documentos-filhos geralmente têm um ID do documento com a sintaxe
{parent-ID}_nem que {parent-ID} é o ID do documento do arquivo original que foi incluído e n é um número sequencial. Por exemplo, se você fizer upload de um arquivo CSV com 5 linhas, cinco documentos serão incluídos na coleção com IDs de documentos, comof5214225c1e03e25190ffcdfad8e84ff_0por meiof5214225c1e03e25190ffcdfad8e84ff_4. -
Não é possível ativar o recurso Optical Character Recognition (OCR) para arquivos CSV.
-
Se o arquivo CSV tiver cabeçalhos, os nomes de cabeçalho são usados para nomear os campos em que o conteúdo da coluna correspondente é armazenado. Não use nomes que tenham significado especial em Discovery. Certifique-se de que os nomes de campo estão em conformidade com as regras de nomenclatura, como não possuir espaços e nenhum número anexado. Por exemplo, você pode renomear o cabeçalho
start dateparastart_dateelabel1paralabel-oneantes de adicionar o arquivo. Para obter mais informações, consulte Como os campos são tratados. -
Quando um nome de cabeçalho de arquivo CSV contém caracteres restritos, o conversor de documentos remove automaticamente os caracteres restritos do nome do campo quando ele adicionar o campo resultante para o índice.
Nota sobre o aprimoramento de dados:
- Não é possível aplicar modelos de Entendimento de Documento Smart pré-construídos ou treinados pelo usuário a arquivos CSV.
Arquivos HTML
Se você fizer upload de um arquivo HTML ou efetuar crawl de uma origem de dados com arquivos HTML, como um website, um campo html será gerado juntamente com o campo text Para obter mais informações, consulte Campos HTML..
Arquivos JSON
Notas sobre a inclusão de dados:
-
Nomes de objetos do arquivo JSON de origem são usados para nomear os campos em que o conteúdo é armazenado. Não use nomes que tenham significado especial em Discovery. Tenha certeza de que os nomes estão em conformidade com as regras de nomenclatura, como não ter espaços e nem números anexados. Por exemplo, você pode renomear o objeto
updated onparaupdated_oneanswer2paraanswer-twoantes de adicionar o arquivo. Para obter mais informações, consulte Como os campos são tratados. -
Se um campo de nível raiz é uma matriz mas não contém nenhum item, o campo é omitido do índice.
-
Se um campo de nível raiz é uma matriz e contém apenas um item, a matriz é indexada como o tipo de dado de um item. Por exemplo, uma matriz string com uma string é indexada como uma string.
-
Se um campo aninhado contém uma matriz, mesmo que a matriz tenha apenas um valor, ela é indexada como uma matriz.
-
Se um campo de nível raiz é uma matriz e contém mais de um item, os dados são indexados como uma matriz.
-
Se você copiar JSON que é gerado por Discovery e então fazer o upload como um arquivo JSON, remova esses campos gerados pelo arquivo primeiro do arquivo:
document_id,parent_document_id,filenameetitle. -
Não é possível ativar o recurso Optical Character Recognition (OCR) para arquivos JSON.
-
Se seu documento de origem tiver um campo com o nome
document_id, o campo será ignorado e não incluído no índice na coleção.Como o campo
document_idem um arquivo JSON é manipulado mudou com a atualização da versão do2023-03-31da API. Antes da atualização, quando você fez upload de um arquivo JSON da interface com o usuário do produto ou usou a API para incluí-lo com o método Incluir documento, o valor no campodocument_iddo arquivo foi mostrado como o valordocument_idnos resultados da consulta. No entanto, um ID do documento diferente foi designado a ele e armazenado no campoparent_document_idO ID do documento atribuído é o que foi retornado quando você chamou o método List documents e é o que teve de ser usado comodocument_idno endpoint URL para uma solicitação do método Delete document. Ao usar o método Atualizar documento para designar um novodocument_id, o ID original continuou a ser retornado nos resultados da consulta. No entanto, o ID designado precisou ser usado para excluir o documento. Se você tiver um aplicativo que dependa do comportamento anterior, será possível especificar um número de versão anterior a 2023-03-31, como2020-08-30, em suas chamadas da API.
Notas sobre o aprimoramento de dados:
-
Não é possível aplicar modelos de Understanding de Smart Document pré-construídos ou treinados pelo usuário a arquivos JSON.
-
Quando você aplica um enriquecimento em um campo a partir do arquivo JSON, o tipo de dados de campo é convertido em uma matriz. O campo é convertido em uma matriz mesmo que ele contenha um valor único. Por exemplo, "field1": "Discovery" torna-se "field1": ["Discovery"].
-
Apenas os primeiros 50.000 caracteres de um campo personalizado a partir de um arquivo JSON são enriquecidos.
-
Em tipos de projetos em que o enriquecimento Part of Speech (POS) é aplicado automaticamente, o enriquecimento é aplicado ao campo que contém a maior parte do conteúdo do arquivo no primeiro arquivo JSON incluído na coleção. Esse campo é determinado pelas seguintes regras:
- Se um campo é denominado
text, o enriquecimento POS é aplicado a ele. - O campo com o maior valor de cadeia e maior número de valores distintos é escolhido.
- Se mais de um campo atender à condição anterior, um dos campos é escolhido aleatoriamente.
- Se um campo é denominado
-
Se você deseja aplicar um enriquecimento em um campo aninhado, deve-se criar um projeto de Mineração de Conteúdo e, em seguida, aplicar o enriquecimento em campo. Se desejar usar um tipo de projeto diferente do Content Mining, será possível reutilizar a coleção criada com o tipo de projeto Content Mining em outro lugar. Para obter mais informações, consulte Aprespondendo enriquecimentos.
É possível especificar os objetos normalizations e conversions no método Atualizar uma coleção da API para mover ou mesclar campos JSON.
Como as passagens são derivadas
Discovery usa algoritmos sofisticados para determinar as melhores passagens de texto de todos os documentos que são retornados por uma consulta. Passagens são retornadas por documento por padrão. Eles são exibidos como uma seção dentro de cada resultado de consulta de documentos e são ordenados por relevância de passagem.
Discovery usa a detecção de limite de sentença para escolher uma passagem que inclui uma sentença completa. Ele procura passagens que possuem um comprimento aproximado de 200 caracteres, em seguida, olha para pedaços de conteúdo que são duas vezes esse comprimento para encontrar passagens que contêm sentenças completas. A detecção de limite de sentença funciona para todos os idiomas suportados e usa a lógica específica do idioma.
Para todos os tipos de projeto, exceto Pesquisa Conversacional, é possível alterar como as passagens são exibidas nos resultados da pesquisa a partir da página Customize display> Resultados da pesquisa. Por exemplo, é possível configurar o número de passagens que são mostradas por documento e o tamanho máximo de caracteres por passagem.