Um redesenho do produto, Discovery v2, foi introduzido em novembro de 2019. Discovery v2 oferece vantagens significativas sobre Discovery v1.
Saiba como migrar uma instância de serviço v1 Discovery para Discovery v2, incluindo como mover dados e atualizar seus aplicativos.
As principais diferenças estruturais entre Discovery v1 e v2 incluem:
Não existe um conceito de ambiente em v2. Os detalhes de implementação como tamanho e capacidade de índice são gerenciados para você quando você escolhe o plano de serviço adequado para as suas necessidades. Para implementações gerenciadas,
é possível escolher um plano Plus, Enterprise ou Premium, por exemplo. Para implementações instaladas, o dimensionamento é gerenciado pelo tipo de implementação que você especifica ao instalar o serviço no Cloud Pak for Data.
Não há nenhum objeto de configuração em v2. O controle dos enriquecimentos que são aplicados aos documentos é gerenciado nas coleções e objetos do projeto em v2. Outras capacidades de configuração do v1, como a capacidade de customizar a etapa
de conversão da ingestão, não estão disponíveis em v2.
Maior suporte programático está disponível para enriquecimentos personalizados em v2. Novos métodos de API de enriquecimento estão disponíveis que podem ser usados para criar enriquecimentos A v2 também apresenta métodos de API do classificador
de documento que podem ser usados para treinar modelos do classificador do documento programaticamente... É possível aplicar esses enriquecimentos customizados em uma coleta usando a API.
Os recursos de uma pesquisa de consulta de linguagem natural são expandidos em v2 para permitir o retorno das passagens de topo por documento e de respostas sucintas de passagens. Outras capacidades avançadas de busca são introduzidas, incluindo
recuperação de tabelas. Em v2, o parâmetro de deduplicação não está disponível e as funções de registro de relevância contínua e funções de registro de consulta não estão disponíveis.
Discovery v2 está disponível para todos os usuários de instâncias de plano Plus ou Enterprise, ou instâncias de plano Premium que foram criadas após o dia 15 de julho de 2020. v2 também está disponível para IBM Watson® Discovery Cartucho para
usuários IBM Cloud Pak® for Data.
Visão geral da migração
Migrar de Discovery v1 para v2 é um processo multistep que você pode fazer de forma independente.
As duas versões do serviço Discovery possuem muitas diferenças, mas você pode adotar técnicas e utilitários que foram aplicados em uma instância do v1 para uso com sua nova instância do v2.
Para migrar do v1 para o v2, você deve concluir as seguintes etapas de alto nível:
Algumas etapas requerem que você faça mudanças programáticas usando a API e outras envolvem mudanças que você pode fazer a partir da interface do usuário do produto.
Planejar a migração
Se familiare com o que há de novo em v2 e aprenda sobre como ele difere do v1 antes de você fornecer uma instância do v2. Sua primeira instância de julgamento do plano v2 Plus está disponível em nenhum custo por 30 dias. Aprenda sobre e planeje
a migração antes de provisionar a instância para que você possa obter o máximo de sua avaliação.
Quando você estiver pronto para iniciar a migração, crie um planejamento de migração que você e sua equipe possam seguir enquanto conclui o processo. Certifique-se de configurar a nova instância de serviço v2 e obter projetos e coleções recriados
na nova instância de serviço antes de alternar para o uso do serviço v2 e antes de excluir sua instância v1.
Aprenda sobre as opções do plano Discovery v2, para que seja possível escolher o plano certo para suas necessidades de longo prazo. O plano Plus que você usa para começar a ser iniciado pode ser suficiente. No entanto, você pode optar por usar
um plano Enterprise ou Premium em vez disso. A partir de um plano Plus, é possível fazer um upgrade in-place para um plano Enterprise, mas não para um plano Premium.
Planete como adaptar sua aplicação
Uma das principais mudanças entre as versões é que Discovery v2 introduz projetos. Um projeto consiste em uma ou mais coleções. A vantagem de usar projetos é que uma consulta pode correr contra muitas coleções ao mesmo tempo. Cada coleção
pode conter documentos que você carrega ou que rastreia a partir de uma única fonte de dados, como um site, o Microsoft SharePoint, e outros.
Coisas a considerar quando você adapta seu aplicativo para usar projetos:
Embora o conceito de um ambiente não exista em v2, os dados ainda são organizados em coleções. Em v2, as coleções são agrupadas em projetos. Na maioria dos casos, você deseja migrar uma única coleção v1 para uma única coleção v2.
Se você deseja manter informações de treinamento de relevância que são aplicadas a uma coleção v1, inclua os documentos de coleta em uma única coleção em seu projeto v2.
Decida quantas coleções você deseja adicionar a cada projeto v2. Todos os tipos de projeto, exceto projetos de Mineração de Conteúdo, podem conter até 5 coleções. Escolha o tipo certo de projeto para os seus dados.
Para otimizar resultados de pesquisa, diferentes enriquecimentos e opções de configuração são aplicados automaticamente em coleções que são adicionadas a diferentes tipos de projeto. Para obter mais informações, consulte os tópicos a seguir:
A API Discovery v2 mudou para dar conta de projetos e coleções, entre outros aprimoramentos. Algumas chamadas de API alteradas para suportar ações no nível do projeto em vez do nível de coleta, como enviar uma consulta e executar treinamento
de relevância. Muitos outros métodos de API mudaram e alguns não estão disponíveis em v2. Para uma comparação detalhada dos métodos de API v1 e v2, consulte comparação de versão da API.
Como escolher um plano de serviço
Escolha entre os planos gerenciados Plus, Enterprisee Premium ou opte por uma instalação no local ao comprar o Discovery Cartucho para IBM Cloud Pak for Data. Revise os benefícios e os limites de cada tipo de plano
antes de escolher um.
Para obter mais informações sobre limites de artefatos, consulte Limit details.
A tabela a seguir mostra tipos de plano para implementações gerenciadas que geralmente são semelhantes entre v1 e v2.
Planos semelhantes
Plano atual v1
Exemplo de uso de dados v1
Plano similar v2
Lite
Não aplicável
Mais Julgamento (sem cobrança por 30 dias apenas)
Avançado (baixo uso)
10.000 documentos, 10.000 consultas por mês
Mais
Avançado (uso alto)
100.000 documentos, 100.000 consultas por mês
Enterprise
Premium
Não aplicável
Empresa ou Premium
Para obter informações sobre o armazenamento atual, documentos e coleções usadas, clique no ícone Detalhes do ambiente a partir do cabeçalho da interface do usuário do produto.
Não é possível fazer um upgrade in-place a partir de um plano v1, como Lite ou Advanced, para um plano v2. Você deve criar um novo plano v2 e, em seguida, mover seus dados para a nova instância de serviço. Enquanto você migra seus dados de
v1 para v2, você provavelmente terá ambos uma instância v1 e v2 implementada ao mesmo tempo. Considere usar a avaliação sem encargos de 30 dias que está disponível com sua primeira instância do plano Plus durante esse tempo
Coletando métricas
Anote as informações a seguir para que você possa compará-lo aos dados da sua instância de serviço após a migração:
Como você transfere seus documentos depende da técnica que foi usada para ingerir os documentos em v1.
Recrie uma coleção de cada vez Se você iniciar vários processos de ingestão ao mesmo tempo, será possível tributar os recursos do sistema e aumentar o tempo geral que leva para que o processamento seja concluído Você também quer ficar de olho
para quaisquer mensagens informativas que são geradas pelo processo de ingestão. É mais fácil solucionar um problema de ingestão, por exemplo, quando você ingere uma coleção de cada vez.
Dados transferidos por upload
Se você usou a API para fazer upload de documentos em Discovery v1, uma API similar está disponível em v2 para fazer upload de documentos em coleções. Deve-se atualizar quaisquer fluxos de trabalho usados para automatizar o processo para considerar
a nova organização de projetos e coleções.
Se os documentos originais que você ingeriu em Discovery v1 não estiverem mais disponíveis, você poderá usar a API de consulta para extrair o texto do documento a partir de Discovery v1. Você pode então adicionar o texto em uma coleção em
Discovery v2. Para obter mais informações, consulte Recuperar documentos.
Dados do crawled
Se você rastejou dados de uma fonte de dados externa em v1, você pode continuar engatinhar dados da mesma fonte de dados externos em v2. Todas as mesmas fontes de dados são suportadas.
Para usar dados de uma fonte de dados externa, você deve recriar as coleções dentro de um projeto v2, e configurar como a fonte de dados está engatinada. Para obter mais informações, consulte Visão Geral de fontes de dados.
O serviço precisa de tempo e recursos para engatinhar e ingerir documentos a partir de fontes de dados externas. Recriar os conectores um de cada vez. Fatore o tempo que leva para refazer o crawl dos dados em seu plano de migração.
Coleções de dados pré-construídos
As coleções de fonte de dados embutidas a seguir não estão disponíveis em v2:
Watson Discovery Notícias
Esta fonte de dados pré-enriquecida não é oferecida em v2. Para obter mais informações sobre uma maneira alternativa de obter dados de notícias, consulte Usando um serviço de notícias com v2.
COVID-19 kit
Esta coleção pré-construída foi projetada para ajudá-lo a alimentar um chatbot dinâmico que é construído com IBM® watsonx™ Assistant e Discovery para responder às perguntas dos seus clientes sobre COVID-19. Em v2, é possível construir uma
solução semelhante. Crie um tipo de projeto Busca Conversacional com coleções que engatinam websites confiáveis para respostas a perguntas do COVID-19.
Alimentando dados
Para ingerir dados v1 em uma instância Discovery v2, complete as seguintes etapas:
Crie uma instância do serviço v2.
Crie um projeto.
Adicionar uma coleção para o projeto.
Dados carregados:
A partir da API, você cria uma coleção e adiciam documentos a ele com dois métodos separados. Use o método Criar uma coleção para criar a coleção.
Em seguida, inclua os mesmos documentos de origem que você adicionou à sua coleção v1 para a coleção v2. Use os métodos Adicionar documento ou Atualizar documento. Para atribuir o mesmo ID do documento v1 ao documento ao adicioná-lo à coleção v2, anexe o ID do documento ao terminal. Para obter mais informações, consulte IDs de documentos de retenção.
A partir da interface do usuário do produto v2, faça o upload dos mesmos documentos de origem que você adicionou à sua coleção v1 para a coleção v2.
Dados do crawled: Você não pode rastejar dados de uma fonte de dados externa programaticamente em v2. A partir da interface com o usuário do produto, re-crie a conexão com a fonte de dados externa e, em seguida, rasteje a fonte de dados
externa do zero.
A partir da interface com o usuário do produto, é possível configurar a coleção Discovery v2. Por exemplo, você pode escolher se habilitar o reconhecimento de caracteres ópticos. Para uma fonte de dados externa, é possível configurar o planejamento
do crawl.
Aplique enriquecimentos em seus dados. Você pode aplicar enriquecimentos de Processamento de Língua Natural pré-construídos ou enriquecimentos customizados que você criar.
Em v1, os enriquecimentos são associados à configuração gerada quando você cria o ambiente. No v2, os enriquecimentos são associados à configuração de coleção. Alguns enriquecimentos são aplicados em sua coleção por padrão, dependendo do
tipo de projeto utilizado. Para obter mais informações, consulte Configurações de projeto padrão. Em v2, você pode configurar a coleção para usar qualquer subconjunto
de enriquecimentos disponíveis nos campos do seu documento.
Retendo IDs de documentos
IDs de documentos são atribuídos aos documentos que você adicionar a uma coleção v2 quando você faz o upload deles a partir da interface do usuário do produto ou adicioná-los usando o método de API Adicionar um documento.
Você pode desejar reter os IDs de seus documentos v1 em v2 se você estiver usando processos que dependem desses identificadores únicos. Por exemplo, o teste de regressão para o aplicativo pode verificar se documentos específicos são retornados
verificando os IDs do documento. O treinamento de relevância utiliza os IDs de documentos para rastrear documentos entre execuções de treinamento. Esses processos são mais fáceis de se adaptar se os IDs de documentos forem os mesmos entre
suas instâncias v1 e v2. Caso contrário, os processos que são usados com a instância Discovery v1 devem ser remapeados para os IDs que são atribuídos aos documentos após serem adicionados à instância Discovery v2.
Se você especificou seus próprios IDs de documentos quando adicionou documentos para a instância de serviço v1, você pode reter os IDs usando o método Update um documento em vez do método Adicionar um documento. Com o método
de atualização, é possível atribuir um ID de documento ao documento ao adicioná-lo à coleção v2. Para obter mais informações, consulte Atualizar um documento.
Se os seus dados são armazenados em um arquivo JSON, uma matriz no documento original gera um ID de documento com um número anexado a ele. Por exemplo, original_id_n. Para reter o ID do documento original sem o sufixo de número,
remova a matriz no arquivo JSON. Alterar [ {"name": "value"} ] para {"name": "value"}, por exemplo.
Se os seus documentos v1 tiverem IDs gerados pelo sistema, você pode enviar uma consulta de pesquisa vazia vazia para recuperar uma lista dos documentos e seus IDs. Em seguida, é
possível atribuir o mesmo ID a cada documento ao adicioná-lo à sua nova coleção em v2.
Recuperação de documentos
Em alguns casos, os documentos originais que foram ingeridos em Discovery V1 não estão mais disponíveis. Você pode usar a instância Discovery v1 para recuperar informações do documento. Discovery cria uma cópia de texto de cada documento que
ele ingere. A cópia é texto apenas, portanto, quaisquer documentos em HTML, PDF ou outros formatos não texto são convertidos em uma versão textual.
Você pode recuperar apenas os primeiros 10.000 documentos em uma coleção usando este método. Para obter mais informações sobre uma maneira de recuperar mais de 10.000 documentos, consulte Recuperando mais de 10.000 documentos de uma coleta.
Para transferir informações de documentos do v1 para v2, complete as seguintes etapas:
Por exemplo, GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=.
A API retorna os resultados.. O campo matching_results especifica o número total de resultados.. O objeto de resultados retorna os documentos correspondentes. Cada documento é retornado como um objeto JSON separado. Ele retorna
um máximo de 10 documentos por padrão.
{"matching_results":34,"session_token":"nnn","results":[{"{result objects}":"{maximum of 10 by default}"}]}
Você pode usar os parâmetros count e offset para página através dos resultados da consulta e salvar todos os documentos.
Por exemplo, para obter 100 documentos por vez, você pode configurar o count para 100 e offset para 0 e enviar a consulta.
GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=0
Em seguida, você pode novamente definir a contagem para 100, mas desta vez definiu o deslocamento para 100 minutos para obter os próximos 100 documentos.
GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=100`
Repita esse processo, incrementando o deslocamento em 100 até recuperar todos os documentos.
Prepare os documentos exportados para serem ingeridos em v2.
Cada arquivo JSON resultante que você obtiver de Discovery v1 contém dados que são extraídos do documento original, como texto, html e outros campos. Se metadados personalizados foram associados ao documento quando ele foi carregado para
v1, ele também está presente no arquivo JSON. Além disso, o arquivo contém vários campos que foram gerados pela análise v1. Retenha apenas um subconjunto desses dados como parte do documento que você adicionar em Discovery v2.
As dicas a seguir podem ajudá-lo a decidir quais campos manter:
Inclua o campo text ou qualquer outro campo com conteúdo textual que você deseja que possa enriquecer ou procurar no Discovery v2.
Inclua qualquer metadado personalizado que esteja armazenado no documento. Esses metatdata geralmente são específicos para o aplicativo que usa Discovery e são usados para filtrar documentos em uma procura. Por exemplo, metadata.customer_id.
Não inclua enriquecimentos a partir de Discovery v1. Por exemplo, enriched_text.entities. Discovery v2 gera seus próprios enriquecimentos.
Excluir campos que são gerados pelo Discovery, a menos que eles sejam usados por seu aplicativo e contenham informações que sejam exclusivas para a versão v1 do documento. Nesse caso, renomear o campo para que ele não seja substituído
quando o documento for ingerido em Discovery v2. Por exemplo, extracted_metadata.publicationdate é um campo que é gerado por Discovery quando um documento é ingerido. Talvez você queira reter as informações metadata.parent_document_id do v1 para entender como os subdocumentos foram originalmente gerados a partir de um único documento de origem.
Evite campos que tenham nomes de campo reservados. Para obter mais informações, consulte Como os campos são tratados.
Ingest cada um documento editado v1 JSON na instância Discovery v2. O ID do documento Discovery v1 pode ser mantido em Discovery v2. Para obter mais informações sobre como reter o ID do documento, consulte IDs de documentos de retenção.
Recuperando mais de 10.000 documentos de uma coleção
Uma consulta só pode retornar até 10.000 documentos No entanto, se você desejar recuperar mais de 10.000 documentos de sua coleta, precisará de uma maneira de separar os documentos em subgrupos sem sobreposição. Cada subgrupo deve conter menos
de 10.000 documentos que podem ser retornados por uma consulta.. Em seguida, é possível paginar os resultados para recuperar os documentos.
A paginação para os resultados é restrita ao máximo de 10.000 documentos retornados pela consulta. Especificamente, o uso combinado dos parâmetros de paginação count e offset não pode exceder 10.000 documentos..
Uma maneira de separar os documentos em subgrupos não sobrepostos é utilizar um campo que existe em cada documento e contém um valor exclusivo. Por exemplo, o campo SHA-1 contém um hash do arquivo de origem original e é formatado como um valor
de sequência hexadecimal. É possível usar o primeiro caractere do campo como uma maneira de dividir a coleta em subgrupos Como SHA-1 contém um valor hexadecimal, o primeiro caractere pode ter até 16 valores possíveis (0-9 ou a-f). Se você
filtrar pelo first_char_of (SHA-1) == 0, poderá retornar aproximadamente 1/16 da coleção inteira. Em seguida, é possível efetuar loop em cada um dos 16 valores possíveis para obter o restante dos documentos. Se o número ideal
de documentos não for retornado em um dos subgrupos, será possível usar os primeiros 2 caracteres no campo SHA-1 para dividir a coleta em 256 subgrupos.
Transferindo treinamento de relevância
O treinamento de relevância que foi feito em Discovery v1 pode ser transferido para Discovery v2. Transferir o treinamento funciona melhor com um projeto Discovery v2 que possui uma coleção que contém os mesmos documentos da coleção Discovery
v1.
Mesmo se coleções foram adicionadas ou documentos alterados, o treinamento de relevância pode ser transferido. No entanto, você deve atualizar o treinamento para dar conta das mudanças.
Para transferir treinamento de relevância, complete as seguintes etapas:
Carregue os documentos em Discovery v2.
Faça o download programaticamente as consultas que foram usadas para treinamento de relevância em Discovery v1. Para obter mais informações, consulte Lista de dados de treinamento.
Recrie programaticamente os dados de treinamento de relevância em Discovery v2. Inclua cada consulta de treinamento separadamente usando o método Criar uma consulta. Para obter mais informações, consulte Criar uma consulta de treinamento.
Certifique-se de especificar o ID de coleta v2. Você também deve especificar o ID do documento também.
Se você não reter os IDs de documentos entre as coleções v1 e v2, então você deve encontrar o ID do documento v2 que corresponde ao ID do documento v1 que é referenciado no exemplo de consulta baixada.
Transferindo modelos
Você pode reutilizar alguns dos modelos que você criou em v1 com o seu projeto v2.
Modelos de Smart Document Understading (SDU)
É possível importar um modelo de SDU que foi construído com o Discovery v1 para o Discovery v2. No entanto, o desempenho do modelo pode ser diferente entre as versões Compare os resultados do modelo SDU v1 em v2 para verificar se o comportamento
é o mesmo. Não é possível editar o modelo SDU v1 importado. Se o modelo importado não puder reconhecer elementos do documento que ele reconheceu na v1 e que são importantes para seu caso de uso, deve-se recriar o modelo SDU na interface
com o usuário do produto Discovery v2. Para obter mais informações, consulte Exportando modelos de SDU na documentação v1 e importando o modelo de SDU na documentação v2.
Modelos de aprendizado de máquina
Você não pode implementar modelos diretamente em Discovery instâncias de serviço v2 a partir de Knowledge Studio. Em vez disso, você deve exportar os modelos de aprendizado de máquina a partir de Knowledge Studioe, em seguida, importá-los
em Discovery. O modelo deve ter sido exportado a partir de Knowledge Studio após 16 de julho de 2020. Se você tiver um modelo que foi exportado antes dessa data, deverá reexportar o modelo de Knowledge Studio. Apenas os planos pagos Knowledge
Studio suportam os modelos de exportação.
Para obter mais informações, consulte um dos tópicos a seguir:
Para obter informações sobre como importar um modelo para Discovery v2, veja os modelos Importando Machine Learning.
Atualize seu aplicativo para usar a API v2
Os SDKs do desenvolvedor Watson suportam ambos Discovery v1 e v2.
Essas instruções supõem que o seu aplicativo esteja usando a versão mais recente da API v1 (versão 2019-04-30).
Quando você porta um aplicativo que atualmente usa a API Discovery v1 para usar o v2, você deve planejar como abordar as seguintes diferenças de alto nível entre as duas versões.
Além dessas mudanças de alto nível, revise as diferenças em um nível por método para entender o que mais você pode precisar alterar. Para obter mais informações, consulte comparação de versão da API.
v2 organiza dados por projeto e coleções; não há conceito de ambiente. Por exemplo, compare os pedidos a seguir para obter uma coleção:
GET {url}/v2/projects/{project_id}/collections/{collection_id}
Em v1, o treinamento de relevância é executado em uma única coleção. Em v2, o treinamento de relevância é executado em um projeto. O projeto pode conter muitas coleções. Se for assim, o treinamento de relevância é aplicado em todas as coleções.
Para obter informações sobre como transferir treinamento de relevância, consulte Transferindo treinamento de relevância.
Por exemplo, compare os seguintes pedidos que retornam o status de treinamento de relevância:
O envio de uma consulta é semelhante entre as duas versões. Em v2, é possível consultar todas as coleções em um projeto ou você pode limitar a consulta a uma ou mais coleções especificando um parâmetro collection_ids. Por exemplo,
compare os seguintes pedidos para consultar dados:
Você pode opcionalmente omitido o parâmetro collection_ids para consulta em todas as coleções no projeto.
O parâmetro passage para uma consulta tem uma nova opção per_document que classifica os documentos por qualidade de documento e, em seguida, retorna as passagens de maior quantidade por documento em um campo document_passages para cada entrada de documentos na lista de resultados da resposta. Se falsa, classifica as passagens de todos os documentos por qualidade de passagem independentemente da qualidade do documento e os devolve em um campo de passagens separadas
na resposta.
Quando as passagens são retornadas para uma consulta, você também pode ativar a localização da resposta. Quando true, os objetos de resposta são retornados como parte de cada passagem nos resultados da consulta. Quando find_answers e per_document são ambos configurados como true, os resultados da procura de documento e os resultados da procura de passagem dentro de cada documento são reordenados usando as confidências de respostas O objetivo desta reordenação
é colocar a melhor resposta como a primeira resposta da primeira passagem do primeiro documento. Da mesma forma, se o parâmetro find_answers for configurado como parâmetro true e per_document for configurado como false, então
os resultados da pesquisa de passagem serão reordenados em ordem decrescente da resposta de confiança mais alta para cada documento e passagem.
A v1 e a v2 suportam palavras vazias customizadas. No entanto, há algumas diferenças em como as palavras vazias customizadas são usadas:
Não há nenhuma lista de palavras vazias customizadas padrão para coleções japonesas em v2..
Ao definir palavras vazias customizadas no v1, sua lista de palavras vazias substitui a lista de palavras vazias existente. No v2, sua lista aumenta a lista padrão. Não é possível substituir a lista, o que significa que não é possível
remover palavras comuns que fazem parte da lista padrão no v2.
Atualize como seu aplicativo manipula resultados de consulta
A forma como o seu aplicativo mostra resultados de consulta pode precisar ser atualizado devido às seguintes diferenças entre a sintaxe de documento de resultados da consulta entre as consultas v1 e v2:
No nível de enriquecimento da entidade, as informações a seguir não são suportadas em v2:
Desambiguação
Emoção
Impressão
O enriquecimento Parte do Discurso é aplicado automaticamente em documentos na maioria dos tipos de projeto em v2, mas os campos de índice que são gerados pelo enriquecimento não são exibidos na representação JSON do documento.
de dados de na estrutura de dados de entidades*
Em vez do count e relevance em v1, v2 inclui as menções.
Cada entrada na menção corresponde a uma ocorrência da entidade no texto do documento. No exemplo a seguir, sete ocorrências são encontradas. Para cada ocorrência, são exibidas uma pontuação de confiança e os deslocamentos do texto de
menção. Você pode utilizar os deslocamentos para destacar a menção no texto do documento quando o resultado for exibido em uma interface com o usuário.
Entity mentions in Discovery v2
A estrutura JSON das respostas de consulta é rearranjada ligeiramente em v2.
As informações de deduplicação não estão incluídas na resposta de consulta v2.
Em v2, enriched_text é uma matriz em vez de um objeto.
Em Discovery v2, as Entidades v2 de enriquecimento são usadas. Nomes de tipos de entidade em v2 são especificados em headline case, em vez de todas as letras maiúsculas. Se você usar uma consulta ou agregação que especifica um nome de
entidade, você deve alterar a capitalização. Por exemplo, altere PERSON para Person.
Os campos de arquivos JSON que são adicionados a uma coleção são convertidos de forma diferente durante a ingestão entre v1 e v2. Se o seu aplicativo manipula esses resultados, você pode precisar fazer ajustes.
É possível especificar os objetos normalizations e conversions no método Atualizar uma coleção da API para mover ou mesclar
campos JSON.
Como os campos de origem JSON são tratados
Conteúdo do campo JSON original
v1 representação
v2 representação
Notas
"field": null
"field": null
N/D
v1 mantém o valor nulo. v2 esquiava totalmente o campo nulo.
"field": ""
"field": ""
N/D
v1 mantém o valor do texto vazio. v2 pula o campo de texto vazio por completo.
"field": "value2"
"field": "value2"
"field": "value2"
Nenhuma diferença.
"field": []
"field": []
N/D
v1 mantém a matriz vazia. v2 esquiava o campo com a matriz vazia por completo.
"field": [ "value4" ]
"field": [ "value4" ]
"field": "value4"
v1 mantém a matriz singleton. v2 converte a matriz singleton no valor apenas; ela não é armazenada como parte de uma matriz.
"field": [ 1, 2, 3 ]
"field": [ 1, 2, 3 ]
"field": [ 1, 2, 3 ]
Nenhuma diferença.
"field": [ "v6", "v7", "v8" ]
"field": [ "v6", "v7", "v8"]
"field": [ "v6", "v7", "v8"]
Nenhuma diferença.
Verificando se seus dados foram migrados com sucesso
Certifique-se de recriar todas as coleções que você usou na v1 e que deseja manter. Com o método da API v2 Lista de listas, você pode obter uma lista de coleções,
mas você deve enviar uma solicitação por projeto. Não é possível utilizar uma chamada para obter o número total de coletas por instância de serviço.
Número de documentos por coleção
Para coleções com dados carregados, verifique o número de documentos na coleta enviando uma consulta vazia com o método de API Query a project. Especificar o parâmetro ID da
coleção para limitar os resultados a apenas documentos em uma mesma coleção. Uma consulta vazia retorna todos os documentos. Portanto, é possível obter o número total de documentos do valor matching_results na resposta.
O número de documentos por coleção deve estar próximo do número de documentos que estavam armazenados na mesma coleção em v1. Os números podem não ser os mesmos.
Para dados rastejados, não se surpreender se a coleção v2 tiver menos documentos. Os conectores v1 não excluem documentos de uma coleção Discovery que são excluídos da origem de dados externa. Sua versão do v2 da coleta possui um crawl mais
recente dos dados como eles existem na origem de dados externa hoje.
Não espere que os resultados da procura sejam os mesmos para consultas enviadas nas instâncias v1 e v2.
Como usar um serviço de notícias com v2
Se você usou o Watson Discovery Fonte de dados de notícias em v1 e deseja criar uma fonte de dados com função equivalente em v2, encontre um serviço de provedor de dados de notícias e eventos. Procure um serviço que oferece uma API de Notícias
que extrai artigos de notícias em formato JSON. Você pode então fazer o upload dos arquivos JSON para criar uma coleção de Notícias em seu projeto v2.
Exclua sua instância de serviço v1
Após seus dados serem migrados e seus aplicativos serem atualizados para usar a nova instância de serviço v2, certifique-se de excluir sua instância de serviço v1. Você será cobrado pela instância de serviço v1 até excluí-la. Para obter mais
informações, consulte Excluindo uma instância de serviço gerenciado.