Migration vers Discovery v2
Une nouvelle conception du produit, Discovery v2, a été introduite en novembre 2019. Discovery v2 offre des avantages significatifs par rapport à Discovery v1.
Découvrez comment migrer une instance de service v1 Discovery vers Discovery v2, y compris comment déplacer des données et mettre à jour vos applications.
Les principales différences structurelles entre Discovery v1 et v2 sont les suivantes:
-
Il n'existe aucun concept d'environnement dans v2. Les détails de déploiement, tels que la taille et la capacité d'index, sont gérés pour vous lorsque vous choisissez le plan de service adapté à vos besoins. Pour les déploiements gérés, vous pouvez choisir un plan Plus, Enterprise ou Premium, par exemple. Pour les déploiements installés, le dimensionnement est géré par le type de déploiement que vous spécifiez lorsque vous installez le service dans Cloud Pak for Data.
-
Il n'existe pas d'objet de configuration unique dans v2. Le contrôle des enrichissements appliqués aux documents est géré dans les collections et les objets de projet dans v2. Les autres fonctions de configuration v1, telles que la possibilité de personnaliser l'étape de conversion de l'ingestion, ne sont pas disponibles dans v2.
-
Une plus grande prise en charge par programmation est disponible pour les enrichissements personnalisés dans v2. De nouvelles méthodes d'API d'enrichissement sont disponibles et vous pouvez les utiliser pour créer des enrichissements. v2 introduit également des méthodes d'API de discriminant de document que vous pouvez utiliser pour entraîner des modèles de discriminant de document à l'aide d'un programme. Vous pouvez appliquer ces enrichissements personnalisés à une collection à l'aide de l'API.
-
Les capacités d'une recherche par requête en langage naturel sont développées dans v2 pour permettre le retour des principaux passages par document et des réponses succinctes des passages. D'autres fonctions de recherche avancée sont introduites, y compris l'extraction de table. Dans v2, le paramètre de dédoublonnage n'est pas disponible et les fonctions d'apprentissage continu de la pertinence et de journalisation des requêtes ne sont pas disponibles.
-
Pour plus d'informations sur les différences entre les fonctions, voir le tableau de comparaison des fonctions.
-
Pour plus d'informations sur les différences d'API détaillées, voir Comparaison des versions d'API.
Discovery v2 est disponible pour tous les utilisateurs des instances de plan Plus ou Enterprise ou des instances de plan Premium qui ont été créées après le 15 juillet 2020. v2 est également disponible pour les utilisateurs de IBM Watson® Discovery Cartridge pour IBM Cloud Pak® for Data.
Aperçu sur la migration
La migration de Discovery v1 vers v2 est un processus en plusieurs étapes que vous pouvez effectuer indépendamment.
Les deux versions du service Discovery présentent de nombreuses différences, mais vous pouvez adopter des techniques et des utilitaires qui ont été appliqués à une instance v1 pour une utilisation avec votre nouvelle instance v2.
Pour effectuer une migration depuis v1 vers v2, vous devez effectuer les étapes de haut niveau suivantes:
- Planifiez la migration.
- Transférez vos documents.
- Mettez à jour votre application pour utiliser l'API v2.
- Test de régression et déploiement de l'application mise à jour.
- Supprimez votre instance de service de plan v1.
Certaines étapes nécessitent que vous apportez des modifications par programmation à l'aide de l'API et d'autres impliquent des modifications que vous pouvez apporter à partir de l'interface utilisateur du produit.
Planification de la migration
Familiarisez-vous avec les nouveautés de v2 et découvrez comment il diffère de v1 avant de mettre à disposition une instance v2. Votre première instance d'essai de plan v2 Plus est disponible gratuitement pendant 30 jours. Découvrez et planifiez la migration avant de mettre à disposition l'instance afin de tirer le meilleur parti de votre version d'essai.
Lorsque vous êtes prêt à démarrer la migration, créez un planning de migration que vous et votre équipe pouvez suivre à mesure que vous exécutez le processus. Veillez à configurer la nouvelle instance de service v2 et à obtenir les projets et les collections recréés dans la nouvelle instance de service avant de passer à l'utilisation du service v2 et de supprimer votre instance v1.
Découvrez les options de plan Discovery v2 pour pouvoir choisir le plan adapté à vos besoins à long terme. Le plan Plus que vous utilisez pour démarrer peut être suffisant. Toutefois, vous pouvez choisir d'utiliser un plan Enterprise ou Premium à la place. A partir d'un plan Plus, vous pouvez effectuer une mise à niveau interne vers un plan Enterprise, mais pas vers un plan Premium.
Planifiez l'adaptation de votre application
L'une des principales modifications entre les versions est que Discovery v2 introduit des projets. Un projet est constitué d'une ou plusieurs collections. L'avantage d'utiliser des projets est qu'une requête peut s'exécuter simultanément sur de nombreuses collections. Chaque collection peut contenir des documents que vous téléchargez ou que vous extrayez d'une source de données unique, telle qu'un site web, Microsoft SharePoint, et bien d'autres encore.
Points à prendre en compte lorsque vous adaptez votre application pour utiliser des projets:
-
Bien que le concept d'environnement n'existe pas dans v2, les données sont toujours organisées en collections. Dans v2, les collections sont regroupées en projets. Dans la plupart des cas, vous souhaitez migrer une collection v1 unique vers une collection v2 unique.
Si vous souhaitez conserver les informations d'entraînement à la pertinence qui sont appliquées à une collection v1, ajoutez les documents de collection à une collection unique dans votre projet v2.
-
Déterminez le nombre de collections à ajouter à chaque projet v2. Tous les types de projet, à l'exception des projets Content Mining, peuvent contenir jusqu'à 5 collections. Choisissez le type de projet approprié pour vos données.
Pour optimiser les résultats de la recherche, différents enrichissements et options de configuration sont appliqués automatiquement aux collections qui sont ajoutées à différents types de projet. pour plus d'informations, consultez les rubriques suivantes :
-
L'API Discovery v2 a été modifiée pour prendre en compte les projets et les collections, entre autres améliorations. Certains appels d'API ont été modifiés pour prendre en charge des actions au niveau du projet au lieu du niveau de la collection, comme la soumission d'une requête et l'exécution d'un entraînement à la pertinence. De nombreuses autres méthodes d'API ont été modifiées et certaines ne sont pas disponibles dans v2. Pour une comparaison détaillée des méthodes d'API v1 et v2, voir Comparaison des versions d'API.
Prélèvement d'un plan de service
Choisissez parmi les plans gérés Plus, Enterpriseet Premium ou optez pour une installation sur site en achetant la cartouche Discovery pour IBM Cloud Pak for Data. Passez en revue les avantages et les limites de chaque type de régime avant d'en choisir un.
- Pour plus d'informations sur les plans, voir Plans de tarificationDiscovery.
- Pour plus d'informations sur les limites d'artefact, voir Détails des limites.
Le tableau suivant présente les types de plan pour les déploiements gérés qui sont généralement similaires entre v1 et v2.
| Plan v1 en cours | Exemple d'utilisation des données v1 | Plan v2 similaire |
|---|---|---|
| Lite | Non applicable | Offre d'essai Plus (pas de frais pendant 30 jours seulement) |
| Avancé (faible utilisation) | 10 000 documents, 10 000 requêtes par mois | Plus |
| Avancé (utilisation élevée) | 100 000 documents, 100 000 requêtes par mois | Entreprise |
| Premium | Non applicable | Entreprise ou Premium |
Pour obtenir des informations sur le stockage en cours, les documents et les collections utilisés, cliquez sur l'icône Détails de l'environnement dans l'en-tête de l'interface utilisateur du produit.
Vous ne pouvez pas effectuer une mise à niveau interne à partir d'un plan v1, tel que Lite ou Advanced, vers un plan v2. Vous devez créer un nouveau plan v2, puis déplacer vos données vers la nouvelle instance de service. Lorsque vous migrez vos données de v1 vers v2, il est probable qu'une instance v1 et v2 soient déployées simultanément. Pensez à utiliser l'essai gratuit de 30 jours qui est disponible avec votre première instance de plan Plus pendant cette période.
Collecte des mesures
Notez les informations suivantes afin de pouvoir les comparer à vos données d'instance de service après la migration:
-
Nombre de collectes
Pour obtenir le nombre de collections dans une instance dans v1, utilisez l'API List collections.
-
Nombre de documents par collection
Pour obtenir le nombre de documents d'une collection dans v1, utilisez l'API Obtenir les détails de la collection.
GET {url}/v1/environments/{environment_id}/collections/{collection_id}`L'API renvoie des informations sur le statut des documents de la collection, ce qui inclut le nombre total de documents disponibles.
"document_counts": { "available": 34, "{other}":"{values...}" }
Transfert de documents de v1 vers v2
La façon dont vous transférez vos documents dépend de la technique utilisée pour ingérer les documents dans v1.
Recréez une collection à la fois. Si vous démarrez plusieurs processus d'ingestion en même temps, vous pouvez taxer les ressources système et augmenter le temps global nécessaire à l'exécution du traitement. Vous souhaitez également surveiller les messages d'information générés par le processus d'ingestion. Il est plus facile d'identifier et de résoudre un problème d'ingestion, par exemple, lorsque vous ingérez une collection à la fois.
Données transférées
Si vous avez utilisé l'API pour télécharger des documents dans Discovery v1, une API similaire est disponible dans v2 pour télécharger des documents dans des collections. Vous devez mettre à jour les flux de travaux que vous utilisez pour automatiser le processus afin de tenir compte de la nouvelle organisation des projets et des collections.
Si les documents d'origine que vous avez ingérés dans Discovery v1 ne sont plus disponibles, vous pouvez utiliser l'API de requête pour extraire le texte du document depuis Discovery v1. Vous pouvez ensuite ajouter le texte à une collection dans Discovery v2. Pour plus d'informations, voir Récupération de documents.
Données explorées
Si vous avez exploré des données à partir d'une source de données externe dans v1, vous pouvez continuer à explorer des données à partir de la même source de données externe dans v2. Toutes les mêmes sources de données sont prises en charge.
Pour utiliser les données d'une source de données externe, vous devez recréer les collections dans un projet v2 et configurer la façon dont la source de données est explorée. Pour plus d'informations, voir Présentation des sources de données.
Le service a besoin de temps et de ressources pour explorer et ingérer des documents à partir de sources de données externes. Recréez les connecteurs un par un. Prenez en compte le temps nécessaire à la réexploration des données dans votre planification de plan de migration.
Collections de données préconfigurées
Les collections de sources de données intégrées suivantes ne sont pas disponibles dans v2:
- Watson Discovery Actualités
- Cette source de données pré-enrichie n'est pas disponible dans v2. Pour plus d'informations sur une autre méthode d'obtention de données de nouvelles, voir Utilisation d'un service de nouvelles avec v2.
- Kit COVID-19
- Cette collection prégénérée a été conçue pour vous aider à alimenter un agent conversationnel dynamique qui est généré avec IBM® watsonx™ Assistant et Discovery pour répondre aux questions de vos clients sur COVID-19. Dans v2, vous pouvez générer une solution similaire. Créez un type de projet Conversational Search avec des collections qui explorent des sites Web de confiance pour obtenir des réponses aux questions COVID-19.
Ingestion des données
Pour ingérer des données v1 dans une instance Discovery v2, procédez comme suit:
-
Créer une instance de service v2.
-
Permet de créer un projet.
-
Ajoutez une collection au projet.
-
Données téléchargées:
A partir de l'API, vous créez une collection et vous y ajoutez des documents à l'aide de deux méthodes distinctes. Utilisez la méthode Créer une collection pour créer la collection. Ensuite, ajoutez les mêmes documents source que ceux que vous avez ajoutés à votre collection v1 à la collection v2. Utilisez les méthodes Ajouter un document ou Mettre à jour un document. Pour affecter le même ID document v1 au document lorsque vous l'ajoutez à la collection v2, ajoutez l'ID document au noeud final. Pour plus d'informations, voir Conservation des ID de document.
Depuis l'interface utilisateur du produit v2, téléchargez les mêmes documents source que ceux que vous avez ajoutés à votre collection v1 dans la collection v2.
-
Données explorées: vous ne pouvez pas explorer les données d'une source de données externe à l'aide d'un programme dans v2. Dans l'interface utilisateur du produit, recréez la connexion à la source de données externe, puis explorez la source de données externe à partir de zéro.
-
-
A partir de l'interface utilisateur du produit, vous pouvez configurer la collection Discovery v2. Par exemple, vous pouvez choisir d'activer ou non la reconnaissance optique des caractères. Pour une source de données externe, vous pouvez définir le planning d'exploration.
-
Appliquez des enrichissements à vos données. Vous pouvez appliquer des enrichissements Natural Language Processing préconfigurés ou des enrichissements personnalisés que vous créez.
Dans v1, les enrichissements sont associés à la configuration qui est générée lorsque vous créez l'environnement. Dans v2, les enrichissements sont associés à la configuration de collection. Certains enrichissements sont appliqués à votre collection par défaut, en fonction du type de projet utilisé. Pour plus d'informations, voir Paramètres de projet par défaut. Dans v2, vous pouvez configurer la collection pour qu'elle utilise n'importe quel sous-ensemble d'enrichissements disponibles sur les zones de votre document.
Conservation des ID de document
Les ID de document sont affectés aux documents que vous ajoutez à une collection v2 lorsque vous les téléchargez à partir de l'interface utilisateur du produit ou que vous les ajoutez à l'aide de la méthode d'API Ajouter un document.
Vous pouvez conserver les ID de vos documents v1 dans v2 si vous utilisez des processus qui dépendent de ces identificateurs uniques. Par exemple, les tests de régression de l'application peuvent vérifier que des documents spécifiques sont renvoyés en vérifiant les ID de document. L'entraînement à la pertinence utilise les ID de document pour suivre les documents entre les exécutions d'entraînement. Ces processus sont plus faciles à adapter si les ID de document sont identiques entre vos instances v1 et v2. Sinon, les processus utilisés avec l'instance Discovery v1 doivent être remappés aux ID affectés aux documents une fois qu'ils ont été ajoutés à l'instance Discovery v2.
Si vous avez spécifié vos propres ID de document lorsque vous avez ajouté des documents à l'instance de service v1, vous pouvez conserver les ID à l'aide de la méthode Mettre à jour un document au lieu de la méthode Ajouter un document. Avec la méthode de mise à jour, vous pouvez affecter un ID document au document lorsque vous l'ajoutez à la collection v2. Pour plus d'informations, voir Mise à jour d'un document.
Si vos données sont stockées dans un fichier JSON, un tableau du document d'origine génère un ID de document auquel est ajouté un numéro. Par exemple, original_id_n. Pour conserver l'ID document d'origine sans le suffixe numérique,
supprimez le tableau dans le fichier JSON. Remplacez [ {"name": "value"} ] par {"name": "value"}, par exemple.
Si vos documents v1 possèdent des ID générés par le système, vous pouvez soumettre une requête de recherche vide pour extraire une liste des documents et de leurs ID. Vous pouvez ensuite affecter le même ID à chaque document lorsque vous l'ajoutez à votre nouvelle collection dans v2.
Récupération de documents
Dans certains cas, les documents d'origine qui ont été ingérés dans Discovery V1 ne sont plus disponibles. Vous pouvez utiliser l'instance Discovery v1 pour extraire des informations du document. Discovery crée une copie texte de chaque document qu'il ingère. La copie est du texte uniquement, de sorte que tous les documents aux formats HTML, PDF ou non texte sont convertis en version texte uniquement.
Vous pouvez récupérer uniquement les 10 000 premiers documents d'une collection à l'aide de cette méthode. Pour plus d'informations sur la façon de récupérer plus de 10 000 documents, voir Récupération de plus de 10 000 documents à partir d'une collection.
Pour transférer des informations de document de v1 vers v2, procédez comme suit:
-
Extrayez les documents de v1 à l'aide de l'API pour soumettre une requête vide.
Par exemple,
GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=.L'API renvoie les résultats. La zone
matching_resultsindique le nombre total de résultats. L'objet de résultats renvoie les documents correspondants. Chaque document est renvoyé en tant qu'objet JSON distinct. Elle renvoie un maximum de 10 documents par défaut.{ "matching_results": 34, "session_token": "nnn", "results": [ {"{result objects}":"{maximum of 10 by default}"} ] } -
Vous pouvez utiliser les paramètres
countetoffsetpour parcourir les résultats de la requête et sauvegarder tous les documents.Par exemple, pour obtenir 100 documents à la fois, vous pouvez définir
countsur100etoffsetsur0et soumettre la requête.GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=0Ensuite, vous pouvez à nouveau définir le nombre sur 100, mais cette fois, définissez le décalage sur 100 pour obtenir les 100 documents suivants.
GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=100`Répétez ce processus en incrémentant le décalage de 100 jusqu'à ce que vous extrayez tous les documents.
-
Préparez les documents exportés à ingérer dans v2.
Chaque fichier JSON obtenu à partir de Discovery v1 contient des données extraites du document d'origine, telles que du texte, du code HTML et d'autres zones. Si des métadonnées personnalisées ont été associées au document lors de son téléchargement vers v1, elles sont également présentes dans le fichier JSON. En outre, le fichier contient plusieurs zones qui ont été générées par l'analyse v1. Conservez uniquement un sous-ensemble de ces données dans le cadre du document que vous ajoutez à Discovery v2.
Les conseils suivants peuvent vous aider à déterminer les zones à conserver:
- Incluez la zone
textou toute autre zone avec du contenu textuel que vous souhaitez pouvoir enrichir ou rechercher dans Discovery v2. - Incluez les métadonnées personnalisées stockées dans le document. Ces métadonnées sont généralement spécifiques à l'application qui utilise Discovery et qui est utilisée pour filtrer les documents dans une recherche. Par exemple,
metadata.customer_id. - N'incluez pas les enrichissements de Discovery v1. Par exemple,
enriched_text.entities. Discovery v2 génère ses propres enrichissements. - Excluez les zones générées par Discovery sauf si elles sont utilisées par votre application et qu'elles contiennent des informations spécifiques à la version v1 du document. Dans ce cas, renommez la zone pour qu'elle ne soit pas remplacée
lorsque le document est ingéré dans Discovery v2. Par exemple,
extracted_metadata.publicationdateest une zone qui est générée par Discovery lorsqu'un document est ingéré. Vous souhaitez peut-être conserver les informationsmetadata.parent_document_idde v1 pour comprendre comment les sous-documents ont été générés à l'origine à partir d'un seul document source. - Evitez les zones dont les noms sont réservés. Pour plus d'informations, voir Comment les zones sont traitées.
- Incluez la zone
-
Ingérez chaque document JSON v1 édité dans l'instance Discovery v2. L'ID document Discovery v1 peut être conservé dans Discovery v2. Pour plus d'informations sur la conservation de l'ID document, voir Conservation des ID document.
Récupération de plus de 10 000 documents à partir d'une collection
Une requête ne peut renvoyer que jusqu'à 10 000 documents. Toutefois, si vous souhaitez récupérer plus de 10 000 documents à partir de votre collection, vous avez besoin d'un moyen de séparer les documents en sous-groupes qui ne se chevauchent pas. Chaque sous-groupe doit contenir moins de 10 000 documents pouvant être renvoyés par une requête. Ensuite, vous pouvez mettre en page les résultats pour extraire les documents.
La pagination des résultats est limitée à un maximum de 10 000 documents renvoyés par la requête. En particulier, l'utilisation combinée des paramètres de pagination count et offset ne peut pas dépasser 10 000 documents.
Une façon de séparer les documents en sous-groupes qui ne se chevauchent pas consiste à optimiser un champ qui existe dans chaque document et qui contient une valeur unique. Par exemple, la zone SHA-1 contient un hachage du fichier source
d'origine et est formatée en tant que valeur de chaîne hexadécimale. Vous pouvez utiliser le premier caractère de la zone pour diviser la collection en sous-groupes. Etant donné que SHA-1 contient une valeur hexadécimale, le premier caractère
peut avoir jusqu'à 16 valeurs possibles (0-9 ou a-f). Si vous effectuez un filtrage par first_char_of (SHA-1) == 0, il peut renvoyer environ 1/16 de l'ensemble de la collection. Vous pouvez ensuite parcourir en boucle chacune
des 16 valeurs possibles pour obtenir le reste des documents. Si le nombre optimal de documents n'est pas renvoyé dans l'un des sous-groupes, vous pouvez utiliser les 2 premiers caractères de la zone SHA-1 pour diviser la collection en 256
sous-groupes à la place.
Transfert de l'entraînement à la pertinence
L'entraînement à la pertinence effectué dans Discovery v1 peut être transféré dans Discovery v2. Le transfert de la formation fonctionne mieux avec un projet Discovery v2 qui possède une collection contenant les mêmes documents de la collection Discovery v1.
Même si des collections ont été ajoutées ou si des documents ont été modifiés, l'entraînement à la pertinence peut être transféré. Toutefois, vous devez mettre à jour la formation pour tenir compte des modifications.
Pour transférer l'entraînement à la pertinence, procédez comme suit:
-
Chargez les documents dans Discovery v2.
-
Téléchargez à l'aide d'un programme les requêtes utilisées pour l'entraînement à la pertinence dans Discovery v1. Pour plus d'informations, voir Liste des données d'entraînement.
-
Recréez à l'aide d'un programme les données d'entraînement à la pertinence dans Discovery v2. Ajoutez chaque requête d'entraînement séparément à l'aide de la méthode Créer une requête. Pour plus d'informations, voir Création d'une requête d'entraînement.
Veillez à spécifier l'ID de collection v2. Vous devez également spécifier l'ID document.
Si vous n'avez pas conservé les ID document entre les collections v1 et v2, vous devez trouver l'ID document v2 qui correspond à l'ID document v1 référencé dans l'exemple de requête téléchargé.
Transfert de modèles
Vous pouvez réutiliser certains des modèles que vous avez créés dans v1 avec votre projet v2.
- Modèles Smart Document Understading (SDU)
-
Vous pouvez importer un modèle SDU qui a été généré avec Discovery v1 dans Discovery v2. Toutefois, les performances du modèle peuvent varier d'une version à l'autre. Comparez les résultats du modèle SDU v1 dans v2 pour vérifier que le comportement est identique. Vous ne pouvez pas éditer le modèle SDU v1 importé. Si le modèle importé ne peut pas reconnaître les éléments de document qu'il a reconnus dans v1 et qui sont importants pour votre cas d'utilisation, vous devez recréer le modèle SDU dans l'interface utilisateur du produit Discovery v2. Pour plus d'informations, voir Exportation de modèles SDU dans la documentation v1 et Importation du modèle SDU dans la documentation v2.
- Modèles d'apprentissage automatique
-
Vous ne pouvez pas déployer des modèles directement dans des instances de service Discovery v2 à partir de Knowledge Studio. A la place, vous devez exporter les modèles d'apprentissage automatique depuis Knowledge Studio, puis les importer dans Discovery. Le modèle doit avoir été exporté depuis Knowledge Studio après le 16 juillet 2020. Si vous disposez d'un modèle exporté avant cette date, vous devez le réexporter à partir de Knowledge Studio. Seuls les plans Knowledge Studio payants prennent en charge l'exportation de modèles.
Pour plus d'informations, voir l'une des rubriques suivantes :
-
IBM Cloud Pak® for Data: Exportation d'un modèle d'apprentissage automatique
-
IBM Cloud: Déploiement d'un modèle d'apprentissage automatique dans Watson Discovery
Pour plus d'informations sur l'importation d'un modèle dans Discovery v2, voir Importation de modèles Machine Learning.
-
Mettez à jour votre application pour utiliser l'API v2
Les SDK de Watson Developer prennent en charge Discovery v1 et v2.
Ces instructions supposent que votre application utilise la dernière version de l'API v1 (version 2019-04-30).
Lorsque vous portez une application qui utilise actuellement l'API Discovery v1 pour utiliser v2, vous devez planifier la manière de traiter les différences de haut niveau suivantes entre les deux versions.
En plus de ces modifications de haut niveau, passez en revue les différences au niveau de chaque méthode pour comprendre ce que vous pourriez avoir à modifier. Pour plus d'informations, voir Comparaison des versions d'API.
-
v2 organise les données par projet et par collection ; il n'existe pas de concept d'environnement. Par exemple, comparez les demandes suivantes pour obtenir une collection:
GET {url}/v1/environments/{environment_id}/collections/{collection_id}GET {url}/v2/projects/{project_id}/collections/{collection_id} -
Dans v1, l'entraînement à la pertinence s'exécute sur une seule collection. Dans v2, l'entraînement à la pertinence s'exécute sur un projet. Le projet peut contenir de nombreuses collections. Si tel est le cas, l'entraînement à la pertinence est appliqué à toutes les collections. Pour plus d'informations sur le transfert de l'entraînement à la pertinence, voir Transfert de l'entraînement à la pertinence.
Par exemple, comparez les demandes suivantes qui renvoient le statut de l'entraînement à la pertinence:
GET {url}/v1/environments/{environment_id}/collections/{collection_id}GET {url}/v2/projects/{project_id} -
La soumission d'une requête est similaire entre les deux versions. Dans v2, vous pouvez interroger toutes les collections d'un projet ou limiter la requête à une ou plusieurs collections en spécifiant un paramètre
collection_ids. Par exemple, comparez les demandes suivantes pour interroger les données:v1 Requête
POST {url}/v1/environments/{environment_id}/collections/{collection_id}/queryDonnées soumises avec la demande:
{ "query": "text:IBM" }Demande Query v2
POST {url}/v2/projects/{project_id}/queryDonnées soumises avec la demande:
{ "collection_ids": [ "{collection_id_1}", "{collection_id_2}" ], "query": "text:IBM" }Vous pouvez éventuellement omettre le paramètre
collection_idspour effectuer une requête dans toutes les collections du projet. -
Le paramètre
passaged'une requête comporte une nouvelle optionper_documentqui classe les documents par qualité de document, puis renvoie les passages les mieux classés par document dans une zonedocument_passagespour chaque entrée de document de la liste de résultats de la réponse. Si la valeur est false, classe les passages de tous les documents par qualité de passage, quelle que soit la qualité du document, et les renvoie dans une zone de passages distincte de la réponse. -
Lorsque des passages sont renvoyés pour une requête, vous pouvez également activer la recherche de réponse. Lorsque la valeur est true, les objets de réponse sont renvoyés dans le cadre de chaque passage dans les résultats de la requête. Lorsque
find_answersetper_documentsont tous deux définis sur true, les résultats de la recherche de document et les résultats de la recherche de passage dans chaque document sont réorganisés à l'aide des confiances de réponse. Le but de cette réorganisation est de placer la meilleure réponse comme première réponse du premier passage du premier document. De même, si le paramètrefind_answersest défini sur true et que le paramètre per_document est défini sur false, les résultats de la recherche de passage sont réorganisés dans l'ordre décroissant de la réponse de confiance la plus élevée pour chaque document et passage. -
v1 et v2 prennent en charge les mots vides personnalisés. Cependant, il existe quelques différences dans la façon dont les mots vides personnalisés sont utilisés:
- Il n'existe pas de liste de mots vides personnalisés par défaut pour les collections en japonais dans v2.
- Lorsque vous définissez des mots vides personnalisés dans v1, votre liste de mots vides remplace la liste de mots vides existante. Dans v2, votre liste augmente la liste par défaut. Vous ne pouvez pas remplacer la liste, ce qui signifie que vous ne pouvez pas supprimer les mots vides qui font partie de la liste par défaut dans v2.
Mise à jour de la façon dont votre application gère les résultats de requête
La façon dont votre application affiche les résultats de requête peut nécessiter une mise à jour en raison des différences suivantes entre la syntaxe du document de résultats de requête entre les requêtes v1 et v2:
-
Au niveau de l'enrichissement d'entité, les informations suivantes ne sont pas prises en charge dans v2:
- Désambigüisation
- Emotion
- Sentiment
L'enrichissement Part of Speech est appliqué automatiquement aux documents de la plupart des types de projet dans v2, mais les zones d'index générées par l'enrichissement ne sont pas affichées dans la représentation JSON du document.
{: caption=" -
A la place de
countetrelevancedans v1, v2 inclut les mentions.Chaque entrée de la mention correspond à une occurrence de l'entité dans le texte du document. Dans l'exemple suivant, sept occurrences sont trouvées. Pour chaque occurrence, une cote de confiance et les décalages du texte de la mention sont affichés. Vous pouvez utiliser les décalages pour mettre en évidence la mention dans le texte du document lorsque le résultat est affiché dans une interface utilisateur.
Entity mentions in Discovery v2 -
La structure JSON des réponses de requête est légèrement réorganisée dans v2.
-
Les informations de dédoublonnage ne sont pas incluses dans la réponse à la requête v2.
-
Dans v2,
enriched_textest un tableau à la place d'un objet. -
Dans Discovery v2, l'enrichissement Entities v2 est utilisé. Les noms de type d'entité dans v2 sont spécifiés en majuscules et non en majuscules. Si vous utilisez une requête ou une agrégation qui spécifie un nom d'entité, vous devez modifier la casse. Par exemple, remplacez
PERSONparPerson. -
Les zones des fichiers JSON qui sont ajoutés à une collection sont converties différemment lors de l'ingestion entre v1 et v2. Si votre application manipule ces résultats, vous devrez peut-être effectuer des ajustements.
Vous pouvez spécifier les objets
normalizationsetconversionsdans la méthode Update a collection de l'API pour déplacer ou fusionner des zones JSON.Comment les zones source JSON sont traitées Contenu de la zone JSON d'origine Représentation v1 Représentation v2 Remarques "field": null"field": nullN/A v1 conserve la valeur null. v2 ignore complètement la zone null. "field": """field": ""N/A v1 conserve la valeur de texte vide. v2 ignore complètement la zone de texte vide. "field": "value2""field": "value2""field": "value2"Pas de différence. "field": []"field": []N/A v1 conserve le tableau vide. v2 ignore la zone avec le tableau vide. "field": [ "value4" ]"field": [ "value4" ]"field": "value4"v1 conserve le tableau de singleton. v2 convertit le tableau singleton en valeur uniquement ; il n'est pas stocké dans un tableau. "field": [ 1, 2, 3 ]"field": [ 1, 2, 3 ]"field": [ 1, 2, 3 ]Pas de différence. "field": [ "v6", "v7", "v8" ]"field": [ "v6", "v7", "v8"]"field": [ "v6", "v7", "v8"]Pas de différence.
Vérification de la réussite de la migration de vos données
Pour vérifier que la migration a abouti, comparez les métriques suivantes aux métriques que vous avez notées avant la migration.
-
Nombre de collectes
Veillez à recréer toutes les collections que vous avez utilisées dans v1 et à les conserver. Avec la méthode d'API v2 List collections, vous pouvez obtenir une liste de collections, mais vous devez soumettre une demande par projet. Vous ne pouvez pas utiliser un appel pour obtenir le nombre total de collections par instance de service.
-
Nombre de documents par collection
Pour les collections avec des données téléchargées, vérifiez le nombre de documents dans la collection en envoyant une requête vide avec la méthode d'API Query a project. Indiquez le paramètre d'ID de collection pour limiter les résultats aux seuls documents d'une collection. Une requête vide renvoie tous les documents. Par conséquent, vous pouvez obtenir le nombre total de documents à partir de la valeur
matching_resultsdans la réponse.Le nombre de documents par collection doit être proche du nombre de documents stockés dans la même collection dans v1. Il se peut que les nombres ne soient pas identiques.
Pour les données explorées, ne soyez pas surpris si la collection v2 comporte moins de documents. Les connecteurs v1 ne suppriment pas les documents d'une collection Discovery qui sont supprimés de la source de données externe. Votre version v2 de la collection comporte une exploration plus à jour des données telles qu'elles existent dans la source de données externe aujourd'hui.
Ne vous attendez pas à ce que les résultats de la recherche soient identiques pour les requêtes que vous soumettez dans les instances v1 et v2.
Utilisation d'un service d'informations avec v2
Si vous avez utilisé la source de données Actualités Watson Discovery dans v1 et que vous souhaitez créer une source de données avec une fonction équivalente dans v2, recherchez un service de fournisseur de données Actualités et événements. Recherchez un service qui offre une API de nouvelles qui extrait les articles de nouvelles au format JSON. Vous pouvez ensuite télécharger les fichiers JSON pour créer une collection Actualités dans votre projet v2.
Supprimez votre instance de service v1
Une fois vos données migrées et vos applications mises à jour pour utiliser la nouvelle instance de service v2, veillez à supprimer votre instance de service v1. Vous êtes facturé pour l'instance de service v1 jusqu'à ce que vous la supprimiez. Pour plus d'informations, voir Suppression d'une instance de service géré.