Choisir des enrichissements
Ajoutez des ressources qui peuvent enseigner à Discovery des termes ou des modèles ayant une signification spéciale pour votre application.
Le tableau suivant décrit les meilleures ressources à ajouter pour répondre à différents besoins.
| Objectif | Ressource | Remarques |
|---|---|---|
| Définissez les catégories par lesquelles le texte de vos documents peut être classifié. | Classifieur | N/A |
| Reconnaissez les termes et les synonymes des termes qui sont importants pour vous, tels que les noms des produits que vous vendez. | Dictionnaire | N/A |
Définissez des expressions régulières qui capturent des modèles de signification, par exemple AB10045 est la syntaxe utilisée pour vos numéros de commande. |
Expressions régulières | N/A |
| Reconnaître et étiqueter les entités et les relations qui sont définies dans un modèle d'apprentissage automatique personnalisé. | Modèles d'apprentissage automatique | Nécessite un modèle généré et exporté à partir d'un autre outil IBM. |
| Appliquez des règles aux zones basées sur les règles que vous avez définies en créant un modèle de règles avancées dans IBM Watson® Knowledge Studio. | Modèles de règles avancés | Nécessite un modèle de règles avancées qui est généré et exporté à partir de IBM Watson® Knowledge Studio ou qui utilise une ressource de canevas exportée. |
| IBM Cloud Reconnaître les termes qui sont mentionnés dans les phrases qui correspondent à un modèle syntaxique que vous apprenez à reconnaître à Discovery. | Modèles(bêta) | Disponible en tant que fonction bêta pour les collections en anglais dans les déploiements gérés uniquement. L'enrichissement dérivé par la définition de modèles ne peut pas être appliqué aux projets Content Mining. Vous pouvez exporter la ressource et l'utiliser comme modèle de règles avancé. |
| Reconnaît les entités que vous identifiez comme étant significatives en formant un modèle d'apprentissage automatique d'extracteur d'entité. | Extracteur d'entité | Prend en charge le démarrage à partir d'un corpus Knowledge Studio importé. |
| Classifiez les phrases de vos documents dans des classes de phrases définies par l'utilisateur. | Discriminant de phrase | Prend en charge l'étiquetage intelligent pour accélérer le processus d'étiquetage. |
Vous pouvez également appliquer des enrichissements NLP Watson intégrés qui trouvent les informations suivantes dans votre collection:
Vous pouvez extraire la signification des documents en fonction de la structure de document en définissant un modèle SDU (Smart Document Understanding). Utilisez l'outil Smart Document Understanding pour identifier de nouvelles zones permettant de cibler des enrichissements ou de fractionner des documents volumineux en blocs plus gérables. Pour plus d'informations, voir Signification structurelle avec SDU.
Les dictionnaires et les discriminants que vous ajoutez à un projet peuvent être utilisés par d'autres projets.
Pour plus d'informations sur la façon de tirer le meilleur parti des enrichissements, consultez l'article de blogue L'enrichissement de vos documents peut rendre la recherche plus efficace.
Choix du type d'enrichissement approprié
Le diagramme suivant vous aide à choisir le bon enrichissement pour votre cas d'utilisation.
Utilisation conjointe d'enrichissements
Vous pouvez utiliser de nombreux enrichissements ensemble pour relever les différents défis que vous pouvez rencontrer lors du développement d'une application de recherche.
De nombreuses équipes commencent par créer un enrichissement dictionary. Les dictionnaires sont un outil idéal pour identifier les termes importants et les marquer afin qu'ils puissent être extraits ultérieurement. Disons que
vous générez une application de recherche qui doit extraire les ingrédients des recettes. Un enrichissement de dictionnaire peut reconnaître les mentions de la plupart des ingrédients. Cependant, l'enrichissement du dictionnaire peut correspondre
partiellement à des termes à deux mots. Pour les termes tels que olive oil ou mustard greens, il se peut qu'il ne reconnaisse pas correctement uniquement olive et mustard. Pour améliorer
la précision de la recherche, vous pouvez augmenter l'enrichissement du dictionnaire avec un enrichissement pattern qui peut reconnaître les mentions d'ingrédients à deux mots. Quelques recettes mentionnent peut-être des codes
de coloriage alimentaire au format européen (E104). Vous pouvez ajouter un enrichissement d' expression régulière pour reconnaître les occurrences de codes avec la syntaxe E1nn. Enfin, pour intercepter
les termes qu'aucun autre enrichissement ne peut reconnaître, vous pouvez utiliser un enrichissement d' apprentissage automatique. L'enrichissement peut être un enrichissement que vous générez dans un outil externe et que
vous importez dans Discovery ou un enrichissement que vous générez dans Discovery en créant un enrichissement entity extractor.
L'enrichissement de l'extracteur d'entité est plus sophistiqué que les autres enrichissements. Par exemple, un enrichissement de dictionnaire ne reconnaît que les correspondances exactes des termes du dictionnaire et des synonymes qui apparaissent dans vos documents. Un enrichissement d'expression régulière ne reconnaît que des modèles spécifiques. En revanche, les occurrences d'une entité sont reconnues en fonction du contexte dans lequel un exemple d'entité est mentionné dans une phrase.
Par exemple, vous souhaitez peut-être reconnaître des emplacements et le document que vous souhaitez traiter contient les types de phrases suivants:
- Je vis dans
Massachusetts. - Nous sommes en train de voyager de
New York CityàParisla semaine prochaine.
Pour utiliser un enrichissement de dictionnaire afin de reconnaître correctement les noms d'emplacement, le dictionnaire doit répertorier tous les emplacements possibles. Toutefois, si vous utilisez un enrichissement d'extracteur d'entité, vous
pouvez identifier quand un emplacement est mentionné en fonction de la façon dont l'emplacement est référencé dans une phrase. Avec des phrases telles que "I live in x", "I'm from x" ou "I'm
??? to x" dans ses données d'apprentissage, l'extracteur d'entité peut apprendre que x est une référence à un emplacement.
Lorsque vous devez choisir entre l'utilisation d'un dictionnaire ou d'un enrichissement d'extracteur d'entité, procédez comme suit:
-
Si la liste des exemples possibles est courte, utilisez un dictionnaire.
Il est plus efficace de définir un terme de dictionnaire
planetavec des synonymes tels queEarthetSaturnque de créer une entitéplanetcar seules 8 planètes existent dans notre système solaire. Cependant, il n'est pas possible de définir une liste de tous les emplacements possibles sur Terre. Un extracteur d'entité peut reconnaître plus de mentions d'emplacement. -
Si la liste des exemples possibles est statique, utilisez un dictionnaire.
La controverse sur Pluton mis à part, la catégorie
planetest un bon exemple ici aussi parce que la liste des planètes de notre système solaire est statique. Vous pouvez également surveiller le sentiment général des clients concernant vos produits. Vous devez être en mesure de reconnaître les mentions de nom de produit, mais il se peut que vous n'ayez pas besoin de détails spécifiques. Si vous disposez d'une grande variété de noms de produit, vous pouvez créer une entitéproduct name. Au fur et à mesure que de nouveaux produits sont ajoutés à votre portefeuille ou que les noms de produits changent au fil du temps, vous n'avez pas besoin de tenir à jour une liste globale des produits. L'extracteur d'entité peut continuer à reconnaître les commentaires généraux sur vos produits en fonction du contexte des phrases dans lesquelles les produits sont mentionnés.
Ajouter une ressource
Lorsque vous ajoutez un enrichissement personnalisé à un projet, il est disponible pour toute collection du projet.
Pour ajouter une ressource, procédez comme suit :
-
Ouvrez votre projet et accédez à la page Improve and customize.
-
Dans le panneau Outils d'amélioration, développez Concepts de domaine Teach, puis choisissez la ressource à ajouter.
Une fois la ressource créée, elle devient un nouveau type d'enrichissement que vous pouvez appliquer à vos données.
-
Indiquez la collection et la zone dans laquelle appliquer l'enrichissement.
Vous pouvez appliquer des enrichissements aux zones
textethtmlet aux zones personnalisées qui ont été ajoutées à partir de fichiers JSON ou CSV téléchargés ou à partir de l'outil Smart Document Understanding (SDU). Seuls les 50 000 premiers caractères d'une zone personnalisée d'un fichier JSON sont enrichis.Par exemple, si vous ajoutez un dictionnaire et que vous choisissez de l'appliquer à la zone
textd'une collection, les documents de la collection sont retraités. Si le termevehicleest spécifié comme synonyme de l'entrée de dictionnairecaret apparaît dans le texte du document,vehicleest étiqueté comme une mention du type d'entrée de dictionnairecar. Si un client recherche ultérieurementcar, le passage qui contient la mentionvehicleest inclus dans les résultats de la recherche.Si la zone que vous choisissez provient d'un fichier JSON, après avoir appliqué l'enrichissement, le type de données de zone est converti en tableau. La zone est convertie en tableau même si elle contient une valeur unique. Par exemple,
"field1": "Discovery"devient"field1": ["Discovery"].
Vous pouvez choisir d'appliquer des enrichissements dérivés des ressources à vos données ultérieurement. Les enrichissements que vous ajoutez à un projet peuvent être utilisés à partir de n'importe quelle collection du projet. Accédez à la page Gérer les collections, choisissez la collection dans laquelle vous souhaitez appliquer l'enrichissement, puis ouvrez l'onglet Enrichments. Vérifiez que le statut de l'enrichissement indique qu'il est Prêt, puis appliquez l'enrichissement à une zone de la collection. Les enrichissements que vous activez sont appliqués aux documents dans un ordre aléatoire. Pour plus d'informations, voir Gestion des enrichissements.
A partir de l'application Content Mining déployée, vous pouvez créer un discriminant ou un annotateur personnalisé à partir d'un dictionnaire, d'une expression régulière, d'un apprentissage automatique ou d'un fichier PEAR et l'utiliser comme enrichissement dans des collections stockées dans d'autres types de projet. Pour plus d'informations, voir Ajout de facettes.