Utilisez le NLP Watson intégré pour trouver des termes communs
Tirez parti des fonctionnalités NLP (Natural Language Processing) Watson primées en ajoutant des enrichissements préconfigurés à vos documents.
Avec Watson NLP, vous pouvez identifier et étiqueter des informations significatives dans vos collections afin de comprendre ce que cela signifie et de prendre des décisions plus éclairées.
Les enrichissements Watson NLP suivants sont disponibles:
- Entités: reconnaît les noms appropriés tels que les personnes, les villes et les organisations mentionnées dans le contenu.
- Mots clés: reconnaît les termes significatifs dans votre contenu.
- Partie du discours: Identifie les parties du discours (noms et verbes, par exemple) dans le contenu.
- Sentiment: comprend le sentiment global du contenu.
Les autres enrichissements préformés suivants sont disponibles avec Discovery:
Enrichissements Watson NLP
Par exemple, la capture d'écran suivante montre une transcription de la déclaration d'indépendance des Etats-Unis qui a été ajoutée à une collection Discovery dans laquelle les enrichissements Entities et Mots-clés sont activés. Les mentions reconnues par les enrichissements sont mises en évidence dans le texte du document.
Certains enrichissements NLP sont appliqués automatiquement aux projets. Vous n'avez pas besoin de les appliquer vous-même si vous utilisez l'un de ces types de projet.
Enrichissements par défaut par type de projet
Certains enrichissements préconfigurés sont appliqués automatiquement aux collections d'un projet en fonction du type de projet. Le tableau suivant présente les enrichissements par défaut qui sont appliqués à chaque type de projet.
| Enrichissement | Document Retrieval (Récupération de documents) | Extraction de documents pour les contrats | Conversational Search (Recherche conversationnelle) | Content Mining (Exploration de contenu) |
|---|---|---|---|---|
| Contrats | ||||
| Entités | ||||
| Des mots clés | ||||
| Partie du discours | ||||
| Sentiment du document | ||||
| Enrichissement Table Understanding |
Pour plus d'informations sur les enrichissements préconfigurés suivants, voir les rubriques suivantes:
Pour plus d'informations sur la création d'enrichissements personnalisés, voir Ajout de ressources spécifiques à un domaine.
Pour plus d'informations sur la façon de tirer le meilleur parti des enrichissements, consultez l'article de blogue L'enrichissement de vos documents peut rendre la recherche plus efficace.
Pour plus d'informations sur l'application d'enrichissements à l'aide de l'API, voir Application d'enrichissements à l'aide de l'API.
Ajouter des enrichissements
Pour ajouter un enrichissement NLP, suivez les étapes suivantes :
-
Ouvrez votre projet et accédez à la page Gérer les collections.
-
Cliquez pour ouvrir la collection que vous souhaitez enrichir.
-
Ouvrez l'onglet Enrichissements.
-
Faites défiler la page pour trouver l'enrichissement NLP que vous souhaitez appliquer à vos documents.
Les enrichissements intégrés et personnalisés sont répertoriés. Les enrichissements intégrés ont une valeur de type
System. -
Sélectionnez une ou plusieurs zones auxquelles appliquer l'enrichissement.
Vous pouvez appliquer des enrichissements aux zones
textethtmlet aux zones personnalisées qui ont été ajoutées à partir de fichiers JSON ou CSV téléchargés ou à partir de l'outil Smart Document Understanding (SDU). -
Cliquez sur Apply changes and reprocess.
Les enrichissements que vous activez sont appliqués aux documents dans un ordre aléatoire. Pour plus d'informations sur la suppression d'un enrichissement, voir Gestion des enrichissements.
Entités
Identifie les entités. Les entités sont des termes qui représentent généralement des noms propres tels que des personnes, des villes et des organisations qui sont mentionnés dans la collecte de données. Discovery peut reconnaître les entités qui font partie d'un système de types d'entité défini par le service Watson Natural Language Processing (NLP).
Si vous souhaitez pouvoir identifier des termes peu communs qui sont importants pour votre entreprise, vous pouvez entraîner votre propre modèle pour reconnaître des entités personnalisées. Pour plus d'informations, voir Extracteur d'entité.
Le service d'extracteur d'entité NLP Watson utilisé par Discovery est appelé système de types NLU. Le nom provient du fait que le système de types est utilisé par le service Watson Natural Language Understanding (NLU) en plus du service Watson Discovery. Toutefois, c'est l'implémentation Watson NLP du système de types qui est utilisée directement par Discovery, et non l'implémentation Watson NLU. Par conséquent, les deux implémentations peuvent produire des résultats différents. Pour obtenir une idée générale des types d'entités qui sont reconnus par le service, voir Entités.
La capture d'écran suivante montre que l'enrichissement Entities reconnaît les termes Systems of Government et King of Great Britain (entre autres) et les balise en tant que mentions d'entité.
Dans la vue JSON du document, vous pouvez voir la structure JSON sous-jacente des mentions d'entité.
Si vous souhaitez rechercher le type d'entité Organisation, par exemple, vous pouvez copier tout le contenu JSON dans un éditeur de texte et rechercher Organization. Cliquez sur l'icône Copier à partir de la racine de l'arborescence
JSON.
Exemple
Entrée
"IBM is an American multinational technology company headquartered in Armonk."
Réponse
Dans la sortie JSON :
text= string. Texte de l'entitétype= string. Le type d'entité, tel queOrganization,Location,Person,Number.mentions= array. Emplacements et mentions de l'entitémodel_name= string. Pour les modèles personnalisés, ce champ contient le nom du modèle fourni par l'utilisateur. Sinon, ce champ contient le nom par défaut du modèle, tel quewatson_knowledge_studio,dictionary,character_pattern, ounatural_language_understanding
{
"entities": [
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.8317045,
"location": {
"end": 3,
"begin": 0
},
"text": "IBM"
}
],
"text": "IBM",
"type": "Organization"
},
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.6114863,
"location": {
"end": 75,
"begin": 69
},
"text": "Armonk"
}
],
"text": "Armonk",
"type": "Location"
}
]
}
Des mots clés
Renvoie des mots clés importants dans le contenu.
Par exemple, la capture d'écran suivante montre les termes mis en évidence de la Déclaration d'indépendance des Etats-Unis qui sont reconnus par l'enrichissement Mots-clés.
Dans la vue JSON du document, vous pouvez voir la structure JSON sous-jacente de la mention de mot clé Declaration.
Exemple
Entrée
"Watson Discovery is an award-winning AI search technology."
Réponse
Dans la sortie JSON :
text= le texte du mot-clémentions= les emplacements et mentions de l'entité
{
"keywords": [
{
"mentions": [
{
"location": {
"end": 157,
"begin": 141
},
"text": "Watson Discovery"
}
],
"text": "Watson Discovery",
"relevance": 0.503613
},
{
"mentions": [
{
"location": {
"end": 177,
"begin": 164
},
"text": "award-winning"
}
],
"text": "award-winning",
"relevance": 0.728722
},
{
"mentions": [
{
"location": {
"end": 198,
"begin": 181
},
"text": "search technology"
}
],
"text": "search technology",
"relevance": 0.779356
}
]
}
Limites des mots clés
L'enrichissement Mots-clés peut identifier jusqu'à 50 mots clés, chacun avec une ou plusieurs mentions, par document.
Partie du discours
Reconnaît et balise les parties de la parole, y compris les noms, les verbes, les adjectifs, les adverbes, les conjonctions, les interjections et les chiffres.