Utilisez le NLP Watson intégré pour trouver des termes communs

Tirez parti des fonctionnalités NLP (Natural Language Processing) Watson primées en ajoutant des enrichissements préconfigurés à vos documents.

Avec Watson NLP, vous pouvez identifier et étiqueter des informations significatives dans vos collections afin de comprendre ce que cela signifie et de prendre des décisions plus éclairées.

Les enrichissements Watson NLP suivants sont disponibles:

  • Entités: reconnaît les noms appropriés tels que les personnes, les villes et les organisations mentionnées dans le contenu.
  • Mots clés: reconnaît les termes significatifs dans votre contenu.
  • Partie du discours: Identifie les parties du discours (noms et verbes, par exemple) dans le contenu.
  • Sentiment: comprend le sentiment global du contenu.

Les autres enrichissements préformés suivants sont disponibles avec Discovery:

Enrichissements Watson NLP

Par exemple, la capture d'écran suivante montre une transcription de la déclaration d'indépendance des Etats-Unis qui a été ajoutée à une collection Discovery dans laquelle les enrichissements Entities et Mots-clés sont activés. Les mentions reconnues par les enrichissements sont mises en évidence dans le texte du document.

Affiche un extrait de la Déclaration d'indépendance des États-Unis avec plusieurs termes mis en évidence.
Excerpt of the US Declaration of Independence with highlighted terms

Certains enrichissements NLP sont appliqués automatiquement aux projets. Vous n'avez pas besoin de les appliquer vous-même si vous utilisez l'un de ces types de projet.

Enrichissements par défaut par type de projet

Certains enrichissements préconfigurés sont appliqués automatiquement aux collections d'un projet en fonction du type de projet. Le tableau suivant présente les enrichissements par défaut qui sont appliqués à chaque type de projet.

enrichissements par défaut par type de projet
Ce tableau comporte des en-têtes de ligne et de colonne. Les en-têtes de ligne identifient les types de projet. Les en-têtes de colonne identifient différents enrichissements. Pour savoir quels enrichissements sont appliqués à un type de projet par défaut, accédez à la ligne qui décrit les enrichissements et recherchez les colonnes correspondant au type de projet qui vous intéresse.
Enrichissement Document Retrieval (Récupération de documents) Extraction de documents pour les contrats Conversational Search (Recherche conversationnelle) Content Mining (Exploration de contenu)
Contrats Icône de coche
Entités Icône de coche Icône de coche
Des mots clés
Partie du discours Icône de coche
Sentiment du document
Enrichissement Table Understanding Icône de coche

Pour plus d'informations sur les enrichissements préconfigurés suivants, voir les rubriques suivantes:

Pour plus d'informations sur la création d'enrichissements personnalisés, voir Ajout de ressources spécifiques à un domaine.

Pour plus d'informations sur la façon de tirer le meilleur parti des enrichissements, consultez l'article de blogue L'enrichissement de vos documents peut rendre la recherche plus efficace.

Pour plus d'informations sur l'application d'enrichissements à l'aide de l'API, voir Application d'enrichissements à l'aide de l'API.

Ajouter des enrichissements

Pour ajouter un enrichissement NLP, suivez les étapes suivantes :

  1. Ouvrez votre projet et accédez à la page Gérer les collections.

  2. Cliquez pour ouvrir la collection que vous souhaitez enrichir.

  3. Ouvrez l'onglet Enrichissements.

  4. Faites défiler la page pour trouver l'enrichissement NLP que vous souhaitez appliquer à vos documents.

    Les enrichissements intégrés et personnalisés sont répertoriés. Les enrichissements intégrés ont une valeur de type System.

  5. Sélectionnez une ou plusieurs zones auxquelles appliquer l'enrichissement.

    Vous pouvez appliquer des enrichissements aux zones text et html et aux zones personnalisées qui ont été ajoutées à partir de fichiers JSON ou CSV téléchargés ou à partir de l'outil Smart Document Understanding (SDU).

  6. Cliquez sur Apply changes and reprocess.

Les enrichissements que vous activez sont appliqués aux documents dans un ordre aléatoire. Pour plus d'informations sur la suppression d'un enrichissement, voir Gestion des enrichissements.

Entités

Identifie les entités. Les entités sont des termes qui représentent généralement des noms propres tels que des personnes, des villes et des organisations qui sont mentionnés dans la collecte de données. Discovery peut reconnaître les entités qui font partie d'un système de types d'entité défini par le service Watson Natural Language Processing (NLP).

Si vous souhaitez pouvoir identifier des termes peu communs qui sont importants pour votre entreprise, vous pouvez entraîner votre propre modèle pour reconnaître des entités personnalisées. Pour plus d'informations, voir Extracteur d'entité.

Le service d'extracteur d'entité NLP Watson utilisé par Discovery est appelé système de types NLU. Le nom provient du fait que le système de types est utilisé par le service Watson Natural Language Understanding (NLU) en plus du service Watson Discovery. Toutefois, c'est l'implémentation Watson NLP du système de types qui est utilisée directement par Discovery, et non l'implémentation Watson NLU. Par conséquent, les deux implémentations peuvent produire des résultats différents. Pour obtenir une idée générale des types d'entités qui sont reconnus par le service, voir Entités.

La capture d'écran suivante montre que l'enrichissement Entities reconnaît les termes Systems of Government et King of Great Britain (entre autres) et les balise en tant que mentions d'entité.

Affiche la déclaration avec les termes "gouvernements" et "roi de Grande-Bretagne" mis en évidence.
The recognized entities, Governments and King of Great Britain, are highlighted

Dans la vue JSON du document, vous pouvez voir la structure JSON sous-jacente des mentions d'entité.

Montre la vue JSON des entités Systems of Government et King of Great Britain qui sont identifiées dans le
JSON des
d'entités reconnues*

Si vous souhaitez rechercher le type d'entité Organisation, par exemple, vous pouvez copier tout le contenu JSON dans un éditeur de texte et rechercher Organization. Cliquez sur l'icône Copier à partir de la racine de l'arborescence JSON.

Exemple

Entrée

"IBM is an American multinational technology company headquartered in Armonk."

Réponse

Dans la sortie JSON :

  • text = string. Texte de l'entité
  • type = string. Le type d'entité, tel que Organization, Location, Person, Number.
  • mentions = array. Emplacements et mentions de l'entité
  • model_name = string. Pour les modèles personnalisés, ce champ contient le nom du modèle fourni par l'utilisateur. Sinon, ce champ contient le nom par défaut du modèle, tel que watson_knowledge_studio, dictionary, character_pattern, ou natural_language_understanding
{
  "entities": [
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.8317045,
          "location": {
            "end": 3,
            "begin": 0
          },
          "text": "IBM"
        }
      ],
      "text": "IBM",
      "type": "Organization"
    },
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.6114863,
          "location": {
            "end": 75,
            "begin": 69
          },
        "text": "Armonk"
        }
      ],
      "text": "Armonk",
      "type": "Location"
    }
  ]
}

Des mots clés

Renvoie des mots clés importants dans le contenu.

Par exemple, la capture d'écran suivante montre les termes mis en évidence de la Déclaration d'indépendance des Etats-Unis qui sont reconnus par l'enrichissement Mots-clés.

Affiche les mots-clés reconnus dans le texte du
reconnus par l'
des mots-clés*

Dans la vue JSON du document, vous pouvez voir la structure JSON sous-jacente de la mention de mot clé Declaration.

Affiche la vue JSON des mots-clés identifiés dans le
JSON des
d'enrichissement des mots-clés*

Exemple

Entrée

"Watson Discovery is an award-winning AI search technology."

Réponse

Dans la sortie JSON :

  • text = le texte du mot-clé
  • mentions = les emplacements et mentions de l'entité
{
  "keywords": [
    {
      "mentions": [
        {
          "location": {
            "end": 157,
            "begin": 141
          },
          "text": "Watson Discovery"
        }
      ],
      "text": "Watson Discovery",
      "relevance": 0.503613
    },
    {
      "mentions": [
        {
          "location": {
           "end": 177,
            "begin": 164
          },
          "text": "award-winning"
        }
      ],
      "text": "award-winning",
      "relevance": 0.728722
    },
    {
      "mentions": [
        {
          "location": {
            "end": 198,
            "begin": 181
          },
          "text": "search technology"
        }
      ],
      "text": "search technology",
      "relevance": 0.779356
    }
  ]
}

Limites des mots clés

L'enrichissement Mots-clés peut identifier jusqu'à 50 mots clés, chacun avec une ou plusieurs mentions, par document.

Partie du discours

Reconnaît et balise les parties de la parole, y compris les noms, les verbes, les adjectifs, les adverbes, les conjonctions, les interjections et les chiffres.