Utiliser des modèles ML importés pour rechercher des termes personnalisés

Utilisez des modèles Machine Learning personnalisés qui utilisent des règles ou un contexte pour reconnaître et étiqueter les entités.

Ajoutez des modèles Machine Learning que vous avez créés avec les outils IBM que vous pouvez utiliser pour définir votre propre système de types.

Le type de modèles que vous pouvez ajouter dépend de votre déploiement:

  • IBM Cloud Pak for Data Vous pouvez ajouter des modèles créés avec l'xml-ph-0000@deepl.internal, l'xml-ph-0001@deepl.internal, les modèles Studio ou avec une instance de xml-ph-00 IBM Software Hub Vous pouvez ajouter des modèles créés avec l' Watson Explorer, l' Content Analytics, Studio ou avec une instance de l' IBM Watson® Knowledge Studio, hébergée sur IBM Cloud Pak® for Data ou IBM Cloud. À partir de la version d' 4.6.2, vous pouvez également ajouter des modèles d'extracteur d'entités personnalisés qui ont été créés et exportés à partir d'une autre instance d' Discovery.

  • IBM Cloud Vous pouvez ajouter des modèles qui ont été créés avec une instance IBM Watson® Knowledge Studio hébergée dans IBM Cloud uniquement.

    Pour utiliser un modèle Knowledge Studio qui a été généré avec Knowledge Studio sur IBM Cloud Pak for Data, migrez les données de référence vers une instance IBM Cloud de Knowledge Studio, puis entraînez à nouveau le modèle.

Les types de modèles suivants sont pris en charge :

  • Les modèles basés sur les règles créés dans Knowledge Studio qui recherchent des entités dans les documents en fonction des règles que vous définissez. (Format de fichier: .pear)
  • Modèles d'apprentissage automatique créés dans l' Knowledge Studio, qui comprennent les nuances linguistiques, le sens et les relations spécifiques à votre secteur d'activité (format de fichier : .zip)
  • Extracteurs d'entité personnalisés créés dans et exportés à partir de Discovery. (Format de fichier: .ent)
  • Discriminants de phrases créés dans et exportés à partir de Discovery. (Format de fichier: .sc)
  • IBM Cloud Pak for Data modèles d'analyse de texte UIMA personnalisés créés dans l'xml-ph-0000@deepl.internalxml-ph-0001@deepl.internalStudio IBM Software Hub Modèles d'analyse de texte UIMA personnalisés créés dans l' Watson Explorer Content Analytics Studio. (Format de fichier: .pear)

A partir des déploiements installés, la prise en charge de l'importation de modèles d'extracteur d'entité a été ajoutée avec l'édition 4.6.2.

La reconnaissance ne peut pas identifier les sous-types d'entité définis par un modèle Knowledge Studio.

Pour ajouter un modèle d' Machine Learning, procédez comme suit :

  1. Créez le modèle et exportez-le à partir de l'outil que vous utilisez pour le créer.

    Pour plus d'informations, consultez la documentation suivante :

  2. Dans la section Teach domain concepts du panneau Improvement tools, cliquez sur Import machine learning models.

  3. Indiquez un nom pour le modèle, puis choisissez la langue utilisée pour définir le modèle.

  4. Cliquez sur Télécharger pour rechercher le fichier que vous avez exporté précédemment.

  5. Cliquez sur Créer.

  6. Choisissez la collection et la zone dans lesquelles vous souhaitez appliquer les enrichissements du modèle, puis cliquez sur Appliquer.

Si le modèle est trop grand pour être téléchargé à partir de l'interface utilisateur du produit, vous pouvez utiliser la méthode Créer un enrichissement de l'API pour importer le fichier.

Exemple de modèle à base de règles

Par exemple, lorsqu'un modèle d'apprentissage automatique est appliqué pour enrichir un champ, il extrait tous les types d'entités de ce champ qui ont été spécifiés dans un modèle basé sur des règles d' Knowledge Studio. Si le modèle reconnaît des types d'entité tels que person, surname et job title, ils sont reconnus dans vos documents et étiquetés.

Dans la sortie, les informations extraites par l'enrichissement Machine Learning dans le tableau enriched_{field_name}, dans le tableau entities. Dans cet exemple, la zone sélectionnée pour l'enrichissement est text.

{
  "enriched_text": [
    {
      "entities": [
        {
          "path": ".wksrule.entities.PERSON",
          "text": "George Washington",
          "type": "PERSON"
        },
        {
          "path": ".wksrule.entities.GIVENNAME",
          "text": "George",
          "type": "GIVENNAME"
        },
        {
          "path": ".wksrule.entities.SURNAME",
          "text": "Washington",
          "type": "SURNAME"
        },
        {
          "path": ".wksrule.entities.POSITION",
          "text": "politician",
          "type": "POSITION"
        },
        {
          "path": ".wksrule.entities.POSITION",
          "text": "soldier",
          "type": "POSITION"
        },
        {
          "path": ".wksrule.entities.JOBTITLE",
          "text": "President of the United States",
          "type": "JOBTITLE"
        }
      ],
      "text": [
        "George Washington (February 22, 1732‚ December 14, 1799) was an American politician and soldier who served as the first President of the United States from 1789 to 1797 and was one of the Founding Fathers of the United States."
      ]
    }
  ]
}

Par conséquent, si une personne utilise l'API pour soumettre une requête en langage de requête Discovery afin de rechercher les occurrences de l'enrichissement enriched_{field_name}.entities.type:jobtitle, tous les passages qui traitent de la fonction d'une personne sont renvoyés.

Exemple de modèle d'apprentissage automatique

Dans cet exemple, un modèle d'apprentissage automatique extrait des types d'entité tels que person, oranization et date, ainsi que des informations sur les relations entre les entités. Lorsque ce modèle d'apprentissage automatique est appliqué pour enrichir un champ, il utilise l'apprentissage automatique pour comprendre les nuances linguistiques, le sens et les relations qui sont mentionnés dans le document.

Dans la sortie, les informations extraites par l'enrichissement Machine Learning dans le tableau enriched_{field_name}, dans les tableaux entities et relations. Dans cet exemple, la zone sélectionnée pour l'enrichissement est text.

{
  "enriched_text": [
    {
      "entities": [
        {
          "count": 1,
          "text": "Democratic Party",
          "type": "ORGANIZATION"
        },
        {
          "count": 1,
          "text": "March 15, 1767",
          "type": "DATE"
        },
        {
          "count": 1,
          "text": "President",
          "type": "POSITION"
        },
        {
          "count": 1,
          "text": "Andrew Jackson",
          "type": "PERSON"
        }
      ],
      "relations": [
        {
          "sentence": "Andrew Jackson (March 15, 1767‚ June 8, 1845) was an American soldier and statesman who served as the seventh President of the United States from 1829 to 1837 and was the founder of the Democratic Party."
        }
      ]
    }
  ]
}

Limites du modèle d'apprentissage automatique

Le nombre de modèles Machine Learning (ML) que vous pouvez créer par instance de service dépend de votre type de plan Discovery.

Limites du plan de modèle ML
Planifier Modèles ML par instance de service
Cloud Pak for Data Illimité
Premium 10
Entreprise 10
Plus (inclut la version d'essai) 3

Pour chaque modèle d'apprentissage automatique Knowledge Studio, le nombre maximal d'entités pouvant être détectées est de 50.

Modèles de règles avancées

Ajoutez un modèle de règles avancées pour appliquer à votre collection un modèle d'extraction de texte créé et exporté à partir de l'éditeur de règles avancées de IBM Watson® Knowledge Studio.

Votre modèle doit être créé avec le déploiement Knowledge Studio approprié:

  • IBM Cloud Pak for Data vous pouvez ajouter des modèles qui ont été créés et exportés à partir des emplacements suivants IBM Software Hub Vous pouvez ajouter des modèles qui ont été créés et exportés à partir des emplacements suivants :

    • IBM Watson® Knowledge Studio qui a été généré avec un déploiement IBM Cloud Pak® for Data antérieur à l'édition 4.5.
    • IBM Watson® Knowledge Studio hébergé sur IBM Cloud
    • Editeur NLP créé par les contributeurs au Center for Open-source Data & AI Technologies
  • IBM Cloud Vous pouvez ajouter des modèles qui ont été créés avec une instance IBM Watson® Knowledge Studio hébergée sur IBM Cloud uniquement.

Suppression de Knowledge Studio

La prise en charge de la génération de modèles à l'aide de la version bêta d'Advanced Rules Editor dans Knowledge Studio a pris fin. Tous les modèles de règles exportés à partir de Knowledge Studio avant la date de fin de prise en charge peuvent continuer à être utilisés dans Discovery.

Les dates de fin de prise en charge varient en fonction du type de déploiement:

  • IBM Cloud 30 juin 2022
  • IBM Cloud Pak for Data IBM Cloud Pak for Data version 4.5.1 le 3 août 2022.

IBM Cloud Au lieu d'utiliser un modèle généré par l'éditeur de règles avancées Knowledge Studio, vous pouvez définir une règle enajoutant un enrichissement Patterns.

Ajout d'un modèle existant

Pour ajouter un modèle de règle avancé, procédez comme suit:

  1. Créez le modèle et exportez le fichier ZIP qui contient les ressources de modèle.

    Pour plus d'informations sur l'exportation du modèle, voir les instructions relatives à votre source de modèle:

  2. Dans la section Teach domain concepts du panneau Improvement tools, sélectionnez Advanced rules model.

  3. Cliquez sur Transférer.

  4. Indiquez un nom pour le modèle, puis choisissez la langue utilisée pour définir le modèle.

  5. Indiquez un nom pour la zone de résultat, qui correspond à la zone de l'index dans laquelle la sortie de cet enrichissement sera stockée.

  6. Cliquez sur Télécharger pour rechercher le fichier ZIP que vous avez exporté précédemment.

  7. Cliquez sur Créer.

  8. Choisissez la collection et la zone dans lesquelles vous souhaitez appliquer les enrichissements du modèle, puis cliquez sur Appliquer.

Format de sortie pour les règles avancées

Knowledge Studio utilise le langage AQL (Annotation Query Language) pour définir les règles dans un modèle de règles avancées. Chaque modèle est défini par une ou plusieurs vues. Chaque vue est une structure de données relationnelles qui contient plusieurs enregistrements de données. Chaque enregistrement est composé de valeurs dans des colonnes qui sont définies par le schéma de la vue. Pour faciliter la représentation de ces modèles, qui sont personnalisés et ont donc différents schémas, un schéma de sortie JSON uniforme est utilisé.

  • Chaque objet JSON représente une vue AQL (Annotation Query Language).
  • Les paires nom-valeur des objets JSON représentent les noms et les valeurs des attributs de la vue.
  • Les tuples d'une vue AQL sont représentés sous la forme d'un tableau d'objets JSON, avec un objet pour chaque tuple de la vue.

Le tableau suivant décrit comment les types de données AQL sont représentés dans la syntaxe JSON.

Schéma de sortie JSON de modèle de règles avancées
Type de données AQL Syntaxe JSON Exemple JSON
Entier numéro aujourd'hui 5
Flottant numéro aujourd'hui 4.13
Booléen booléen true
Texte chaîne "some string"
Séquence objet au format {"text": String, "location": {"begin": Integer, "end": Integer}} { "text": "Jane", location": {"begin": 5, "end": 9} }
Cas particulier: valeur null null null
Liste des entiers tableau de valeurs numériques [ 1, 2, 3, 4, 5]
Liste des variables flottantes tableau de valeurs numériques [ 4.13, 4.5 ]
Liste des valeurs booléennes tableau de valeurs booléennes [ true, true, false]
Liste de texte tableau de valeurs de chaîne [ "some string", "another string" ]
Liste des Span tableau d'objets au format {"text":String, "location": {"begin": Integer, "end": Integer}} [{ "text":"Jane", "location": {"begin": 5, "end": 9} }, { "text":"...", "location": {"begin": 15, "end": 40} }]
Cas spécial: liste vide tableau avec 0 élément [ ]

Limites du modèle de règles avancées

Le nombre de modèles de règles avancées que vous pouvez définir par instance de service dépend de votre type de plan Discovery.

Limites du plan de modèle de règles avancées
Planifier Modèles de règles avancées par instance de service
Cloud Pak for Data Illimité
Premium 3
Entreprise 3
Plus (inclut la version d'essai) 1