Création d'annotateurs personnalisés

Vous pouvez créer un dictionnaire, une expression régulière ou un annotateur d'apprentissage automatique pour générer de nouvelles facettes qui peuvent vous aider à analyser vos données.

Avant de commencer, préparez les données suivantes.

Données de prérequis de l'annotateur personnalisé
Type d'annotateur Descriptif Données
Dictionnaire Affecte des facettes à des termes qui correspondent à des entrées de dictionnaire que vous définissez ou téléchargez. Vous pouvez éventuellement télécharger un fichier de termes de dictionnaire.
Apprentissage automatique Affecte des facettes aux mentions qui sont reconnues par un modèle d'apprentissage automatique que vous téléchargez. Un fichier compressé d'un modèle d'apprentissage automatique est requis.
Expression régulière Affecte des facettes à du texte qui correspond aux modèles d'expression régulière Java que vous définissez ou téléchargez. Vous pouvez éventuellement télécharger un fichier JSON qui contient des modèles d'expression régulière.

Pour créer un annotateur personnalisé, suivez les étapes suivantes :

  1. Dans la vue d'analyse de votre collection, cliquez sur le lien Collections dans l'élément de navigation pour ouvrir la page Créer une collection pour vos solutions d'analyse de l'application Content Mining.

  2. Pour créer un annotateur, cliquez sur collection, puis sélectionnez custom annotator dans la liste.

    Affiche le{: caption="de la collectionMenu " caption-side="bottom"} la collection

  3. Cliquez sur Créer un annotateur personnalisé.

  4. Nommez votre annotateur et ajoutez éventuellement une description.

  5. Choisissez le type d'annotateur, puis cliquez sur Suivant.

  6. Suivez les instructions à l'écran.

    Pour plus d'informations sur la configuration de chaque type d'annotateur, voir l'une des sections suivantes:

Configuration du dictionnaire

Vous pouvez importer un dictionnaire existant en le téléchargeant ou vous pouvez créer un dictionnaire en ajoutant des termes un par un.

Si vous prévoyez d'importer un dictionnaire, les termes du dictionnaire doivent être définis dans un fichier CSV. Spécifiez chaque terme et ses synonymes sur une ligne distincte. Utilisez la syntaxe suivante pour spécifier chaque terme:

{term},{synonym},{synonym},...

Pour ajouter un dictionnaire, procédez comme suit :

  1. Effectuez l'une des opérations suivantes :

    • Pour importer les termes du dictionnaire:

      1. Cliquez sur Importer, puis recherchez le fichier contenant les termes de votre dictionnaire.
      2. Cliquez sur Import.
    • Pour définir les termes du dictionnaire:

      1. Cliquez sur Ajouter.
      2. Cliquez sur Liste de mots pour ajouter les termes du dictionnaire.
      3. Cliquez sur Ajouter, puis ajoutez le terme dans la zone Mot de base et les synonymes que vous souhaitez définir pour le terme dans la zone Autres mots. Séparez les synonymes multiples par des virgules. Cliquez sur OK.
      4. Répétez l'étape précédente pour ajouter d'autres termes de dictionnaire.
      5. Une fois que vous avez terminé d'ajouter des termes de dictionnaire, cliquez sur Paramètres de base.
  2. Nommez le dictionnaire.

  3. Si vous prévoyez de définir des termes avec une partie du discours autre qu'un nom, spécifiez la partie du discours.

    Si la langue sélectionnée est le chinois, le japonais, le coréen ou l'hébreu, vous ne pouvez spécifier que Nom pour la partie du discours.

  4. Décidez de la façon dont vous voulez traiter le cas.

    Lorsque la casse est ignorée, les termes Sat, SAT et sat sont tous libellés en tant qu'occurrences du terme du dictionnaire Sat.

    Lorsque vous décochez la case Ignorer maj/min pour créer un dictionnaire sensible à la casse, la forme de surface du terme avec une correspondance en majuscules est utilisée. Des annotations sont ajoutées pour le terme exactement tel qu'il est écrit et pour les variations du terme dans lequel les lettres sont en majuscules.

    Par exemple, une entrée sat dans le dictionnaire génère des annotations pour les mentions sat, Sat ou SAT lorsqu'elles apparaissent dans du texte. Pour une entrée Sat du dictionnaire, des annotations sont ajoutées pour les occurrences de Sat et SAT, mais pas pour sat.

  5. Identifiez le nom de facette à utiliser pour ce dictionnaire.

    Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.

    Vous pouvez créer une facette hiérarchique en incluant un point (.) dans le nom de la facette. Par exemple, vous pouvez créer un dictionnaire avec le chemin de facette Food.Vegetables et d'autres avec les chemins de facette Food.Fruits et Food.Proteins. Ajoutez d'autres groupes de facettes avec plus de points. Par exemple, vous pouvez ajouter Food.Proteins.Nuts et Food.Proteins.Meats pour catégoriser encore plus les protéines.

    Montre comment ajouter un
    un

  6. Si vous souhaitez que les documents renvoyés pour une sous-facette soient inclus lorsqu'un utilisateur filtre sur la facette racine, sélectionnez Lift up words.

    Par exemple, vous pouvez activer Lift words pour Food.Fruits et Food.Proteins mais pas Food.Vegetables. Par conséquent, lorsqu'un utilisateur clique sur la facette Food, les documents renvoyés incluent des documents qui mentionnent des termes inclus dans les dictionnaires Fruits et Meats, tels que pommes et bœuf.

    Indique que les documents contenant tous les termes, à l'exception de ceux du dictionnaire des légumes, sont renvoyés lorsque la facette Food est sélectionnée.
    Dictionary enrichment application

    Toutefois, un utilisateur doit cliquer explicitement sur la facette Aliments > Légumes pour obtenir les documents qui mentionnent des termes dans le dictionnaire Légumes, tels que la laitue, à renvoyer.

    Indique que seuls les documents qui mentionnent des légumes sont renvoyés lorsque la facette Légumes est sélectionnée.
    Subfacets

  7. Répétez les étapes précédentes pour ajouter d'autres dictionnaires.

  8. Cliquez sur Sauvegarder.

A partir de la page de l'annotateur personnalisé, vous pouvez voir les dictionnaires qui ont été créés dans d'autres projets, y compris les projets autres que Content Mining. Les dictionnaires d'autres types de projet affichent le nom d'enrichissement comme nom d'annotateur. Les paramètres Ignorer maj/min et Lift up words sont désactivés et le dictionnaire est nommé custom dict.

Limites du dictionnaire

Limites du plan de dictionnaire
Planifier Nombre de dictionnaires par instance de service Nombre de mots de base par dictionnaire Nombre de termes pour lesquels des suggestions peuvent être générées
Cloud Pak for Data Illimité Illimité 1 000
Premium 200 10 000 1 000
Entreprise 200 10 000 1 000

Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.

Configuration de l'apprentissage automatique

Vous pouvez importer un modèle d'apprentissage automatique existant.

Pour utiliser Discovery afin de créer un modèle, voir Entity extractor.

Pour importer un modèle, suivez les étapes suivantes :

  1. Cliquez sur Sélectionner un fichier, puis recherchez le fichier de modèle d'apprentissage automatique.

  2. Dans la zone Chemin de facette, indiquez le nom de facette racine à utiliser pour le modèle.

    Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.

  3. Cliquez sur Sauvegarder.

Limites du modèle d'apprentissage automatique

Limites du plan de modèle ML
Planifier Modèles ML par instance de service
Cloud Pak for Data Illimité
Premium 10
Entreprise 10

Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.

Configuration des expressions régulières

Vous pouvez importer des canevas existants en les téléchargeant dans un fichier JSON ou vous pouvez ajouter des canevas.

Pour ajouter des motifs, procédez comme suit :

  1. Ajoutez le modèle d'expression régulière à la zone Nouveau modèle, puis cliquez sur Ajouter.

  2. Indiquez un nom pour le modèle, puis identifiez le nom de facette à utiliser pour ce modèle.

    Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.

  3. Facultatif: spécifiez une valeur de facette. Vous pouvez spécifier une valeur à partir des options décrites dans le tableau.

    Options de valeur de facette d'expression régulière
    Valeur de facette Descriptif
    $0 Affiche le texte correspondant tel qu'il est.
    $n Si votre modèle d'expression régulière contient des groupes, vous pouvez spécifier un numéro de groupe pour renvoyer le texte correspondant à partir du groupe de modèles uniquement. Par exemple, si votre expression régulière se compose de 3 groupes qui définissent un modèle de numéro de téléphone américain, tel que (\d{3})-(\d{3})-(\d{4}), et que vous souhaitez renvoyer uniquement la partie d'indicatif régional du numéro de téléphone, vous pouvez spécifier $1. Si le texte mis en correspondance est 212-555-1234, la valeur de facette est affichée sous la forme 212. Indiquez uniquement un groupe en tant que valeur de facette pour les modèles qui, selon vous, renverront des correspondances.
    {prefix-text}:$0 Ajoute du texte codé en dur devant le nom de la facette. Vous pouvez utiliser cette option si vous souhaitez distinguer les facettes générées par cette expression régulière des facettes similaires mais générées d'une autre manière. Par exemple, MyRegex:$0 génère une facette nommée MyRegex:212-555-1234.
  4. Cliquez sur Sauvegarder.

Pour importer des motifs, procédez comme suit :

  1. Définissez les canevas que vous souhaitez ajouter dans un fichier JSON.

    La définition de modèle doit utiliser la syntaxe suivante:

    [
      {
        "name": "US Phone number",
        "description": "US mobile phone number",
        "pattern": "(\\d{3})-(\\d{3})-(\\d{4})",
        "facetPath": ".regex.usphonenumber",
        "facetValue": "$0"
      }
    ]
    

    Gardez à l'esprit les remarques suivantes :

    • Les modèles doivent être définis dans un tableau, même si vous prévoyez de définir un seul modèle.
    • Mettez en échappement toute barre oblique inversée (\) avec une barre oblique inversée.
    • Pour plus d'informations sur les options de valeur de facette, voir le tableau Options de valeur de facette d'expression régulière.
  2. Cliquez sur Importer, puis choisissez le fichier JSON dans lequel les canevas sont définis.

  3. Cliquez sur Sauvegarder.

Limites d'expression régulière

Limites du plan d'expression régulière
Planifier Enrichissements d'expression régulière par instance de service Modèles d'expression régulière par instance de service
Cloud Pak for Data Illimité Illimité
Premium 100 50
Entreprise 100 50

Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.

Application de l'annotateur

Une fois l'annotateur créé, vous devez l'appliquer à votre collection.

  1. Dans la page Créer un annotateur personnalisé pour vos solutions d'analyse de l'application Content Mining, cliquez sur annotateur personnalisé, puis sélectionnez collection dans la liste.

  2. Dans la vignette de votre collection, cliquez sur l'icône options et choisissez Editer la collection.

  3. Cliquez sur l'onglet Enrichissement, puis sélectionnez l'annotateur que vous avez créé.

    Il se peut que vous deviez faire défiler la page pour la trouver.

  4. Cliquez sur Enregistrer, puis confirmez l'action.

Donnez le temps à l'index de se régénérer.

Filtrage de documents avec votre facette

  1. Cliquez sur la vignette de la collection pour ouvrir votre collection dans la page d'analyse des données.

  2. Effectuez l'une des opérations suivantes :

    • Vos facettes personnalisées sont répertoriées dans la vue Facettes. Faites défiler et cliquez sur Charger plus à plusieurs reprises jusqu'à ce que vos facettes soient affichées.

    • Soumettez une recherche vide pour renvoyer tous les documents. Dans la sous-fenêtre Analyse de facette, sélectionnez la facette que vous avez créée.

    • Pour accéder plus rapidement à vos facettes personnalisées, ajoutez-les à une vue personnalisée. Sélectionnez Personnalisé comme vue, puis cliquez sur Editer. Sélectionnez une ou plusieurs facettes à ajouter à la vue, puis cliquez sur Sauvegarder.

      caption-side=bottom"
      de la collection*