Vous pouvez créer un dictionnaire, une expression régulière ou un annotateur d'apprentissage automatique pour générer de nouvelles facettes qui peuvent vous aider à analyser vos données.
Avant de commencer, préparez les données suivantes.
Données de prérequis de l'annotateur personnalisé
Type d'annotateur
Descriptif
Données
Dictionnaire
Affecte des facettes à des termes qui correspondent à des entrées de dictionnaire que vous définissez ou téléchargez.
Vous pouvez éventuellement télécharger un fichier de termes de dictionnaire.
Apprentissage automatique
Affecte des facettes aux mentions qui sont reconnues par un modèle d'apprentissage automatique que vous téléchargez.
Un fichier compressé d'un modèle d'apprentissage automatique est requis.
Expression régulière
Affecte des facettes à du texte qui correspond aux modèles d'expression régulière Java que vous définissez ou téléchargez.
Vous pouvez éventuellement télécharger un fichier JSON qui contient des modèles d'expression régulière.
Pour créer un annotateur personnalisé, suivez les étapes suivantes :
Dans la vue d'analyse de votre collection, cliquez sur le lien Collections dans l'élément de navigation pour ouvrir la page Créer une collection pour vos solutions d'analyse de l'application Content Mining.
Pour créer un annotateur, cliquez sur collection, puis sélectionnez custom annotator dans la liste.
{: caption="de la collectionMenu " caption-side="bottom"} la collection
Cliquez sur Créer un annotateur personnalisé.
Nommez votre annotateur et ajoutez éventuellement une description.
Choisissez le type d'annotateur, puis cliquez sur Suivant.
Suivez les instructions à l'écran.
Pour plus d'informations sur la configuration de chaque type d'annotateur, voir l'une des sections suivantes:
Vous pouvez importer un dictionnaire existant en le téléchargeant ou vous pouvez créer un dictionnaire en ajoutant des termes un par un.
Si vous prévoyez d'importer un dictionnaire, les termes du dictionnaire doivent être définis dans un fichier CSV. Spécifiez chaque terme et ses synonymes sur une ligne distincte. Utilisez la syntaxe suivante pour spécifier chaque terme:
{term},{synonym},{synonym},...
Pour ajouter un dictionnaire, procédez comme suit :
Effectuez l'une des opérations suivantes :
Pour importer les termes du dictionnaire:
Cliquez sur Importer, puis recherchez le fichier contenant les termes de votre dictionnaire.
Cliquez sur Import.
Pour définir les termes du dictionnaire:
Cliquez sur Ajouter.
Cliquez sur Liste de mots pour ajouter les termes du dictionnaire.
Cliquez sur Ajouter, puis ajoutez le terme dans la zone Mot de base et les synonymes que vous souhaitez définir pour le terme dans la zone Autres mots. Séparez les synonymes multiples
par des virgules. Cliquez sur OK.
Répétez l'étape précédente pour ajouter d'autres termes de dictionnaire.
Une fois que vous avez terminé d'ajouter des termes de dictionnaire, cliquez sur Paramètres de base.
Nommez le dictionnaire.
Si vous prévoyez de définir des termes avec une partie du discours autre qu'un nom, spécifiez la partie du discours.
Si la langue sélectionnée est le chinois, le japonais, le coréen ou l'hébreu, vous ne pouvez spécifier que Nom pour la partie du discours.
Décidez de la façon dont vous voulez traiter le cas.
Lorsque la casse est ignorée, les termes Sat, SAT et sat sont tous libellés en tant qu'occurrences du terme du dictionnaire Sat.
Lorsque vous décochez la case Ignorer maj/min pour créer un dictionnaire sensible à la casse, la forme de surface du terme avec une correspondance en majuscules est utilisée. Des annotations sont ajoutées pour le terme exactement
tel qu'il est écrit et pour les variations du terme dans lequel les lettres sont en majuscules.
Par exemple, une entrée sat dans le dictionnaire génère des annotations pour les mentions sat, Sat ou SAT lorsqu'elles apparaissent dans du texte. Pour une entrée Sat du dictionnaire,
des annotations sont ajoutées pour les occurrences de Sat et SAT, mais pas pour sat.
Identifiez le nom de facette à utiliser pour ce dictionnaire.
Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.
Vous pouvez créer une facette hiérarchique en incluant un point (.) dans le nom de la facette. Par exemple, vous pouvez créer un dictionnaire avec le chemin de facette Food.Vegetables et d'autres avec les chemins de facette
Food.Fruits et Food.Proteins. Ajoutez d'autres groupes de facettes avec plus de points. Par exemple, vous pouvez ajouter Food.Proteins.Nuts et Food.Proteins.Meats pour catégoriser encore
plus les protéines.
un
Si vous souhaitez que les documents renvoyés pour une sous-facette soient inclus lorsqu'un utilisateur filtre sur la facette racine, sélectionnez Lift up words.
Par exemple, vous pouvez activer Lift words pour Food.Fruits et Food.Proteins mais pas Food.Vegetables. Par conséquent, lorsqu'un utilisateur clique sur la facette Food, les documents renvoyés
incluent des documents qui mentionnent des termes inclus dans les dictionnaires Fruits et Meats, tels que pommes et bœuf.
Dictionary enrichment application
Toutefois, un utilisateur doit cliquer explicitement sur la facette Aliments > Légumes pour obtenir les documents qui mentionnent des termes dans le dictionnaire Légumes, tels que la laitue, à renvoyer.
Subfacets
Répétez les étapes précédentes pour ajouter d'autres dictionnaires.
Cliquez sur Sauvegarder.
A partir de la page de l'annotateur personnalisé, vous pouvez voir les dictionnaires qui ont été créés dans d'autres projets, y compris les projets autres que Content Mining. Les dictionnaires d'autres types de projet affichent le nom d'enrichissement
comme nom d'annotateur. Les paramètres Ignorer maj/min et Lift up words sont désactivés et le dictionnaire est nommé custom dict.
Limites du dictionnaire
Limites du plan de dictionnaire
Planifier
Nombre de dictionnaires par instance de service
Nombre de mots de base par dictionnaire
Nombre de termes pour lesquels des suggestions peuvent être générées
Cloud Pak for Data
Illimité
Illimité
1 000
Premium
200
10 000
1 000
Entreprise
200
10 000
1 000
Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.
Configuration de l'apprentissage automatique
Vous pouvez importer un modèle d'apprentissage automatique existant.
Pour utiliser Discovery afin de créer un modèle, voir Entity extractor.
Pour importer un modèle, suivez les étapes suivantes :
Cliquez sur Sélectionner un fichier, puis recherchez le fichier de modèle d'apprentissage automatique.
Dans la zone Chemin de facette, indiquez le nom de facette racine à utiliser pour le modèle.
Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.
Cliquez sur Sauvegarder.
Limites du modèle d'apprentissage automatique
Limites du plan de modèle ML
Planifier
Modèles ML par instance de service
Cloud Pak for Data
Illimité
Premium
10
Entreprise
10
Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.
Configuration des expressions régulières
Vous pouvez importer des canevas existants en les téléchargeant dans un fichier JSON ou vous pouvez ajouter des canevas.
Pour ajouter des motifs, procédez comme suit :
Ajoutez le modèle d'expression régulière à la zone Nouveau modèle, puis cliquez sur Ajouter.
Indiquez un nom pour le modèle, puis identifiez le nom de facette à utiliser pour ce modèle.
Le nom de facette que vous spécifiez pour l'annotateur est le nom de facette qui s'affiche à partir de la vue de recherche de collection.
Facultatif: spécifiez une valeur de facette. Vous pouvez spécifier une valeur à partir des options décrites dans le tableau.
Options de valeur de facette d'expression régulière
Valeur de facette
Descriptif
$0
Affiche le texte correspondant tel qu'il est.
$n
Si votre modèle d'expression régulière contient des groupes, vous pouvez spécifier un numéro de groupe pour renvoyer le texte correspondant à partir du groupe de modèles uniquement. Par exemple, si votre expression régulière se compose
de 3 groupes qui définissent un modèle de numéro de téléphone américain, tel que (\d{3})-(\d{3})-(\d{4}), et que vous souhaitez renvoyer uniquement la partie d'indicatif régional du numéro de téléphone, vous pouvez spécifier
$1. Si le texte mis en correspondance est 212-555-1234, la valeur de facette est affichée sous la forme 212. Indiquez uniquement un groupe en tant que valeur de facette pour les modèles qui,
selon vous, renverront des correspondances.
{prefix-text}:$0
Ajoute du texte codé en dur devant le nom de la facette. Vous pouvez utiliser cette option si vous souhaitez distinguer les facettes générées par cette expression régulière des facettes similaires mais générées d'une autre manière.
Par exemple, MyRegex:$0 génère une facette nommée MyRegex:212-555-1234.
Cliquez sur Sauvegarder.
Pour importer des motifs, procédez comme suit :
Définissez les canevas que vous souhaitez ajouter dans un fichier JSON.
La définition de modèle doit utiliser la syntaxe suivante:
[{"name":"US Phone number","description":"US mobile phone number","pattern":"(\\d{3})-(\\d{3})-(\\d{4})","facetPath":".regex.usphonenumber","facetValue":"$0"}]
Gardez à l'esprit les remarques suivantes :
Les modèles doivent être définis dans un tableau, même si vous prévoyez de définir un seul modèle.
Mettez en échappement toute barre oblique inversée (\) avec une barre oblique inversée.
Pour plus d'informations sur les options de valeur de facette, voir le tableau Options de valeur de facette d'expression régulière.
Cliquez sur Importer, puis choisissez le fichier JSON dans lequel les canevas sont définis.
Cliquez sur Sauvegarder.
Limites d'expression régulière
Limites du plan d'expression régulière
Planifier
Enrichissements d'expression régulière par instance de service
Modèles d'expression régulière par instance de service
Cloud Pak for Data
Illimité
Illimité
Premium
100
50
Entreprise
100
50
Les totaux incluent les enrichissements que vous créez dans ce projet Content Mining et dans d'autres projets de la même instance de service.
Application de l'annotateur
Une fois l'annotateur créé, vous devez l'appliquer à votre collection.
Dans la page Créer un annotateur personnalisé pour vos solutions d'analyse de l'application Content Mining, cliquez sur annotateur personnalisé, puis sélectionnez collection dans la liste.
Dans la vignette de votre collection, cliquez sur l'icône options et choisissez Editer la collection.
Cliquez sur l'onglet Enrichissement, puis sélectionnez l'annotateur que vous avez créé.
Il se peut que vous deviez faire défiler la page pour la trouver.
Cliquez sur Enregistrer, puis confirmez l'action.
Donnez le temps à l'index de se régénérer.
Filtrage de documents avec votre facette
Cliquez sur la vignette de la collection pour ouvrir votre collection dans la page d'analyse des données.
Effectuez l'une des opérations suivantes :
Vos facettes personnalisées sont répertoriées dans la vue Facettes. Faites défiler et cliquez sur Charger plus à plusieurs reprises jusqu'à ce que vos facettes soient affichées.
Soumettez une recherche vide pour renvoyer tous les documents. Dans la sous-fenêtre Analyse de facette, sélectionnez la facette que vous avez créée.
Pour accéder plus rapidement à vos facettes personnalisées, ajoutez-les à une vue personnalisée. Sélectionnez Personnalisé comme vue, puis cliquez sur Editer. Sélectionnez une ou plusieurs facettes à
ajouter à la vue, puis cliquez sur Sauvegarder.