Classification des phrases

IBM Cloud

La classification de phrase est une fonction bêta disponible uniquement dans les déploiements gérés. En outre, la fonction est disponible uniquement pour les documents en anglais.

Utilisez la classification de phrases pour classer les phrases dans vos documents qui présentent un intérêt commercial important.

La classification des phrases utilise un modèle d'apprentissage automatique qui classifie les phrases en fonction des classes de phrases définies par l'utilisateur. Vous pouvez étiqueter des exemples de phrases dans vos documents pour définir les classes de phrase. Pour accélérer le processus d'étiquetage, le système prépare automatiquement un modèle de suggestion en arrière-plan et vous fournit d'autres suggestions d'étiquetage de phrase.

Avant de commencer

Recherchez ou créez une collection avec des documents comportant divers exemples de phrases que vous souhaitez que Discovery découvre. Pour enseigner le discriminant de phrase, vous devez étiqueter des exemples de classes de phrase. Vous ne pouvez étiqueter des exemples que si votre collection contient des exemples valides. Essayez de trouver des documents dont les phrases sont nombreuses et variées et qui fonctionnent comme des exemples de chaque classe de phrase que vous souhaitez définir.

Ajout d'un discriminant de phrase

Pour ajouter un classificateur de phrases, procédez comme suit :

  1. Ouvrez le projet dans lequel vous souhaitez créer le classificateur de phrases.

    Le projet doit comporter au moins une collection avec des documents représentatifs des données que vous souhaitez classer.

  2. Dans le panneau Improvement tools de la page Improve and customize, développez Teach domain concepts, puis cliquez sur Sentence classifiers.

  3. Cliquez sur Nouveau.

  4. Ajoutez un nom de discriminant de phrase et éventuellement une description.

    Ce nom est utilisé comme nom de modèle et comme nom de l'enrichissement créé lorsque vous publiez le modèle. Le nom s'affiche en tant que nom d'enrichissement dans la page Enrichments où vous et d'autres personnes pouvez l'appliquer aux collections. Il est également affiché en tant que nom de modèle dans la représentation JSON des documents dans lesquels des classes de phrase sont trouvées. Le nom est stocké avec la casse et l'espacement que vous spécifiez.

  5. Choisissez une collection avec des documents représentatifs des données que vous souhaitez classer.

  6. Choisissez les champs du document à afficher dans la vue de document où vous allez étiqueter les documents de la collection.

    • Titre du document s'affiche dans l'en-tête de page en tant que nom de document. Choisissez une zone comportant une valeur unique par document, telle que le nom de fichier, qui est stocké dans la zone extracted_metadata.filename.
    • Corps du document est l'endroit où vous étiquetez les exemples de phrase dans le contenu. Choisissez une zone qui contient la majeure partie du contenu du document, telle que la zone text.
  7. Cliquez sur Créer.

Un document de la collection que vous avez sélectionnée s'affiche dans la vue Documents de libellé. Vous allez étiqueter les occurrences des classes de phrase que vous souhaitez que Discovery reconnaisse à partir de ce document et d'autres documents de la collection.

Si aucun texte n'est affiché dans le corps de la page, commencez par créer un nouveau discriminant de phrase. Cette fois, lorsque vous sélectionnez une valeur pour la zone Corps du document, veillez à choisir une zone dans vos documents traités qui contient du texte.

Définition des classes de phrases

Définissez les classes de phrase en procédant comme suit:

  1. Cliquez sur Ajouter une classe de phrase.

  2. Ajoutez le nom de la classe de phrase et une description facultative.

  3. Facultatif: Choisissez la couleur à utiliser pour la classe de phrase dans le document.

    Vous pouvez cliquer sur une couleur dans la palette Couleur du libellé, puis sur l'icône Renouveler la couleur pour passer d'une couleur à l'autre. Pour utiliser une couleur personnalisée, indiquez son code de couleur hexadécimal (#fff0f7).

  4. Cliquez sur Créer.

  5. Répétez ce processus pour ajouter toutes les classes de phrase que vous souhaitez que le discriminant classifie.

    Si vous n'êtes pas sûr des éléments à ajouter pour les classes de phrase, il peut être utile de passer en revue d'abord les documents de la collection. En examinant le contenu, vous pouvez vous faire une idée des phrases qui ont une signification significative et rechercher des façons logiques de classer ces phrases.

Etiquetage de phrases

Dans la vue Etiqueter des documents, recherchez des phrases dans les documents de votre collection et étiquetez-les pour indiquer leurs classes de phrases. Pendant que vous étiquetez, le discriminant de phrase entraîne automatiquement un modèle en arrière-plan pour présenter des suggestions d'étiquetage.

Les suggestions d'étiquetage accélèrent le processus d'étiquetage de vos documents. Au lieu de parcourir des documents et de passer du temps à lire du texte, les suggestions d'étiquetage vous permettent de trouver facilement des exemples pertinents et de les examiner en contexte.

Vous pouvez étiqueter les phrases de la manière suivante :

Contrairement à l'extracteur d'entité, il n'existe aucun concept de statut de document tel que Non démarré, En courset Terminé pour le discriminant de phrase. Dans le cas d'un extracteur d'entité, vous marquez les documents comme Terminé pour indiquer qu'ils sont utilisés pour la formation. Dans le cas d'un discriminant de phrase, seules les phrases libellées sont utilisées pour l'apprentissage et les données non libellées de chaque document sont ignorées.

Données utilisées pour l'entraînement
Fonction Qu'est-ce qui est utilisé pour l'entraînement
Extracteur d'entité Tous les documents marqués comme étant terminés
Discriminant de phrase Toutes les phrases étiquetées (les phrases non étiquetées ne sont pas utilisées)

étiquetage manuel

Pour étiqueter manuellement, procédez comme suit :

  1. Lisez les documents affichés dans la page Etiqueter les documents pour localiser les exemples de phrases appropriés à étiqueter.

  2. Sélectionnez un exemple de phrase et cliquez sur l'icône Editer les libellés.

  3. Sélectionnez une classe de phrase dans la liste pour étiqueter l'exemple de phrase en tant que libellé positif.

    Pour étiqueter l'exemple de phrase comme un libellé négatif, appuyez sur la touche Maj lorsque vous sélectionnez la classe de phrase dans la liste.

    Si vous ne trouvez pas les exemples de phrases appropriés, sélectionnez un autre document dans la Liste de documents.

    Affiche un extrait d'un document avec des exemples de libellés positifs et négatifs.
    Labeled sentence examples

  4. Répétez les étapes pour étiqueter les exemples de phrases comme positives ou négatives dans d'autres documents de la collection.

Lors de l'étiquetage, cliquez sur Sauvegarder le discriminant de phrase pour sauvegarder votre travail. Si vous passez à une autre page à partir de la page Documents de libellé, le système sauvegarde automatiquement votre travail.

Utilisez les touches de raccourci pour les opérations d'étiquetage rapide. Appuyez sur les touches 1 à 5 correspondant à une classe de phrase affichée dans la liste pour étiqueter l'exemple de phrase en tant que libellé positif. De même, appuyez sur les touches 6 à 0 pour ajouter un libellé négatif. Vous pouvez appuyer sur la touche Suppr ou sur la touche Retour arrière pour supprimer les libellés de la phrase sélectionnée.

Libellé de recherche dans un document

A l'aide de la fonction de recherche, vous pouvez trouver des exemples de phrases dans un document et les étiqueter facilement. Vous pouvez également utiliser la recherche pour trouver des exemples libellés et des exemples non libellés et corriger les incohérences de libellé.

Pour trouver des exemples et les étiqueter dans un document, procédez comme suit:

  1. Dans la vue Documents de libellé, cliquez sur l'icône Rechercher.

  2. Dans la zone Rechercher, indiquez le texte à rechercher dans le document.

    Les résultats de la recherche du document s'affichent lorsque vous entrez le texte.

    Pour parcourir les résultats de la recherche, vous pouvez cliquer sur les icônes Résultat suivant et Résultat précédent. Pour choisir un libellé pour un exemple sans libellé dans le résultat, cliquez sur l'icône Editer les libellés et sélectionnez une classe de phrase dans la liste. Vous pouvez également supprimer des libellés d'un exemple déjà libellé dans le résultat en cliquant sur l'icône Editer le libellé et en sélectionnant Supprimer des libellés.

    Affiche les résultats de la recherche.
    Résultats de la recherche

  3. Pour filtrer les résultats de la recherche, cliquez sur l'icône Afficher les options de filtrage.

    Le tableau suivant décrit les options de filtrage.

    Options de filtre dans la recherche
    Option Descriptif
    Tous Rechercher tous les exemples dans un document qui correspondent au texte.
    Texte libellé Permet de rechercher des exemples libellés existants dans un document correspondant au texte.
    Texte sans libellé Rechercher des exemples sans libellé dans un document qui correspondent au texte.
    Respecter la casse Pour trouver des exemples qui correspondent à la fois au texte et à sa casse.
    Mots entiers Permet de trouver des exemples qui correspondent aux limites des mots du texte. Par exemple, si vous spécifiez installation dans le texte, désinstallation ne correspond pas lorsque cette option est sélectionnée.
    1. Répétez les étapes pour étiqueter des exemples de phrases dans d'autres documents de la collection.

Etiquetage intelligent

La fonction d'étiquetage intelligent utilise des techniques d'apprentissage actives pour suggérer des exemples de phrases que vous pouvez étiqueter. L'étiquetage intelligent accélère le processus d'étiquetage, mais vous devez d'abord étiqueter au moins 20 exemples pour chaque classe de phrase afin que le système puisse créer un modèle de suggestion.

Pour utiliser l'étiquetage intelligent, suivez les étapes suivantes :

  1. Étiquetez un minimum de 20 exemples positifs pour au moins une classe de phrase.

    Le système commence automatiquement à préparer un modèle de suggestion en arrière-plan.

    Une fois qu'une version du modèle de suggestion est prête, le système fournit des suggestions sur les phrases à étiqueter ensuite. L'étiquetage des suggestions permet d'améliorer le plus possible le modèle de discriminant de phrase.

  2. Cliquez sur Utiliser l'étiquetage intelligent.

    Étiquetage " caption-side="bottom"}{: caption="

    Le panneau Etiquetage intelligent s'affiche. Dans cette sous-fenêtre, vous pouvez étiqueter des phrases pour une classe de phrase spécifique.

  3. Sélectionnez un exemple parmi les exemplessuggérés et cliquez sur Oui pour étiqueter l'exemple de phrase comme un libellé positif. Vous pouvez cliquer sur Non pour attribuer un libellé négatif à l'exemple de phrase.

    Étiquetage " caption-side="bottom"} d'étiquetage{: caption="

  4. Répétez l'étape précédente pour étiqueter d'autres exemples suggérés.

    Pour actualiser les exemples suggérés dans la liste, cliquez sur Actualiser les suggestions. La liste est actualisée avec de nouvelles suggestions et les exemples libellés existants ne sont pas affichés dans la liste.

  5. Cliquez sur Terminé après avoir libellé les phrases.

    Si vous ne disposez pas de suffisamment d'exemples de phrases dans l'ensemble de documents en cours, vous pouvez ajouter d'autres documents. Cette option est disponible uniquement lorsqu'il existe d'autres documents dans la collection. Pour plus d'informations, voir Ajout de documents aux données d'apprentissage.

  6. Après avoir étiqueté des exemples dans autant de documents de la collection que vous le souhaitez, cliquez sur Enregistrer le discriminant de phrase, puis entraînez le discriminant. Pour plus d'informations, voir Entraînement du discriminant.

Conseils pour l'étiquetage intelligent

Prenez en compte les conseils suivants pour l'étiquetage intelligent:

  • Utilisez les touches de raccourci pour les opérations d'étiquetage rapide. Vous pouvez appuyer sur la touche de déplacement vers la gauche pour choisir Oui ou sur la touche de déplacement vers la droite pour choisir Non. Choisir Oui ou Non revient à spécifier un libellé positif ou négatif pour la classe de phrase.

  • Pour étiqueter un exemple de phrase comme libellé positif, appuyez sur les touches 1 à 5, correspondant à une classe de phrase affichée dans la liste. De même, appuyez sur les touches 6 à 0 pour ajouter un libellé négatif. Vous pouvez appuyer sur la touche Suppr ou sur la touche Retour arrière pour supprimer les libellés de la phrase sélectionnée.

  • Si un exemple n'est pas pertinent pour la classe de phrase en cours, étiquetez l'exemple comme négatif au lieu de le laisser sans libellé. Les données sans libellé sont ignorées et ne sont pas utilisées pour l'apprentissage. Il est donc important de spécifier des libellés négatifs pour améliorer le modèle de classification.

  • Si vous étiquetez 20 exemples ou plus (libellés positifs ou négatifs) après l'entraînement du dernier modèle de suggestion, le système commence automatiquement à créer un nouveau modèle de suggestion en arrière-plan. Vous êtes averti lorsque les nouvelles suggestions sont prêtes à être étiquetées.

Ajout de documents aux données d'entraînement

Pour ajouter d'autres documents, procédez comme suit :

  1. Accédez à la vue Documents de libellé.
  2. Dans le panneau Liste de documents, cliquez sur Ajouter des documents.

Cette option n'est pas disponible lorsqu'il n'y a pas d'autres documents dans la collection à ajouter à l'espace de travail du discriminant de phrases. Pour ajouter d'autres documents à la collection, accédez à la page Activité de la collection, puis cliquez sur la vignette Télécharger les données pour parcourir et ajouter d'autres documents.

Même si vous ajoutez d'autres documents à partir d'une collection, tous les documents peuvent ou non être utilisés pour entraîner le modèle. Contrairement à l'extracteur d'entité où tous les documents terminés sont utilisés pour l'entraînement, le discriminant de phrase utilise uniquement des phrases étiquetées pour l'entraînement et les données non étiquetées sont ignorées.

Vous ne pouvez pas choisir les documents de la collection à afficher dans le panneau Liste de documents pour l'étiquetage. S'il existe des types spécifiques de documents que vous souhaitez étiqueter, envisagez de créer une nouvelle collection contenant uniquement ces documents.

Entraînement du discriminant

Après avoir étiqueté les documents, vous pouvez passer en revue les données d'apprentissage dans la vue Entraîner le discriminant. Les données d'apprentissage sont utilisées pour entraîner le modèle de discriminant de phrase.

Pour entraîner le classificateur, suivez les étapes suivantes :

  1. Accédez à la vue Entraîner le discriminant.

  2. Passez en revue le récapitulatif de l'étiquetage pour vérifier si vous avez suffisamment étiqueté pour entraîner le discriminant.

    Pour entraîner le discriminant, chaque classe de phrase doit comporter au moins 20 libellés positifs et deux libellés négatifs. Sinon, le bouton Entraîner le discriminant est désactivé et vous ne pouvez pas démarrer l'entraînement. Les classes de phrases qui n'ont pas de libellés positifs ou négatifs sont ignorées.

  3. Vérifiez si vous souhaitez appliquer des options avancées pour la formation. La plupart des modèles ne nécessitent pas de modifications des options avancées.

    Vos phrases sont divisées au hasard en ensembles. L'ensemble d'apprentissage est utilisé pour entraîner le discriminant. L'ensemble de test est utilisé pour tester le modèle après son apprentissage. L'ensemble aveugle a réservé des phrases que vous ne voyez pas pendant l'entraînement. Ils sont utilisés pour générer périodiquement une évaluation non biaisée du modèle. La division par défaut utilise le rapport standard pour l'entraînement. Pour plus d'informations, voir Jeux de documents pour l'entraînement.

  4. Cliquez sur Entraîner le discriminant.

    Lorsque vous entraînez le discriminant, Discovery utilise des phrases de l'ensemble d'apprentissage pour générer un modèle d'apprentissage automatique. Les résultats du test sont affichés pour que vous puissiez les consulter dans la vue Evaluer le discriminant.

Jeux de documents pour l'entraînement

Vous pouvez modifier le rapport des phrases incluses dans les jeux de documents qui comprennent vos données d'apprentissage.

Les phrases que vous avez étiquetées sont divisées de manière aléatoire en les ensembles suivants:

  • Ensemble d'apprentissage: les phrases que vous étiquetez et qui sont utilisées pour entraîner le modèle d'apprentissage automatique du discriminant de phrases. L'objectif de l'ensemble d'entraînement est d'enseigner au modèle les libellés corrects.

  • Ensemble de tests: phrases utilisées pour tester le modèle entraîné. Une fois le modèle généré, il exécute automatiquement un test sur les documents de l'ensemble de tests. Vous pouvez analyser les résultats pour déterminer les zones où le modèle a eu un problème et trouver des moyens d'améliorer les performances du modèle.

  • Set aveugle: Sentences qui sont mises de côté et utilisées pour tester le modèle périodiquement après plusieurs itérations de tests et d'améliorations. Les phrases de l'ensemble des aveugles sont intentionnellement rarétées. Lorsque vous testez le modèle avec des phrases de l'ensemble de tests et que vous analysez les résultats, vous vous familiarisez avec les phrases de test sous-jacentes. Les phrases de test étant utilisées de manière itérative pour améliorer le modèle, elles peuvent commencer à influencer indirectement l'apprentissage du modèle. C'est pourquoi vous voudrez peut-être avoir l'ensemble aveugle des phrases. L'ensemble aveugle vous permet de générer périodiquement une évaluation non biaisée du modèle.

Le rapport de division par défaut est de 70% pour l'ensemble d'apprentissage, de 30% pour l'ensemble de tests et de 0% pour l'ensemble en aveugle. Vous pouvez avoir un ensemble aveugle de phrases en augmentant le rapport de l'ensemble aveugle. Dans ce cas, les nombres de la table de scores du discriminant de la vue Evaluer le discriminant, tels que Faux positif, Faux négatif, et d'autres, ne correspondent pas au nombre de phrases affichées dans la vue Vérifier les résultats de l'entraînement. En effet, les phrases de l'ensemble aveugle sont prises en compte pour l'évaluation, mais elles n'apparaissent pas dans la vue Review training results.

Evaluation du discriminant

Pour passer en revue les métriques de l'exécution en test du modèle de discriminant de phrase que vous avez créé, cliquez sur l'onglet Evaluer le discriminant.

Le tableau suivant décrit les mesures d'évaluation disponibles.

Détails des métriques
Métrique Descriptif
Matrice de confusion Un tableau qui fournit une ventilation numérique détaillée des phrases étiquetées. Utilisez-le pour comparer ce qui est libellé par le modèle d'apprentissage automatique à ce qui est libellé dans les données d'apprentissage.
Score F1 Mesure si l'équilibre optimal entre la précision et le rappel est atteint. Le score F1 peut être interprété comme une moyenne pondérée des valeurs de précision et de rappel. Un score F1 atteint sa meilleure valeur à 1 et sa pire valeur à 0. Les scores globaux sont inférieurs si le modèle ne dispose pas de suffisamment de données d'apprentissage pour en tirer des enseignements.
Précision Mesure combien de phrases globales sont classées comme la classe de phrase correcte. Un faux positif est un cas où une phrase ne doit pas être classifiée, mais a été classifiée (Prévu = Positif, Réel = Négatif). Les faux positifs signifient généralement une faible précision.
Rappel Mesure la fréquence à laquelle les phrases qui doivent être classifiées sont classifiées. Un faux négatif se produit lorsqu'une phrase doit être classifiée, mais qu'elle n'a pas été classifiée (Prévu = Négatif, Réel = Positif). Les faux négatifs signifient généralement un faible rappel.
  1. Passez en revue les métriques fournies sur l'exécution du test du modèle de discriminant pour déterminer si un entraînement supplémentaire est nécessaire.

  2. Explorez les résultats de test plus en détail en cliquant sur Vérifier les résultats de l'entraînement dans l'ensemble de tests.

    Examiner les résultats de la formation dans l'ensemble de
    les résultats de la formation dans l'ensemble
    test*

    Les phrases de l'ensemble de tests sont affichées avec les libellés réels et prévus affichés dans la liste du panneau de gauche. Si vous cliquez sur une phrase de la liste, elle s'affiche dans la vue de document du panneau de droite.

    • Les libellés réels sont les exemples qu'une personne a libellés manuellement. Ils sont considérés comme les libellés corrects.
    • Les libellés prédits sont les exemples que le discriminant de phrase a identifiés et libellés en tant que classes de phrase.

    Les performances du modèle sont évaluées en fonction du degré de correspondance entre les libellés prévus et les libellés réels.

  3. Pour filtrer la liste, cliquez sur l'icône Filtrer, choisissez Classe de phrase et Prédiction, puis cliquez sur Appliquer.

Examen des résultats de l'entraînement à partir de la répartition des performances

Pour passer en revue les résultats de l'entraînement à partir de la répartition des performances, procédez comme suit:

  1. Cliquez sur un nombre dans le tableau Répartition des performances par classe de phrase.

    La boîte de dialogue Review training results s'affiche.

  2. Passez en revue les phrases appropriées, qui sont basées sur le nombre sur lequel vous avez cliqué.

Amélioration du discriminant

Le tableau suivant présente les correctifs suggérés pour les problèmes courants.

Actions d'amélioration
Problème Action pour résoudre le problème
Faibles scores globaux Il se peut que vous n'ayez pas assez de phrases étiquetées dans votre ensemble d'entraînement. Libellez plus de phrases dans plus de vos documents.
Faible rappel Etiquetez d'autres documents avec de nouveaux exemples de classes de phrases que le discriminant n'a pas classifié. Passez en revue les phrases faussement négatives pour vérifier s'il existe des termes uniques parmi elles. Si vous voyez de tels termes uniques, recherchez les phrases qui incluent de tels termes et ajoutez-leur des libellés positifs.
Faible précision Passez en revue les phrases faussement positives avec soin. Vous avez peut-être manqué d'étiqueter des phrases. En particulier, vérifiez les phrases avec un libellé négatif. Lorsqu'une phrase a un libellé négatif pour une classe de phrase particulière (par exemple, la classe A), vérifiez si un libellé positif est nécessaire pour une autre classe de phrase (par exemple, la classe B). Si la phrase appartient en fait à la classe B, mais que vous n'avez pas spécifié de libellé positif pour la classe B, elle peut dégrader le score de précision. En outre, si vous trouvez des termes qui apparaissent généralement dans les phrases de faux positifs, spécifiez des libellés négatifs dans les phrases contenant de tels termes.

Publication du discriminant de phrase en tant qu'enrichissement

Lorsque vous pensez que le discriminant de phrase est prêt, publiez le modèle de discriminant de phrase. Vous pouvez considérer que le modèle est prêt lorsque le score ne change pas après plusieurs exécutions de test dans lesquelles vous apportez des améliorations. Vous pouvez revenir pour mettre à jour et entraîner à nouveau le modèle après l'avoir publié.

Pour publier un classificateur de phrases, suivez les étapes suivantes :

  1. Accédez à la vue Evaluer le discriminant et cliquez sur Publier le discriminant.
  2. Cliquez sur Publier.
  3. Cliquez sur Appliquer aux données.
  4. Choisissez une collection, puis sélectionnez la zone de texte dans laquelle vous souhaitez que l'enrichissement de discriminant de phrase soit appliqué.
  5. Cliquez sur Appliquer.

Téléchargement du modèle de discriminant de phrases

Un modèle de discriminant de phrase que vous créez et déployez dans un projet est disponible en tant qu'enrichissement qui peut être appliqué à une collection à partir de n'importe quel projet dans la même instance de service.

Si vous souhaitez utiliser le modèle de discriminant de phrase dans un projet à partir d'une autre instance de service, vous pouvez exporter ou télécharger le modèle de discriminant de phrase. Pour l'utiliser ailleurs, suivez les étapes de création d'un modèle d'apprentissage automatique dans Utilisation de modèles d'apprentissage automatique importés pour rechercher des termes personnalisés. Vous ne pouvez pas continuer à éditer un discriminant de phrase que vous importez dans un autre projet.

Le discriminant de phrase que vous souhaitez exporter doit être entièrement entraîné.

Pour exporter un classificateur de phrases, procédez comme suit :

  1. Ouvrez le projet avec le discriminant de phrase que vous souhaitez exporter.

  2. Dans le panneau Improvement tools de la page Improve and customize, développez Teach domain concepts, puis cliquez sur Sentence classifiers.

  3. Dans la liste Classificateurs de phrase, recherchez le discriminant de phrase que vous souhaitez exporter.

  4. Cliquez sur l'icône Actions de votre discriminant, puis sélectionnez Télécharger le modèle pour enregistrer le modèle sur votre système.

    L'option Télécharger le modèle n'est pas disponible à moins que le modèle ne soit entraîné.

Le modèle de discriminant de phrases est sauvegardé sous la forme d'un fichier .sc. Vous pouvez l'importer dans un projet dans une autre instance de service en tant que modèle d'apprentissage automatique, puis l'appliquer à vos collections.

Téléchargement de données libellées pour un discriminant de phrase

Vous pouvez télécharger ou exporter les données libellées d'un discriminant de phrase à partir de Discovery. Vous pouvez utiliser les données libellées exportées pour l'entraînement ou la génération de modèles de langage de grande taille (LLMs) sur un service tel que Watson Studio et Natural Language Processing (NLP).

Pour exporter les données étiquetées, procédez comme suit :

  1. Dans le panneau Improvement tools de la page Improve and customize, développez Teach domain concepts, puis cliquez sur Sentence classifiers.

  2. Pour le discriminant de phrase à partir duquel vous souhaitez exporter des données libellées, cliquez sur l'icône Actions, puis sélectionnez Télécharger les données libellées.

    Un fichier compressé est téléchargé avec des données libellées. Le fichier compressé contient les fichiers JSON suivants.

    • labeled_data.json: inclut le texte et les libellés. Le format de données est basé sur le format de données d'entrée pour la classification de texte dans Watson Natural Language Processing. Pour plus d'informations, voir Format des données d'entrée.
    • metadata.json: inclut des métadonnées pour l'espace de travail et des données libellées.

Conversion de labeled_data.json en CSV

Entrez la commande suivante pour convertir labeled_data.json en CSV:

$ cat labeled_data.json | jq -r '.[] | [.text, .labels[]] | @csv'

Les données libellées sont converties au format suivant:

    "sentence1", class-label1, class-label2
    "sentence2", class-label3
    "sentence3", ...
    ...

Application d'un enrichissement de discriminant de phrase

Lorsque vous publiez le discriminant de phrase, vous spécifiez la zone dans laquelle vous souhaitez que le discriminant de phrase soit appliqué.

Pour appliquer ultérieurement l'enrichissement à un ou plusieurs champs, procédez comme suit :

  1. Dans le panneau de navigation, cliquez sur Manage collections.

  2. Cliquez pour ouvrir la collection dans laquelle vous souhaitez appliquer l'enrichissement.

  3. Cliquez sur Enrichments.

  4. Recherchez le nom du discriminant de phrase dans la liste, puis choisissez une zone à laquelle appliquer l'enrichissement.

    Vous pouvez choisir une zone qui contient du texte ou du code HTML.

  5. Cliquez sur Apply changes and reprocess.

Pour plus d'informations sur l'application d'un enrichissement de discriminant de phrase à une collection, voir Gestion des enrichissements

Sortie du discriminant de phrases

Lorsque l'enrichissement classifie l'une de vos phrases dans un document, une entrée est ajoutée à la section enriched_text.element_classes de la représentation JSON du document. La section contient des phrases classées par votre modèle de discriminant ainsi que leurs classes de phrases.

Un discriminant de phrase ne classifie pas les phrases dont les scores de confiance sont inférieurs à 0.5.

La sortie JSON suivante est un exemple de résultat de classification de phrase.

Montre la sortie JSON à titre d'exemple* " caption-side="bottom"}{: caption="

Surveillance des performances dans le temps

Vous pouvez réentraîner votre modèle de discriminant de phrase à tout moment. Chaque fois que vous entraînez le modèle, passez en revue les scores des attributs de performance pour déterminer si vos modifications les plus récentes augmentent ou diminuent les scores du modèle.

Pour comparer une exécution de test à une autre, cliquez sur Afficher l'historique des scores dans la vue Evaluer le discriminant. La vue d'historique affiche les 5 dernières exécutions d'entraînement.

To retain the score information for more than the most recent 5 training runs, you can export the metrics in comma-separated value format, and track the scores in a separate application. Click the tabular representation icon ![Tabular representation icon](images/table-of-contents.svg), and then click **Download as CSV**.
{: tip}

Si une exécution d'entraînement ultérieure aboutit à des scores inférieurs, ne publiez pas cette version du modèle.

Suppression d'un discriminant de phrase

Vous pouvez supprimer un discriminant de phrase s'il n'est pas utilisé, par exemple lorsque l'enrichissement qui est publié à partir du discriminant de phrase n'est pas appliqué à une collection.

Vous pouvez supprimer un discriminant de phrase si vous atteignez la limite du nombre maximal de discriminants de phrase autorisés pour votre plan, par exemple.

Il existe deux limites différentes: le nombre maximal d'espaces de travail de discriminant de phrase et le nombre maximal d'enrichissements de discriminant de phrase. Vous créez un espace de travail de discriminant de phrase lorsque vous accédez au panneau Outils d'amélioration, développez Teach domain concepts, cliquez sur Sentence classifiers, puis sur le bouton New. Vous créez un enrichissement de discriminant de phrase lorsque vous publiez votre discriminant de phrase entraîné ou que vous téléchargez un modèle de discriminant de phrase. Pour plus d'informations sur les limites, voir Limites du discriminant de phrase.

N'oubliez pas que les limites sont définies par instance de service et non par projet. Si vous ne disposez pas du nombre maximal de discriminants de phrase dans le projet en cours, mais que vous ne pouvez pas créer de nouveaux espaces de travail de discriminant de phrase ou publier votre discriminant de phrase entraîné, vérifiez les autres projets dans la même instance de service. Il peut exister des espaces de travail de discriminant de phrase ou des enrichissements qui ne sont pas utilisés dans d'autres projets qui peuvent être supprimés.

Suppression des enrichissements de discriminant de phrase

Supprimez l'enrichissement de discriminant de phrase, qui a été publié à partir du discriminant de phrase que vous souhaitez supprimer, des collections dans lesquelles il est utilisé. Pour plus d'informations, voir Suppression d'enrichissements.

La suppression d'un enrichissement de discriminant de phrase ne supprime pas son espace de travail.

Suppression des espaces de travail de classifieur

Pour supprimer un espace de travail de classificateur de phrases, procédez comme suit :

  1. Dans le panneau Improvement tools de la page Improve and customize, développez Teach domain concepts, puis cliquez sur Sentence classifiers.

  2. Recherchez l'espace de travail du discriminant de phrases à supprimer, cliquez sur l'icône Actions, puis sélectionnez Supprimer.

La suppression d'un espace de travail de discriminant de phrase ne supprime pas l'enrichissement publié dans l'espace de travail.

Utilisation des API pour le discriminant de phrase

L'API de discriminant de phrases est une fonctionnalité bêta.

Vous pouvez utiliser les API pour appliquer un enrichissement de discriminant de phrase à vos documents. A l'aide des API, vous pouvez créer un enrichissement de discriminant de phrase et également gérer l'enrichissement, par exemple en le mettant à jour et en le supprimant.

Pour utiliser les API de classification des phrases, procédez comme suit :

  1. Créez un enrichissement de discriminant de phrase à l'aide de la méthode create an enrichment dans l'API.

    Pour plus d'informations sur la création de l'enrichissement, voir Création d'un enrichissement dans la référence d'API.

    Vous devez spécifier les données libellées pour entraîner le modèle de discriminant de phrase lorsque vous créez l'enrichissement de discriminant de phrase. Les données libellées doivent être au format CSV suivant:

    "sentence1", class-label1, class-label2
    "sentence2", class-label3
    "sentence3", ...
    ...
    

    Chaque ligne est une phrase suivie d'une liste séparée par des virgules de zéro ou plusieurs libellés de classe de phrase associés à la phrase.

    Comme pratique recommandée, chaque libellé de classe de phrase dans le fichier CSV doit être représenté par au moins 100 phrases pour obtenir une classification de phrase de qualité raisonnable. Les phrases associées à un libellé de classe de phrase sont considérées comme des exemples positifs de cette classe de phrase. Les phrases qui ne sont pas associées à un libellé de classe de phrase sont considérées comme des exemples négatifs de cette classe de phrase.

    Une fois que l'enrichissement de discriminant de phrase a été créé, accédez à la page Manage collections, choisissez la collection, puis ouvrez l'onglet Enrichments. Vous pouvez trouver l'enrichissement de discriminant de phrase dans la liste des enrichissements disponibles.

    Une fois que l'enrichissement de discriminant de phrase Status est prêt, vous pouvez appliquer l'enrichissement de discriminant de phrase aux documents de votre collection.

  2. Appliquez l'enrichissement de discriminant de phrase que vous avez créé aux zones (texte ou html) de vos documents pour classer les phrases. Pour plus d'informations sur l'application d'un enrichissement et la gestion de l'enrichissement à l'aide d'API, voir Utilisation de l'API pour gérer les enrichissements.

Limites du discriminant de phrases

Le nombre de discriminants de phrase que vous pouvez créer par instance de service dépend de votre type de plan Discovery.

Limites du discriminant de phrases
Planifier Espaces de travail de discriminant de phrases par instance de service Enrichissements de discriminant de phrase par instance de service Nombre maximal de classes de phrase par discriminant Nombre maximal de documents dans les données d'apprentissage
Premium 10 20 5 1 000
Entreprise 10 20 5 1 000
Plus (y compris la version d'essai) 3 5 3 200