Classification de documents

Un modèle d'apprentissage automatique de discriminant de document analyse les documents et les étiquette avec le libellé approprié à partir d'un ensemble de libellés que vous définissez.

La classification des documents est utile lorsque vous souhaitez trier un grand nombre de documents en groupes à l'aide d'un programme. Par exemple, vous pouvez disposer d'une collection contenant des commentaires client sur les produits que vous vendez. Si vous pouvez trier automatiquement les commentaires en retour en classes, vous pouvez isoler les problèmes urgents mentionnés par les clients et les traiter en premier. En fonction des commentaires précédents, vous pouvez définir des classes telles que les libellés suivants:

  • Ne fonctionne pas correctement
  • Fonctions non annoncées
  • Difficile à utiliser
  • Parties manquantes
  • Les pièces expédiées ne correspondent pas à la liste des pièces dans les instructions d'assemblage

Pour créer un discriminant de document, vous générez un modèle d'apprentissage automatique qui peut identifier la classe qui capture le mieux le point de retour d'informations client spécifié en langage naturel. Vous les associez à des libellés de classe qui représentent des scénarios réels qui ont un sens pour votre entreprise.

Quelle est la différence entre un discriminant de document et un discriminant de texte?
Un discriminant de document peut classer les documents en fonction des mots et des phrases extraits des zones de texte du corps avec les informations de leur partie du discours et les autres enrichissements appliqués au texte du corps pris en compte. Les informations des autres zones non-corps sont également utilisées. Un discriminant de texte peut classer des documents en fonction de mots et de phrases extraits du texte du corps du texte en prenant en compte les informations relatives à la partie du discours. Pour plus d'informations sur la création d'un discriminant de texte, voir Discriminant.

Avant de commencer

Pour entraîner le modèle de discriminant de document, vous devez fournir des exemples de documents libellés de manière appropriée. Préparez les fichiers suivants:

Données d'entraînement

Obligatoire. Fichier CSV utilisé pour entraîner le modèle d'apprentissage automatique du discriminant de document. Le fichier peut contenir des points de données clés par colonne. Les points de données peuvent varier, mais le fichier doit inclure les colonnes suivantes:

  • Texte en langage naturel que vous souhaitez classer ou étiqueter.
  • Libellé ou nom de classe qui catégorise l'idée exprimée dans le texte du document. Vous pouvez appliquer plusieurs libellés à un échantillon de texte. Séparez les différentes valeurs de libellé par un point-virgule.
Données de test

Facultatif. Fichier CSV utilisé pour tester le modèle d'apprentissage automatique du discriminant de document après son entraînement. Si vous ne spécifiez pas de fichier distinct pour le test, un sous-ensemble du contenu des données d'apprentissage est utilisé à des fins de test.

Données cible

Obligatoire. Fichier CSV avec les données que vous souhaitez classifier.

Tous les fichiers CSV (entraînement, test et cible) doivent avoir les mêmes noms de colonne. Les données des colonnes doivent avoir les mêmes types de données, tels que chaîne, nombre, etc.

Vous pouvez utiliser un fichier CSV que vous avez téléchargé lors de la création du projet Content Mining ou vous pouvez créer une nouvelle collection.

pour plus d'informations, consultez les rubriques suivantes :

Exemple de données d'apprentissage de discriminant de document

Le tableau suivant présente un exemple du type de contenu qui peut être stocké dans des fichiers CSV utilisés pour entraîner un discriminant de document.

Exemple de données pour les fichiers CSV
ID_réclamation Date : Ligne_produit Produit Segments_client Emplacement_client Age du client Commentaires en retour Libellé
0 2016/1/1 thé thé au citron Non membre Manhattan 20 La paille a été épluchée du paquet de jus. conteneur_package
1 2016/1/2 crème glacée crème glacée à la vanille Membre Silver Queens 20 J'ai pris de la crème glacée pour mes enfants, mais il y avait quelque chose comme un morceau de fil à l'intérieur de la tasse. contamination_falsification

Notez que les deux zones obligatoires sont présentes dans l'exemple. Les zones obligatoires portent les noms suivants:

  • Feedback: texte en langage naturel à étiqueter.
  • Label: libellé à appliquer aux commentaires en retour.

Ouverture de l'application Content Mining

Si vous ne l'avez pas fait, créez le projet et ajoutez-lui une collection. Si vous avez déjà créé le projet et la collection, vous pouvez ignorer cette procédure et créer le discriminant de document.

  1. Dans Discovery, créez un projet Content Mining.

  2. Choisissez de télécharger des données pour créer la collection. Indiquez un nom pour votre collection, puis cliquez sur Next.

  3. Téléchargez le fichier CSV contenant vos données d'entraînement.

    Le fichier de données d'apprentissage doit contenir au minimum les informations suivantes:

    • Colonne contenant un exemple de texte que vous souhaitez classifier. Par exemple, l'exemple de texte peut être une revue de produit.
    • Colonne contenant un libellé de classe ou de catégorie affecté à l'exemple de texte.
  4. Une fois le traitement de la collecte terminé, cliquez sur Lancer l'application pour ouvrir l'application Content Mining.

    Les détails de la facette sont affichés pour la collection.

Création d'un discriminant de document

Pour créer un classificateur de documents, suivez les étapes suivantes :

  1. Dans l'application Content Mining, cliquez sur le lien Collections dans l'élément de navigation pour ouvrir la page Créer une collection.

    Le statut de la création d'index s'affiche. Attendez que la collection soit entièrement indexée avant de poursuivre cette procédure.

  2. Pour créer un discriminant, cliquez sur collection, puis choisissez discriminant dans la liste.

    Affiche le{: caption="de la collectionMenu " caption-side="bottom"} la collection

  3. Cliquez sur Create classifier.

  4. Nommez votre discriminant.

    Lorsque vous déployez le modèle en tant qu'enrichissement ultérieurement, l'enrichissement reçoit un nom au format {classifier name} - {model name}. Par exemple, si votre discriminant est nommé Product reviews et que le modèle est nommé v0.1, le nom de l'enrichissement est Product reviews - v0.1.

    Vous pouvez éventuellement ajouter une description et identifier la langue de vos données d'apprentissage en la sélectionnant dans la zone Langue.

  5. Cliquez sur Suivant

  6. Sur la page Données de formation, sélectionnez le fichier que vous avez téléchargé précédemment dans la liste, puis cliquez sur Suivant.

    Vous pouvez également télécharger un fichier CSV qui contient vos données d'entraînement.

    La page Champs s'affiche. Il affiche des détails sur les zones qui sont générées à partir du fichier que vous avez ajouté. En règle générale, chaque colonne d'un fichier CSV est convertie en zone et reçoit un nom qui est copié à partir de l'en-tête de colonne.

  7. Désélectionnez les zones de métadonnées que vous souhaitez exclure du jeu de données à partir de laquelle votre discriminant de document doit apprendre, puis cliquez sur Suivant.

    Toutes les zones que vous incluez sont utilisées en tant que fonctions supplémentaires dans la classification. Toutes les zones sont sélectionnées par défaut. Vous devrez peut-être faire défiler horizontalement pour passer en revue toutes les zones.

  8. Sur la page Discriminant, spécifiez les zones à utiliser pour la formation et la prévision de l'apprentissage automatique.

    Zone de réponse
    Sélectionnez la zone dans votre fichier de données d'apprentissage avec le libellé de classification. Dans l'exemple précédent, la zone Label est le meilleur choix.
    Zone prédite
    Nom de la facette générée pour les valeurs de classe prévues. Par défaut, le nom de facette possède la syntaxe <Answer field value>_predicted. Par exemple, Label_predicted.
    Jeu de données de test
    Indique le jeu de données à utiliser pour tester le modèle de discriminant. Par défaut, le fichier CSV de données d'entraînement que vous avez téléchargé et configuré est divisé en trois ensembles de données utilisés respectivement pour l'entraînement, la validation et le test. Toutefois, vous pouvez éventuellement spécifier un ensemble de données distinct à utiliser pour tester le modèle.
    Entraînement du modèle fédéré
    Crée plusieurs modèles, en fonction des valeurs d'un champ spécifique du jeu de données. Par exemple, si le document comporte une zone Product, vous pouvez configurer le discriminant pour créer un modèle de discriminant distinct pour chaque valeur de nom de produit spécifiée dans la zone. Par défaut, le discriminant crée un modèle de discriminant d'apprentissage automatique.

    Il n'est pas nécessaire de spécifier la zone qui contient le texte à classer. Le système détecte automatiquement cette zone. Vous pouvez vérifier à partir de quelle zone le texte analysable est extrait et le modifier ou l'augmenter en modifiant le type d'index d'une autre zone. Pour plus d'informations, voir Identification de la zone de texte.

    Cliquez sur Suivant.

  9. Si vous souhaitez appliquer un enrichissement au texte de vos données d'apprentissage, sélectionnez au moins une zone dans la liste Zones cible dans laquelle vous souhaitez appliquer des enrichissements.

    En règle générale, vous souhaitez choisir la zone qui contient le corps du texte que vous souhaitez classifier. Dans l'exemple précédent, la zone Feedback est le meilleur choix.

    Ensuite, sélectionnez les annotateurs que vous souhaitez appliquer pour enrichir le texte dans la ou les zones cible, puis cliquez sur Suivant.

    L'annotateur de parties du discours est sélectionné par défaut.

  10. Sur la page Confirmer, passez en revue les paramètres de configuration de votre discriminant. Pour apporter des modifications, utilisez le bouton Précédent. Sinon, cliquez sur Sauvegarder.

    Une page de présentation s'affiche.

  11. Cliquez sur Nouveau modèle pour créer et entraîner votre modèle d'apprentissage automatique.

  12. Vous pouvez éventuellement modifier le nom du modèle et ajouter une description.

    Vous pouvez modifier les valeurs de rapport par défaut spécifiées pour les ensembles de données suivants:

    • Jeu de données d'entraînement: met à jour les pondérations du modèle d'entraînement.
    • Ensemble de validation: surveille l'exactitude du modèle d'entraînement lors de l'entraînement. Le résultat de la précision est utilisé pour tracer un graphique des pertes d'entraînement.
    • Jeu de données de test: calcule le score du modèle entraîné.
  13. Cliquez sur Créer.

    L'entraînement du modèle peut durer plusieurs minutes.

Déploiement du modèle de discriminant de document

Une fois le modèle entraîné, déployez-le en tant qu'enrichissement.

  1. Cliquez sur l'icône de menu déroulant dynamique dans la colonne Actions, puis cliquez sur Déployer le modèle. Indiquez le nom et d'autres détails, puis cliquez sur Déployer.

  2. Effectuez l'une des opérations suivantes :

    • Pour appliquer le discriminant de document à une collection dans votre projet Content Mining, voir Enrichissement de votre collection.

    • Pour appliquer le discriminant de document à une collection dans un autre projet, procédez comme suit:

      1. Dans Discovery, créez ou ouvrez la collection contenant les documents que vous souhaitez classifier.

        Les données de la collection dans laquelle vous appliquez l'enrichissement doivent avoir les mêmes zones que la collection que vous avez utilisée pour entraîner le modèle.

      2. Dans l'onglet Enrichments, localisez votre discriminant dans la colonne Nom. Dans la zone Zones à enrichir, choisissez la même zone de texte que celle qui a été utilisée pour entraîner le modèle. (Cette zone est déterminée par le système et est indexée en tant que zone Contenu de texte analysable. Pour plus d'informations, voir Identification de la zone de texte.)

      3. Cliquez sur Apply changes and reprocess.

Résultats de la classification

Une fois que l'enrichissement est appliqué à une collection, une facette est générée et vous pouvez l'utiliser pour rechercher les classes prévues. Dans cet exemple, le champ prédit est nommé label_answer_predicted.

Affiche la facette générée après l'application de l'enrichissement du classificateur de documents à une
facette Label_answer_predicted est

Utilisez la facette générée pour filtrer les documents par classification et analyser les sous-ensembles de documents. Cela vous aide à trouver des modèles et à découvrir d'autres connaissances. Vous pouvez exporter ces documents cible pour les partager avec les membres de l'équipe ou les analyser plus en détail. Pour plus d'informations, voir Exportation de données.

Lorsque le discriminant de document classifie un document, il stocke la classification dans la zone document_level_enrichment.classes.class_name.

Par exemple, l'extrait JSON suivant montre un document classé avec la classe package_container.

Affiche la source JSON d'un document qui a été classé avec la classe package_container.
Document classifier enrichment syntax

Limites de discriminant de document

Le nombre de discriminants de document et de libellés que vous pouvez créer par instance de service dépend de votre type de plan Discovery.

Limites du plan de discriminant de document
Limite Entreprise Premium Cloud Pak for Data
Nombre de discriminants de document par instance de service 20 20 Illimité
Nombre de lignes de données libellées 20 000 20 000 20 000
Taille maximale en Mo des données d'apprentissage après l'enrichissement 1,024 1,024 1,024
Nombre de libellés 1 000 1 000 1 000
Nombre de champs cible 50 50 50