Classification de documents
Un modèle d'apprentissage automatique de discriminant de document analyse les documents et les étiquette avec le libellé approprié à partir d'un ensemble de libellés que vous définissez.
La classification des documents est utile lorsque vous souhaitez trier un grand nombre de documents en groupes à l'aide d'un programme. Par exemple, vous pouvez disposer d'une collection contenant des commentaires client sur les produits que vous vendez. Si vous pouvez trier automatiquement les commentaires en retour en classes, vous pouvez isoler les problèmes urgents mentionnés par les clients et les traiter en premier. En fonction des commentaires précédents, vous pouvez définir des classes telles que les libellés suivants:
- Ne fonctionne pas correctement
- Fonctions non annoncées
- Difficile à utiliser
- Parties manquantes
- Les pièces expédiées ne correspondent pas à la liste des pièces dans les instructions d'assemblage
Pour créer un discriminant de document, vous générez un modèle d'apprentissage automatique qui peut identifier la classe qui capture le mieux le point de retour d'informations client spécifié en langage naturel. Vous les associez à des libellés de classe qui représentent des scénarios réels qui ont un sens pour votre entreprise.
- Quelle est la différence entre un discriminant de document et un discriminant de texte?
- Un discriminant de document peut classer les documents en fonction des mots et des phrases extraits des zones de texte du corps avec les informations de leur partie du discours et les autres enrichissements appliqués au texte du corps pris en compte. Les informations des autres zones non-corps sont également utilisées. Un discriminant de texte peut classer des documents en fonction de mots et de phrases extraits du texte du corps du texte en prenant en compte les informations relatives à la partie du discours. Pour plus d'informations sur la création d'un discriminant de texte, voir Discriminant.
Avant de commencer
Pour entraîner le modèle de discriminant de document, vous devez fournir des exemples de documents libellés de manière appropriée. Préparez les fichiers suivants:
- Données d'entraînement
-
Obligatoire. Fichier CSV utilisé pour entraîner le modèle d'apprentissage automatique du discriminant de document. Le fichier peut contenir des points de données clés par colonne. Les points de données peuvent varier, mais le fichier doit inclure les colonnes suivantes:
- Texte en langage naturel que vous souhaitez classer ou étiqueter.
- Libellé ou nom de classe qui catégorise l'idée exprimée dans le texte du document. Vous pouvez appliquer plusieurs libellés à un échantillon de texte. Séparez les différentes valeurs de libellé par un point-virgule.
- Données de test
-
Facultatif. Fichier CSV utilisé pour tester le modèle d'apprentissage automatique du discriminant de document après son entraînement. Si vous ne spécifiez pas de fichier distinct pour le test, un sous-ensemble du contenu des données d'apprentissage est utilisé à des fins de test.
- Données cible
-
Obligatoire. Fichier CSV avec les données que vous souhaitez classifier.
Tous les fichiers CSV (entraînement, test et cible) doivent avoir les mêmes noms de colonne. Les données des colonnes doivent avoir les mêmes types de données, tels que chaîne, nombre, etc.
Vous pouvez utiliser un fichier CSV que vous avez téléchargé lors de la création du projet Content Mining ou vous pouvez créer une nouvelle collection.
pour plus d'informations, consultez les rubriques suivantes :
Exemple de données d'apprentissage de discriminant de document
Le tableau suivant présente un exemple du type de contenu qui peut être stocké dans des fichiers CSV utilisés pour entraîner un discriminant de document.
| ID_réclamation | Date : | Ligne_produit | Produit | Segments_client | Emplacement_client | Age du client | Commentaires en retour | Libellé |
|---|---|---|---|---|---|---|---|---|
| 0 | 2016/1/1 |
thé | thé au citron | Non membre | Manhattan | 20 | La paille a été épluchée du paquet de jus. | conteneur_package |
| 1 | 2016/1/2 |
crème glacée | crème glacée à la vanille | Membre Silver | Queens | 20 | J'ai pris de la crème glacée pour mes enfants, mais il y avait quelque chose comme un morceau de fil à l'intérieur de la tasse. | contamination_falsification |
Notez que les deux zones obligatoires sont présentes dans l'exemple. Les zones obligatoires portent les noms suivants:
Feedback: texte en langage naturel à étiqueter.Label: libellé à appliquer aux commentaires en retour.
Ouverture de l'application Content Mining
Si vous ne l'avez pas fait, créez le projet et ajoutez-lui une collection. Si vous avez déjà créé le projet et la collection, vous pouvez ignorer cette procédure et créer le discriminant de document.
-
Dans Discovery, créez un projet Content Mining.
-
Choisissez de télécharger des données pour créer la collection. Indiquez un nom pour votre collection, puis cliquez sur Next.
-
Téléchargez le fichier CSV contenant vos données d'entraînement.
Le fichier de données d'apprentissage doit contenir au minimum les informations suivantes:
- Colonne contenant un exemple de texte que vous souhaitez classifier. Par exemple, l'exemple de texte peut être une revue de produit.
- Colonne contenant un libellé de classe ou de catégorie affecté à l'exemple de texte.
-
Une fois le traitement de la collecte terminé, cliquez sur Lancer l'application pour ouvrir l'application Content Mining.
Les détails de la facette sont affichés pour la collection.
Création d'un discriminant de document
Pour créer un classificateur de documents, suivez les étapes suivantes :
-
Dans l'application Content Mining, cliquez sur le lien Collections dans l'élément de navigation pour ouvrir la page Créer une collection.
Le statut de la création d'index s'affiche. Attendez que la collection soit entièrement indexée avant de poursuivre cette procédure.
-
Pour créer un discriminant, cliquez sur collection, puis choisissez discriminant dans la liste.
{: caption="de la collectionMenu " caption-side="bottom"} la collection -
Cliquez sur Create classifier.
-
Nommez votre discriminant.
Lorsque vous déployez le modèle en tant qu'enrichissement ultérieurement, l'enrichissement reçoit un nom au format
{classifier name} - {model name}. Par exemple, si votre discriminant est nomméProduct reviewset que le modèle est nommév0.1, le nom de l'enrichissement estProduct reviews - v0.1.Vous pouvez éventuellement ajouter une description et identifier la langue de vos données d'apprentissage en la sélectionnant dans la zone Langue.
-
Cliquez sur Suivant
-
Sur la page Données de formation, sélectionnez le fichier que vous avez téléchargé précédemment dans la liste, puis cliquez sur Suivant.
Vous pouvez également télécharger un fichier CSV qui contient vos données d'entraînement.
La page Champs s'affiche. Il affiche des détails sur les zones qui sont générées à partir du fichier que vous avez ajouté. En règle générale, chaque colonne d'un fichier CSV est convertie en zone et reçoit un nom qui est copié à partir de l'en-tête de colonne.
-
Désélectionnez les zones de métadonnées que vous souhaitez exclure du jeu de données à partir de laquelle votre discriminant de document doit apprendre, puis cliquez sur Suivant.
Toutes les zones que vous incluez sont utilisées en tant que fonctions supplémentaires dans la classification. Toutes les zones sont sélectionnées par défaut. Vous devrez peut-être faire défiler horizontalement pour passer en revue toutes les zones.
-
Sur la page Discriminant, spécifiez les zones à utiliser pour la formation et la prévision de l'apprentissage automatique.
- Zone de réponse
- Sélectionnez la zone dans votre fichier de données d'apprentissage avec le libellé de classification. Dans l'exemple précédent, la zone
Labelest le meilleur choix. - Zone prédite
- Nom de la facette générée pour les valeurs de classe prévues. Par défaut, le nom de facette possède la syntaxe
<Answer field value>_predicted. Par exemple,Label_predicted. - Jeu de données de test
- Indique le jeu de données à utiliser pour tester le modèle de discriminant. Par défaut, le fichier CSV de données d'entraînement que vous avez téléchargé et configuré est divisé en trois ensembles de données utilisés respectivement pour l'entraînement, la validation et le test. Toutefois, vous pouvez éventuellement spécifier un ensemble de données distinct à utiliser pour tester le modèle.
- Entraînement du modèle fédéré
- Crée plusieurs modèles, en fonction des valeurs d'un champ spécifique du jeu de données. Par exemple, si le document comporte une zone
Product, vous pouvez configurer le discriminant pour créer un modèle de discriminant distinct pour chaque valeur de nom de produit spécifiée dans la zone. Par défaut, le discriminant crée un modèle de discriminant d'apprentissage automatique.
Il n'est pas nécessaire de spécifier la zone qui contient le texte à classer. Le système détecte automatiquement cette zone. Vous pouvez vérifier à partir de quelle zone le texte analysable est extrait et le modifier ou l'augmenter en modifiant le type d'index d'une autre zone. Pour plus d'informations, voir Identification de la zone de texte.
Cliquez sur Suivant.
-
Si vous souhaitez appliquer un enrichissement au texte de vos données d'apprentissage, sélectionnez au moins une zone dans la liste Zones cible dans laquelle vous souhaitez appliquer des enrichissements.
En règle générale, vous souhaitez choisir la zone qui contient le corps du texte que vous souhaitez classifier. Dans l'exemple précédent, la zone
Feedbackest le meilleur choix.Ensuite, sélectionnez les annotateurs que vous souhaitez appliquer pour enrichir le texte dans la ou les zones cible, puis cliquez sur Suivant.
L'annotateur de parties du discours est sélectionné par défaut.
-
Sur la page Confirmer, passez en revue les paramètres de configuration de votre discriminant. Pour apporter des modifications, utilisez le bouton Précédent. Sinon, cliquez sur Sauvegarder.
Une page de présentation s'affiche.
-
Cliquez sur Nouveau modèle pour créer et entraîner votre modèle d'apprentissage automatique.
-
Vous pouvez éventuellement modifier le nom du modèle et ajouter une description.
Vous pouvez modifier les valeurs de rapport par défaut spécifiées pour les ensembles de données suivants:
- Jeu de données d'entraînement: met à jour les pondérations du modèle d'entraînement.
- Ensemble de validation: surveille l'exactitude du modèle d'entraînement lors de l'entraînement. Le résultat de la précision est utilisé pour tracer un graphique des pertes d'entraînement.
- Jeu de données de test: calcule le score du modèle entraîné.
-
Cliquez sur Créer.
L'entraînement du modèle peut durer plusieurs minutes.
Déploiement du modèle de discriminant de document
Une fois le modèle entraîné, déployez-le en tant qu'enrichissement.
-
Cliquez sur l'icône de menu déroulant dynamique dans la colonne Actions, puis cliquez sur Déployer le modèle. Indiquez le nom et d'autres détails, puis cliquez sur Déployer.
-
Effectuez l'une des opérations suivantes :
-
Pour appliquer le discriminant de document à une collection dans votre projet Content Mining, voir Enrichissement de votre collection.
-
Pour appliquer le discriminant de document à une collection dans un autre projet, procédez comme suit:
-
Dans Discovery, créez ou ouvrez la collection contenant les documents que vous souhaitez classifier.
Les données de la collection dans laquelle vous appliquez l'enrichissement doivent avoir les mêmes zones que la collection que vous avez utilisée pour entraîner le modèle.
-
Dans l'onglet Enrichments, localisez votre discriminant dans la colonne Nom. Dans la zone Zones à enrichir, choisissez la même zone de texte que celle qui a été utilisée pour entraîner le modèle. (Cette zone est déterminée par le système et est indexée en tant que zone Contenu de texte analysable. Pour plus d'informations, voir Identification de la zone de texte.)
-
Cliquez sur Apply changes and reprocess.
-
-
Résultats de la classification
Une fois que l'enrichissement est appliqué à une collection, une facette est générée et vous pouvez l'utiliser pour rechercher les classes prévues. Dans cet exemple, le champ prédit est nommé label_answer_predicted.
Utilisez la facette générée pour filtrer les documents par classification et analyser les sous-ensembles de documents. Cela vous aide à trouver des modèles et à découvrir d'autres connaissances. Vous pouvez exporter ces documents cible pour les partager avec les membres de l'équipe ou les analyser plus en détail. Pour plus d'informations, voir Exportation de données.
Lorsque le discriminant de document classifie un document, il stocke la classification dans la zone document_level_enrichment.classes.class_name.
Par exemple, l'extrait JSON suivant montre un document classé avec la classe package_container.
Limites de discriminant de document
Le nombre de discriminants de document et de libellés que vous pouvez créer par instance de service dépend de votre type de plan Discovery.
| Limite | Entreprise | Premium | Cloud Pak for Data |
|---|---|---|---|
| Nombre de discriminants de document par instance de service | 20 | 20 | Illimité |
| Nombre de lignes de données libellées | 20 000 | 20 000 | 20 000 |
| Taille maximale en Mo des données d'apprentissage après l'enrichissement | 1,024 | 1,024 | 1,024 |
| Nombre de libellés | 1 000 | 1 000 | 1 000 |
| Nombre de champs cible | 50 | 50 | 50 |