Classifier le texte
Définissez les catégories par lesquelles le texte de vos documents peut être classifié.
Cette rubrique explique comment classifier du texte. Si vous souhaitez classer des documents, utilisez l'application Content Mining. Pour plus d'informations, voir les types de classificateurs.
Ajoutez un discriminant de texte pour affecter du texte à partir de documents de votre collection dans des catégories. Discovery utilise les libellés et les exemples de texte que vous fournissez pour prévoir les catégories de texte de votre collection.
Pour créer un classificateur de texte, procédez comme suit :
-
Créez un fichier CSV contenant un exemple de texte suivi de son libellé de catégorie par ligne.
Le fichier CSV doit être au format de codage UTF-8 et doit répondre aux exigences suivantes:
-
Le format doit être
text,label. Letextest le texte de l'exemple et lelabelest le nom de la catégorie.Ajoutez des phrases complètes en tant qu'entrées de texte. N'incluez pas de lignes vides dans le fichier CSV.
Vous pouvez ajouter d'autres colonnes
labelsi vous devez appliquer plus d'une étiquette à la phrase de la colonnetext. Par exemple,text,label,label. -
Le fichier doit comporter au moins deux colonnes sans en-tête.
-
Ajoutez 10 entrées ou plus pour chaque catégorie que vous souhaitez définir. Le nombre minimal d'entrées requises par catégorie est 3. Plus vous fournissez d'exemples pour chaque catégorie, plus le discriminant peut prédire les catégories d'autres contenus de votre collection.
L'exemple suivant est un fichier CSV qui définit deux catégories, nommées
facility_temperatureetcatering. L'exemple de texte comprend les commentaires des participants à la conférence.The rooms were too cold.,facility_temperature Breakfast did not include gluten-free options.,catering The rooms were too warm.,facility_temperature I was very comfortable in the session rooms.,facility_temperature The awards dinner was delicious.,catering Coffee ran out during one of the breaks.,catering The temperature was not comfortable.,facility_temperature I was very happy with the selection at lunch.,catering It was nice that you provided tea and coffee. Tea drinkers are often ignored.,catering Can you turn up the air conditioning? I was very warm.,facility_temperature My teeth were chattering because I was so cold.,facility_temperature The speaker left the room to find someone to adjust the temperature.,facility_temperature Would you consider an all-vegan menu next year?,catering I would like lemonade and iced tea to be served during the breaks.,catering The lunch staff was excellent.,catering Appreciated the fresh blueberry muffins at breakfast.,catering The hotel staff adjusted the temperature in my session room as soon as I asked. Excellent service!,facility_temperature Every meal was delicious and there was something for everyone.,catering The seats under the skylights were not comfortable. Too hot.,facility_temperature I was comfortable everywhere in the conference center. I never needed my emergency sweater.,facility_temperature -
-
Dans la section Teach domain concepts du panneau Improvement tools, cliquez sur Text classifiers.
-
Cliquez sur Transférer.
-
Indiquez un nom pour le discriminant, puis choisissez la langue utilisée dans le fichier CSV.
-
Cliquez sur Télécharger pour rechercher le fichier CSV que vous avez créé précédemment.
-
Cliquez sur Créer.
Un enrichissement de discriminant est créé en fonction des données d'apprentissage que vous avez fournies.
-
Choisissez la collection et la zone dans lesquelles vous souhaitez appliquer l'enrichissement du discriminant de texte, puis cliquez sur Appliquer.
L'exemple suivant montre comment un enrichissement créé avec l'exemple de fichier CSV comme données d'apprentissage peut classer du texte dans un document. Dans la sortie, l'enrichissement du discriminant applique le libellé facility_temperature au texte du document. label est stocké dans le tableau enriched_{field_name}, dans le tableau classes.
{
"enriched_text": [
{
"classes": [
{
"confidence": 0.999692440032959,
"label": "facility_temperature"
}
]
}
],
"text": [
"I think more attendees would stay awake in the sessions if the rooms were colder."
]
}
Types de discriminant
Le discriminant que vous ajoutez à partir de l'interface utilisateur Discovery est un discriminant de texte. Un discriminant de texte peut classer des documents en fonction de mots et de phrases qui sont extraits du texte du corps du texte et dont les informations sur la partie du discours sont prises en compte.
Vous pouvez créer un autre type de discriminant, un discriminant de document, uniquement à partir de l'application Content Mining déployée. Un discriminant de document peut classer des documents en fonction de mots et de phrases extraits des zones de texte de corps avec des informations provenant de leur partie du discours et des autres enrichissements appliqués au texte de corps pris en compte. Les informations des autres zones non-corps sont également utilisées.
Vous pouvez appliquer un discriminant de document à une collection dans un type de projet autre qu'un projet Content Mining. Pour ce faire, vous devez créer le discriminant dans l'application Content Mining déployée et l'exporter. Vous pouvez ensuite importer le discriminant et l'appliquer à votre collection en tant qu'enrichissement. Pour plus d'informations, voir Création et application d'un discriminant de document.
Le discriminant de texte utilise les informations de la partie du discours, que l'enrichissement de la partie du discours soit appliqué ou non au projet.
Les discriminants de texte que vous ajoutez à un projet peuvent être utilisés par d'autres projets, y compris les projets Content Mining.
Un discriminant de texte ne classifie pas la zone de texte cible avec des scores de confiance inférieurs à 0.5. Vous ne pouvez pas modifier le seuil de confiance utilisé par le discriminant de texte. Si vous vous attendiez à ce que certains types de passages ne soient pas classifiés, vous pouvez ajouter des passages avec des caractéristiques similaires à vos données d'apprentissage et entraîner un autre discriminant.
Limites du discriminant de texte
Le nombre de discriminants de texte et de libellés que vous pouvez créer par instance de service dépend de votre type de plan Discovery.
| Limite | Plus | Entreprise | Premium | Cloud Pak for Data |
|---|---|---|---|---|
| Nombre de discriminants de texte par instance de service | 5 | 20 | 20 | Illimité |
| Nombre de lignes de données libellées | 2 000 | 20 000 | 20 000 | 20 000 |
| Taille maximale en Mo des données d'apprentissage après l'enrichissement | 16 | 1,024 | 1,024 | 1,024 |
| Nombre de libellés | 100 | 1 000 | 1 000 | 1 000 |