Classifica testo
Definire le categorie in base alle quali il testo nei documenti può essere classificato.
Questo argomento descrive come classificare il testo. Se si desidera classificare i documenti, utilizzare l'applicazione Content Mining. Per ulteriori informazioni, vedere Tipi di classificatori.
Aggiungere un classificatore di testo per assegnare il testo dai documenti nella raccolta in categorie. Discovery utilizza le etichette e gli esempi di testo forniti per prevedere le categorie di testo nella tua raccolta.
Per creare un classificatore di testo, completare i seguenti passaggi:
-
Creare un file CSV che contiene testo di esempio seguito dalla relativa etichetta di categoria per riga.
Il file CSV deve avere il formato di codifica UTF-8 e deve soddisfare i seguenti requisiti:
-
Il formato deve essere
text,label.textè il testo di esempio elabelè il nome della categoria.Aggiungere frasi complete come voci di testo. Non includere righe vuote nel file CSV.
È possibile aggiungere altre colonne
labelse si desidera applicare più di un'etichetta alla frase nella colonnatext. Ad esempio,text,label,label. -
Il file deve avere almeno due colonne senza intestazioni.
-
Aggiungere 10 o più voci per ogni categoria che si desidera definire. Il numero minimo di voci richieste per categoria è 3. Più esempi fornisci per ogni categoria, meglio il classificatore può prevedere le categorie di altro contenuto nella tua raccolta.
Il seguente esempio è un file CSV che definisce due categorie, denominate
facility_temperatureecatering. Il testo di esempio è costituito dal feedback dei partecipanti alla conferenza.The rooms were too cold.,facility_temperature Breakfast did not include gluten-free options.,catering The rooms were too warm.,facility_temperature I was very comfortable in the session rooms.,facility_temperature The awards dinner was delicious.,catering Coffee ran out during one of the breaks.,catering The temperature was not comfortable.,facility_temperature I was very happy with the selection at lunch.,catering It was nice that you provided tea and coffee. Tea drinkers are often ignored.,catering Can you turn up the air conditioning? I was very warm.,facility_temperature My teeth were chattering because I was so cold.,facility_temperature The speaker left the room to find someone to adjust the temperature.,facility_temperature Would you consider an all-vegan menu next year?,catering I would like lemonade and iced tea to be served during the breaks.,catering The lunch staff was excellent.,catering Appreciated the fresh blueberry muffins at breakfast.,catering The hotel staff adjusted the temperature in my session room as soon as I asked. Excellent service!,facility_temperature Every meal was delicious and there was something for everyone.,catering The seats under the skylights were not comfortable. Too hot.,facility_temperature I was comfortable everywhere in the conference center. I never needed my emergency sweater.,facility_temperature -
-
Dalla sezione Teach domain concepts del pannello Improvement tools e fai clic su Text classifiers.
-
Fai clic su Carica.
-
Specificare un nome per il classificatore, quindi scegliere la lingua utilizzata nel file CSV.
-
Fare clic su Carica per ricercare il file CSV creato in precedenza.
-
Fai clic su Crea.
Viene creato un ampliamento del classificatore in base ai dati di formazione che hai fornito.
-
Scegli la raccolta e il campo in cui vuoi applicare l'arricchimento del classificatore di testo e fai quindi clic su Applica.
Il seguente esempio mostra come un arricchimento creato con il file CSV di esempio come i suoi dati di addestramento potrebbe classificare il testo in un documento. Nell'output, l'arricchimento del classificatore applica l'etichetta facility_temperature al testo del documento. label è memorizzato nell'array enriched_{field_name}, all'interno dell'array classes.
{
"enriched_text": [
{
"classes": [
{
"confidence": 0.999692440032959,
"label": "facility_temperature"
}
]
}
],
"text": [
"I think more attendees would stay awake in the sessions if the rooms were colder."
]
}
Tipi di classificatori
Il classificatore che aggiungi dall'interfaccia utente Discovery è un classificatore di testo. Un programma di classificazione del testo può classificare i documenti in base alle parole e alle frasi estratte dal testo del corpo tenendo conto delle informazioni sulla parte del discorso.
È possibile creare un altro tipo di classificatore, un classificatore di documenti, solo dall'applicazione Content Mining distribuita. Un classificatore di documenti può classificare i documenti in base alle parole e alle frasi estratte dai campi di testo del corpo con le informazioni dalla loro parte del discorso e gli altri arricchimenti applicati al testo del corpo presi in considerazione. Vengono utilizzate anche le informazioni provenienti da altri campi non - body.
È possibile applicare un classificatore di documenti a una raccolta in un tipo di progetto diverso da un progetto Content Mining. Per farlo, è necessario creare il classificatore nell'applicazione Content Mining distribuita ed esportarlo. Puoi quindi importare il classificatore e applicarlo alla tua raccolta come un arricchimento. Per ulteriori informazioni, vedi Creazione e applicazione di un classificatore di documenti.
Il classificatore di testo utilizza le informazioni Part of Speech indipendentemente dal fatto che l'arricchimento Part of Speech sia applicato al progetto.
I classificatori di testo che si aggiungono a un progetto possono essere utilizzati da altri progetti, inclusi i progetti Content Mining.
Un classificatore di testo non classifica il campo di testo di destinazione con punteggi di affidabilità inferiori a 0.5. Non è possibile modificare la soglia di sicurezza utilizzata dal classificatore di testo. Se hai previsto che alcuni tipi di passaggi non fossero classificati, puoi aggiungere passaggi con caratteristiche simili ai tuoi dati di formazione e addestrare un altro classificatore.
Limiti classificatore testo
Il numero di classificatori e etichette di testo che puoi creare per ogni istanza del servizio dipende dal tuo tipo di piano Discovery.
| Limite | Segno più | Enterprise | Premium | Cloud Pak for Data |
|---|---|---|---|---|
| Numero di classificatori di testo per istanza del servizio | 5 | 20 | 20 | Illimitato |
| Numero di righe di dati etichettate | 2.000 | 20.000 | 20.000 | 20.000 |
| Dimensione massima in MB dei dati di training dopo l'arricchimento | 16 | 1,024 | 1,024 | 1,024 |
| Numero di etichette | 100 | 1.000 | 1.000 | 1.000 |