Clasificar texto
Defina las categorías por las que se puede clasificar el texto de los documentos.
En este tema se describe cómo clasificar texto. Si desea clasificar documentos, utilice la aplicación Content Mining. Para más información, consulte Tipos de clasificadores.
Añada un clasificador de texto para asignar texto de los documentos de la colección en categorías. Discovery utiliza las etiquetas y los ejemplos de texto que proporciona para predecir las categorías de texto de la colección.
Para crear un clasificador de texto, siga estos pasos:
-
Cree un archivo CSV que contenga texto de ejemplo seguido de su etiqueta de categoría por línea.
El archivo CSV debe estar en formato de codificación UTF-8 y debe cumplir los requisitos siguientes:
-
El formato debe ser
text,label.text» es el texto de ejemplo y «label» es el nombre de la categoría.Añada frases completas como entradas de texto. No incluya ninguna línea en blanco en el archivo CSV.
Puede añadir más columnas de e
labeles si necesita aplicar más de una etiqueta a la frase en la columna de etextes. Por ejemplo,text,label,label. -
El archivo debe tener al menos dos columnas sin encabezados.
-
Añada 10 o más entradas para cada categoría que desee definir. El número mínimo de entradas que son necesarias por categoría es 3. Cuantos más ejemplos proporcione para cada categoría, mejor puede predecir el clasificador las categorías de otro contenido de la colección.
El ejemplo siguiente es un archivo CSV que define dos categorías, denominadas
facility_temperatureycatering. El texto de ejemplo consta de comentarios de los asistentes a la conferencia.The rooms were too cold.,facility_temperature Breakfast did not include gluten-free options.,catering The rooms were too warm.,facility_temperature I was very comfortable in the session rooms.,facility_temperature The awards dinner was delicious.,catering Coffee ran out during one of the breaks.,catering The temperature was not comfortable.,facility_temperature I was very happy with the selection at lunch.,catering It was nice that you provided tea and coffee. Tea drinkers are often ignored.,catering Can you turn up the air conditioning? I was very warm.,facility_temperature My teeth were chattering because I was so cold.,facility_temperature The speaker left the room to find someone to adjust the temperature.,facility_temperature Would you consider an all-vegan menu next year?,catering I would like lemonade and iced tea to be served during the breaks.,catering The lunch staff was excellent.,catering Appreciated the fresh blueberry muffins at breakfast.,catering The hotel staff adjusted the temperature in my session room as soon as I asked. Excellent service!,facility_temperature Every meal was delicious and there was something for everyone.,catering The seats under the skylights were not comfortable. Too hot.,facility_temperature I was comfortable everywhere in the conference center. I never needed my emergency sweater.,facility_temperature -
-
En la sección Enseñar conceptos de dominio del panel Herramientas de mejora y, a continuación, pulse Clasificadores de texto.
-
Pulse Cargar.
-
Especifique un nombre para el clasificador y, a continuación, elija el idioma que se ha utilizado en el archivo CSV.
-
Pulse Cargar para buscar el archivo CSV que ha creado anteriormente.
-
Pulse Crear.
Se crea un enriquecimiento de clasificador basado en los datos de entrenamiento que ha proporcionado.
-
Elija la colección y el campo donde desea aplicar el enriquecimiento del clasificador de texto y, a continuación, pulse Aplicar.
El ejemplo siguiente muestra cómo un enriquecimiento que se crea con el archivo CSV de ejemplo como sus datos de entrenamiento puede clasificar texto en un documento. En la salida, el enriquecimiento del clasificador aplica la etiqueta facility_temperature al texto del documento. label se almacena en la matriz enriched_{field_name}, dentro de la matriz classes.
{
"enriched_text": [
{
"classes": [
{
"confidence": 0.999692440032959,
"label": "facility_temperature"
}
]
}
],
"text": [
"I think more attendees would stay awake in the sessions if the rooms were colder."
]
}
Tipos de clasificador
El clasificador que añade desde la interfaz de usuario de Discovery es un clasificador de texto. Un clasificador de texto puede clasificar documentos basados en palabras y frases que se extraen del texto del cuerpo con su información de categoría léxica tomada en cuenta.
Puede crear otro tipo de clasificador, un clasificador de documentos, sólo desde la aplicación Content Mining desplegada. Un clasificador de documentos puede clasificar documentos basándose en palabras y frases que se extraen de los campos de texto del cuerpo con información de su categoría léxica y los otros enriquecimientos que se aplican al texto del cuerpo que se tiene en cuenta. También se utiliza la información de los otros campos que no son del cuerpo.
Puede aplicar un clasificador de documentos a una colección en un tipo de proyecto que no sea un proyecto de Content Mining. Para ello, debe crear el clasificador en la aplicación Content Mining desplegada y exportarlo. A continuación, puede importar el clasificador y aplicarlo a la colección como enriquecimiento. Para obtener más información, consulte Creación y aplicación de un clasificador de documentos.
El clasificador de texto utiliza información de categoría léxica independientemente de si el enriquecimiento de categoría léxica se aplica al proyecto.
Los clasificadores de texto que añada a un proyecto pueden ser utilizados por otros proyectos, incluidos los proyectos de Content Mining.
Un clasificador de texto no clasifica el campo de texto de destino con puntuaciones de confianza inferiores a 0.5. No puede cambiar el umbral de confianza que utiliza el clasificador de texto. Si esperaba que se clasificaran ciertos tipos de pasajes que no lo eran, puede añadir pasajes con características similares a los datos de entrenamiento y entrenar a otro clasificador.
Límites de clasificador de texto
El número de clasificadores de texto y etiquetas que puede crear por instancia de servicio depende del tipo de plan Discovery.
| Limitar | Más | Empresa | Premium | Cloud Pak for Data |
|---|---|---|---|---|
| Número de clasificadores de texto por instancia de servicio | 5 | 20 | 20 | Ilimitado |
| Número de filas de datos etiquetadas | 2.000 | 20.000 | 20.000 | 20.000 |
| Tamaño máximo en MB de datos de entrenamiento después del enriquecimiento | 16 | 1.024 | 1.024 | 1.024 |
| Número de etiquetas | 100 | 1.000 | 1.000 | 1.000 |