Esta documentación es para IBM Watson® Knowledge Studio en IBM Cloud®. Para ver la documentación de la versión anterior de Knowledge Studio en IBM Marketplace, pulse este enlace.
Añadir documentos para su anotación
Para entrenar un modelo de aprendizaje automático, debe añadir documentos que contengan conocimientos sobre la materia, como artículos de diarios u otros textos específicos del sector, a su espacio de trabajo.
Acerca de esta tarea
Esta sección describe cómo añadir documentos solo para la anotación. Para definir reglas para el modelo basado en reglas, añada o cargue documentos desde los que pueda definir patrones a definir como reglas. Consulte Añadir documentos para definir reglas para obtener más información.
Documentos
Para entrenar un modelo de aprendizaje automático, debe recopilar documentos que sean representativos del contenido del dominio y de alto valor para su aplicación.
Intente asegurarse de que sus documentos de entrenamiento sean verdaderamente representativos del contenido de interés para su dominio; es decir, que contengan muchas menciones relevantes que se puedan anotar. Para elegir los mejores documentos, siga estas directrices:
- Trate de proporcionar un conjunto de documentos que tengan un tamaño total de aproximadamente 300.000 palabras. Proporcione más palabras para un sistema de tipos complejo, y menos para uno más sencillo.
- Limite cada documento a una o dos páginas de contenido; menos de 2.000 palabras, y más cerca de 1.000 palabras por documento es lo mejor. En las primeras etapas de desarrollo del modelo, conservar cada documento con unos pocos párrafos es también una práctica recomendada. Un anotador humano puede marcar menciones y relaciones en un documento largo, pero los intentos por marcar correferencias en varias páginas puede ser difícil.
- Los documentos suelen limitarse a 600 menciones
- Asegúrese de que los datos de los documentos estén distribuidos entre todos los tipos, subtipos y roles de entidades posibles, y las relaciones entre ellas. Un objetivo que busca conseguirse es llegar a tener al menos 50 anotaciones para cada tipo de entidad y 50 para cada tipo de relación de la recopilación de documentos.
- De nuevo, los documentos deben representar la amplitud de la materia que tratará la aplicación, pero en el caso de frecuencia de aparición desigual de tipos de entidades y de tipos de relaciones, intente obtener al menos 50 ejemplares de cada tipo, más para tipos de entidades que tienen menciones que tienden a ser frases.
- El conjunto que cree para el entrenamiento debe contener al menos 10 documentos anotados.
Cuando esté listo para crear y entrenar el modelo, los documentos que añada al espacio de trabajo se podrán dividir en conjuntos utilizados como datos de entrenamiento, datos de prueba y datos ciegos. Los conjuntos de datos independientes son importantes para evaluar el rendimiento de modelo.
Puede añadir documentos de las maneras siguientes. Para obtener más información sobre los tipos de documentos admitidos, los límites de tamaño y demás información, consulte Creación de un espacio de trabajo > Resumen de entradas, salidas y limitaciones.
- Un archivo CSV de dos columnas en formato UTF-8
- Archivos de texto en formato UTF-8
- Archivos HTML
- Archivos PDF (no se admiten archivos digitalizados -escaneados- ni protegidos con contraseña)
- Archivos DOC o DOCX de Microsoft Word (no se admiten archivos protegidos por contraseña)
- Un archivo .zip que contiene documentos descargados desde un espacio de trabajo de Knowledge Studio
- Un archivo .zip que contiene archivos en formato UIMA CAS XMI
Archivos CSV
Puede cargar un archivo CSV de dos columnas que contenga texto de muestra desde la máquina local. Cargue un archivo CSV a la vez. La primera columna del archivo CSV especifica el nombre de archivo del documento. La segunda columna del archivo
contiene el texto del documento. Para ver un ejemplo del formato necesario, consulte la publicación documents-new.csv Archivo en los archivos de ejemplo de la guía de aprendizaje.
Archivos PDF
En algunos casos, no se puede extraer el texto de un PDF, según cómo se haya creado el PDF. Normalmente, el texto no se puede extraer de fuentes incluidas que no se correlacionan con caracteres Unicode. Si no está seguro de si el texto de un PDF se puede extraer, puede intentar copiar el texto del PDF y luego pegarlo en un editor de texto. Si no ve los mismos caracteres que son visibles en el propio PDF, es probable que la extracción de texto falle.
Documentos formateados
Cuando los documentos con formato se convierten en texto sin formato, es posible que al perder el formato se produzca una peor señalización ("tokenización") de las palabras. Por ejemplo, si una fila de tabla de un archivo DOCX contiene valores de celda que no finalizan con un punto, los valores se pueden convertir en una sola frase. Otro ejemplo sería si un documento PDF contiene una palabra muy larga a la que se añade un guión al final de una línea, porque no cabe; dicha palabra se podría convertir en dos palabras. En casos como estos, es posible que los documentos no sean adecuados para el aprendizaje automático a menos que se procesen previamente los archivos para arreglar las limitaciones de formato.
Documentos de otro espacio de trabajo de Watson Knowledge Studio
Si ha descargado previamente documentos desde un espacio de trabajo de Knowledge Studio, puede cargar el archivo .zip que ha descargado. Una opción le permite especificar si desea que las anotaciones de los datos de campo se incluyan en los archivos importados.
Una vez anotados los documentos, estos se almacenarán en formato JSON. El lenguaje de códigos de estos archivos, que muestra cómo se ha analizado y señalizado el texto del documento original, incluye elementos para todas las anotaciones
que ha añadido un anotador humano. Para mejorar la exactitud del modelo a lo largo del tiempo, puede cargar estos archivos en otro espacio de trabajo, conservando así todas las anotaciones existentes. Un anotador humano puede revisar, suprimir
y añadir anotaciones a estos documentos, o puede omitir la anotación humana y utilizar estos archivos para crear conjuntos de documentos de entrenamiento, de prueba y ciegos para evaluar y mejorar el rendimiento del modelo.
Archivos UIMA CAS XMI
Para ayudar a entrenar un modelo, puede cargar documentos que fueron preanotados por un motor de análisis de UIMA. Los archivos preanotados deben estar en formato de serialización XMI de UIMA Common Analysis Structure (UIMA CAS XMI) y estar combinados en un archivo .zip. Por ejemplo, puede cargar documentos anotados en una recopilación de IBM Watson Explorer.
Un anotador humano puede revisar, suprimir y añadir anotaciones a estos documentos, o puede omitir la anotación humana y utilizar estos archivos para crear conjuntos de documentos de entrenamiento, de prueba y ciegos para evaluar y mejorar el rendimiento del modelo. Para obtener más información sobre cómo crear estos archivos y requisitos para cargarlos, consulte Carga de documentos preanotados.
Creación de datos anónimos
Si desea crear un modelo optimizado para sus datos, pero no desea cargar los datos tal cual en Knowledge Studio por motivos de privacidad, puede despojar los documentos de cualquier información personalmente identificable (PII) en primer lugar y, a continuación, utilizar esos documentos convertidos en anónimos para entrenar el modelo. No redacte la información ni la sustituya en bloque por variables. Para obtener mejores resultados, sustituya la información real por información falsa del mismo tipo.
Por ejemplo, si la PII que desea proteger son los nombres de clientes, en lugar de redactar cada nombre o sustituir cada nombre por una variable, como por ejemplo USER_NAME, sustituya cada nombre por un nombre falso que utilice una variedad de estilos de sintaxis de nombre típicos, como por ejemplo Ana García, Sr. Rodríguez, González, o Dr. Pérez, doctorado. Considere la posibilidad de escribir un script que concatene una variedad de nombres y apellidos, y títulos y nombres, y que añada nombres solos para crear nombres falsos que se puedan insertar en el documento para sustituir instancias de nombres de usuarios reales. El objetivo es simular lo más cerca posible valores reales en los documentos de origen. Si el mismo texto (USER_NAME) se utiliza en los documentos o en el texto que se redacte, estará básicamente entrenando el modelo para esperar que todos los nombres tengan el mismo valor o se redacten. Cuando el modelo se utilice en el tiempo de ejecución en documentos nuevos, y encuentra nombres que no se han visto antes en toda su variabilidad, deseará que pueda reconocerlos como nombres.
Adición de documentos a un espacio de trabajo
Para entrenar un modelo, debe añadir documentos que son representativos del contenido de dominio a su espacio de trabajo.
Acerca de esta tarea
Como mejor práctica, empiece con una recopilación de documentos relativamente pequeña. Utilice estos documentos para entrenar los anotadores humanos (si el espacio de trabajo implica anotación humana) y para refinar las directrices de anotación. Los documentos pequeños pueden ayudar a los anotadores humanos a identificar cadenas de correferencia mediante el documento. A medida que mejore la exactitud de la anotación, podrá añadir más documentos al corpus para proporcionar mayor profundidad al esfuerzo de entrenamiento.
Procedimiento
Para añadir documentos a un espacio de trabajo:
-
Inicie sesión como un administrador o gestor de proyectos de Knowledge Studio, y seleccione su espacio de trabajo.
-
Seleccione el separador Activos> Documentos > Conjuntos de documentación.
-
Pulse Cargar conjuntos de documentos para añadir documentos al corpus.
-
Subir documentos en uno de los formatos admitidos. Para obtener más información sobre los tipos de documentos admitidos, los límites de tamaño y demás información, consulte Creación de un espacio de trabajo > Resumen de entradas, salidas y limitaciones.
Notas sobre archivos .zip de documentos descargados desde otro espacio de trabajo
Cuando se importen los documentos anotados, se volverán a señalizar. Este proceso puede cambiar lo que Knowledge Studio considera que son los límites de la frase. Dado que las anotaciones están definidas por la frase, algunas anotaciones podrían ser invalidadas durante este proceso. Después de cargar documentos desde otro espacio de trabajo, realice una revisión rápida de las anotaciones para enfrentarse a las discrepancias.
- Si ha descargado previamente documentos desde un espacio de trabajo de Knowledge Studio, arrastre el archivo .zip que contiene los documentos descargados o pulse para localizar y seleccionar el archivo. Si desea incluir anotaciones añadidas a los documentos antes de que se descargaran, asegúrese de que la opción para incluir los datos de campo esté seleccionada antes de pulsar Cargar. Solo se importarán las anotaciones promocionadas a datos de campo antes de que se descarguen los documentos.
- Debe cargar el sistema de tipos desde el espacio de trabajo original al espacio de trabajo actual antes de cargar las anotaciones de datos de campo. Para obtener más información, consulte Cargar recursos desde otro espacio de trabajo.
Notas acerca de los archivos de .zip de documentos en formato UIMA CAS XMI
- Si ha descargado previamente documentos anotados que están en formato UIMA CAS XMI, puede cargar el archivo .zip que contiene el contenido analizado. Especifique que este es el tipo de contenido que desea cargar antes de pulsar Cargar. Para obtener más información sobre cómo crear estos archivos y requisitos para cargarlos, consulte Carga de documentos preanotados.
-
Cuando los documentos se hayan añadido, pulse los nombres de documentos para previsualizarlos y verificar que el contenido es correcto. Por ejemplo, verifique que los archivos de texto estén en formato UTF-8 y que no sean visibles problemas de marcas diacríticas ni de normalización de caracteres en los documentos, y compruebe si hay saltos de frase pobres. Si existen problemas, puede que necesite preprocesar los archivos antes de añadirlos al corpus. Desea que los documentos estén lo más limpios y con mejor formato como sea posible antes de comenzar el diccionario o la anotación humana.
Qué hacer a continuación
Antes de iniciar las tareas de anotación humana, divida el corpus en varios conjuntos de documentos y asigne los conjuntos de documentos a anotadores humanos.
Los administradores y gestores de proyectos pueden anotar conjuntos de documentos directamente sin crear tareas de anotación.
Supresión de documentos
Puede suprimir un documento si determina que no representa el texto del sector estándar que beneficiará al modelo.
Para suprimir un documento, elija la opción que se aplica a su situación:
- Supresión de un documento que no se ha asociado con una tarea de anotación
- Supresión de un documento asociado con una tarea de anotación y la anotación humana no se ha iniciado
- Supresión de un documento asociado con una tarea de anotación y la anotación humana se ha iniciado
Supresión de un documento que no se ha asociado con una tarea de anotación
Si el documento que desea suprimir no está asociado con una tarea de anotación, siga estos pasos para suprimir el documento.
Procedimiento
Inicie sesión como administrador de Knowledge Studio y seleccione el espacio de trabajo.
- Seleccione el separador Activos> Documentos > Conjuntos de documentos.
- Seleccione el conjunto de documentos que contiene el documento que desea suprimir. Se abrirá el conjunto de documentos.
- Busque el documento que desea eliminar y, a continuación, pulse Suprimir.
Supresión de un documento asociado con una tarea de anotación y la anotación humana no se ha iniciado
Si el documento que desea suprimir está asociado con una tarea de anotación y la anotación humana aún no se ha iniciado, siga estos pasos para suprimir el documento.
Procedimiento
-
Inicie sesión como administrador de Knowledge Studio y seleccione el espacio de trabajo.
-
Suprima la tarea de anotación:
- Abra la página Modelo de aprendizaje automático > Anotaciones. Pulse el separador Tareas de anotación.
- Busque la tarea de anotación con la que está asociado el documento, pulse el icono Mostrar menú en la tarea y, a continuación, pulse Suprimir.
-
Suprima el documento tal como se describe en Supresión de un documento que no se ha asociado con una tarea de anotación.
-
Después de suprimir el documento, vuelva a crear la tarea de anotación y asocie el mismo conjunto de anotaciones, que ahora tiene un documento menos.
Supresión de un documento asociado con una tarea de anotación y la anotación humana se ha iniciado
Si el documento que desea suprimir está asociado con una tarea de anotación y la anotación humana se ha iniciado, siga estos pasos para suprimir el documento.
No suprima una tarea si la anotación humana está en curso; de o contrario, perderá el trabajo en curso.
Procedimiento
- Indique a los anotadores humanos que ignoren el documento no deseado en el conjunto.
- Una vez finalizado el trabajo de anotación en los demás documentos, y cuando los anotadores humanos envíen todos los documentos para añadir el conjunto a los datos de campo, revise y acepte los documentos enviados.
- Resuelva los conflictos de anotación.
- Cuando todos los documentos formen parte de los datos de campo y la tarea se haya completado, suprima la tarea tal como se describe en Supresión de un documento asociado con una tarea de anotación y la anotación humana no se ha iniciado.
- Suprima el documento tal como se describe en Supresión de un documento que no se ha asociado con una tarea de anotación.
Puede confirmar que las anotaciones en los documentos restantes no se pierden descargando los conjuntos de documentos y revisando los documentos en la carpeta gt.
Modelo de datos
Los diagramas de este tema resumen el flujo de documentos en un sistema Knowledge Studio y las diferencias entre documentos del corpus, una tarea de anotación y los datos de campo.
El corpus contiene documentos, que se dividen en conjuntos de documentos:
- Un documento no es nada más que cadenas de texto.
- Un conjunto de documentos es un puntero a un grupo de documentos. El conjunto de documentos no contiene copias de los propios documentos.
- Algunos conjuntos de documentos pueden apuntar a un solo documento, una configuración que puede controlar mediante el parámetro de solapamiento que especifique al crear conjuntos de anotaciones.
Figura 1. Esta figura ilustra dos conjuntos de documentos que apuntan a tres documentos. Los documentos se dividen entre los conjuntos.
Los datos de campo comprenden las anotaciones (menciones, relaciones, y menciones correferenciadas) que se añaden a los documentos. Los datos de campo son singulares para cada documento.
Figura 2. Estas cifras ilustran que los datos de campo consisten en las anotaciones que se añaden al documento 1, documento 2, documento 3, etc.
Al crear una tarea de anotación, se crearán copias de las anotaciones para cada documento en el conjunto de anotaciones que añada a la tarea. Los anotadores humanos anotan los documentos. Las anotaciones están aisladas entre sí y entre los datos de campo. Una tarea de anotación es un concepto temporal que existe para permitir a los anotadores humanos anotar texto en espacios aislados. En cambio, los datos de campo son permanentes y singulares.
Figura 2. Estas cifras
ilustran que el gestor de proyectos crea conjuntos de anotaciones y los asigna a una tarea de anotación. Dave y Phil, los anotadores humanos, anotan documentos en los conjuntos asignados a ellos.
Una vez que el gestor de proyectos apruebe conjuntos de anotaciones en una tarea de anotación, las anotaciones de documentos que no se solapen con otros conjuntos de anotaciones se convertirán en datos de campo. Para los documentos que se solapen entre conjuntos de anotaciones (representados por el documento 2 de este ejemplo), el gestor de proyectos debe adjudicar y resolver conflictos. Las anotaciones de los documentos que se solapan no se convertirán en datos de campo hasta que se aprueben mediante la adjudicación.
Los datos de campo se utilizarán entonces para entrenar y probar un modelo de aprendizaje automático, o se pueden utilizar como la base para la siguiente iteración del desarrollo de modelos. Para utilizar los datos de campo en una nueva iteración, debe crear una tarea de anotación nueva.
Figura 3. Esta figura ilustra cómo las anotaciones añadidas por dos anotadores humanos se convierten en los datos de campo. Un documento, etiquetado como documento 2, está anotado por ambos anotadores humanos. Las anotaciones de este documento
que se solapa deben estar adjudicadas antes de que se conviertan en datos de campo.