Análisis de los datos con la aplicación Content Mining
Utilice la aplicación Content Mining Discovery para analizar los datos. La aplicación muestra subconjuntos de información en visualizaciones que pueden ayudarle a encontrar patrones, tendencias y anomalías.
Solo los usuarios de implementaciones instaladas o de implementaciones gestionadas de planes Enterprise y Premium pueden utilizar la aplicación Content Mining.
Vídeo de visión general
Transcripción de vídeo
Watson Discovery Content Mining Project presentado por Stuart Strolin. (Introducción musical) La finalidad de este vídeo es familiarizarle con el proyecto de minería de contenido en Watson Discovery.
La minería de contenido es uno de los principales casos de uso de Watson Discovery y se utiliza para analizar y explorar datos estructurados y no estructurados para encontrar información y extraer significado oculto. Lo utilizan tanto el analista ciudadano como el científico de datos.
El proyecto de minería de contenido se puede utilizar para todos los tipos de análisis porque la interfaz de usuario no es específica de un determinado sector o conjunto de datos.
En este escenario, es analista de una empresa automovilística ficticia. Los informes operativos han alertado a la compañía de una tasa de accidentes inusual para uno de sus coches. Su trabajo es averiguar por qué.
Utilizando el proyecto de minería de contenido, empiece su análisis examinando los datos no estructurados de los informes de incidentes de vehículos de motor nacionales. Se le presenta una interfaz que le permite seleccionar el modelo de coche y comenzar su análisis (en la página Colecciones). En este caso, te interesa el Hill Walker. Puede escribir esa información en la sección de búsqueda al principio de la página. Pero es más fácil hacer clic en el elemento. Puede añadir tantos términos y condiciones de búsqueda como desee. Pero en realidad, desea que la aplicación guíe su análisis.
Lo que ve ahora es la vista de navegación (en modo guiado). Realiza un seguimiento de su análisis y proporciona opciones para los siguientes pasos. También proporciona un recuento del número de documentos que coinciden con el estado actual del análisis. En esta pequeña colección, el número de documentos relacionados con el Hill Walker es de sólo 51. En un conjunto de datos de producción, el número suele ser mucho mayor. Analizar tendencias y anomalías suele ser una buena forma de empezar ya que permite ver si algo parece fuera de lo común.
Inmediatamente, se da cuenta de que el Hill Walker tiene problemas en diciembre y enero. Usted decide investigar más a fondo reduciendo esta exploración inicial a sólo el mes de diciembre.
Observe cómo la vista de navegación en la parte superior siempre le mantiene informado de dónde se encuentra en el análisis. A continuación, seleccione Analizar causa y características porque está interesado en por qué están sucediendo las cosas.
Usted nota que palabras como "nieve" y "freno" se resaltan juntos (en la sección de parte del habla), por lo que se añaden a su análisis.
El proyecto Content Miner ha reducido la investigación a un pequeño número de quejas que se pueden leer fácilmente. (pulsaciones Mostrar documentos)
El tema común aquí es que hay un problema inesperado con la forma en que los frenos están funcionando en condiciones nevadas. Ahora tienes la información que necesitas para pedir al departamento de ingeniería que realice una inspección detallada del sistema de frenado y determine por qué no está funcionando como se esperaba en condiciones de nieve.
En esta demostración, ha visto cómo un analista ciudadano que utiliza Watson Discovery y la minería de contenido puede descubrir fácilmente el significado oculto en texto no estructurado. (lista de características, funcionalidad y casos de uso)
¿Qué harás con un Watson Discovery? (Música outro)
Cómo funciona
Para analizar los datos, utilice facetas. Las facetas le proporcionan una forma de dividir los datos y visualizar un subconjunto de información para que sea más fácil de comprender.
En la página de análisis de datos de la colección, puede elegir que los datos se muestren en una de las vistas siguientes:
- Facetas
- Muestra las facetas que se derivan de las anotaciones que se añaden a los documentos mediante los enriquecimientos que se aplican a los documentos. Los enriquecimientos pueden incluir enriquecimientos incorporados de Natural Language Processing, como Part of Speech o Entities. También pueden incluir enriquecimientos personalizados que añada, como diccionarios, patrones de expresión regular y modelos de aprendizaje automático.
- Facetas de metadatos
- Muestra las facetas que se derivan de los datos. Cuando añade archivos a una colección, Discovery analiza e indexa los datos. Las anotaciones se añaden para identificar tipos de contenido y se muestran como facetas de metadatos. Las mejores facetas de metadatos resultan al ingerir datos estructurados, como por ejemplo registros de un archivo CSV. La longitud máxima de una faceta de metadatos es de 256 caracteres.
- Personalizado
- Muestra sólo las facetas que elige añadir a la vista. Puede añadir una mezcla de facetas derivadas de enriquecimiento y derivadas de contenido a la vista personalizada.
Cuando crea un tipo de proyecto de Content Mining, la faceta Parte de voz se aplica automáticamente a los datos. Esta faceta es un gran lugar para empezar porque es válida para todos los datos, sin importar el tema. La salida le proporciona una visión rápida de la terminología que es más común en los datos.
Desde este punto de partida, puede determinar otras formas de filtrar los datos que pueden ser útiles.
Si los datos constan de informes de tráfico, por ejemplo, la faceta Parte de voz puede mostrar que las palabras clave de alta frecuencia incluyen términos como motor, freno, activación, humoy chispa. Dada esta terminología común, puede crear diccionarios para ayudarle a categorizar y filtrar los datos. Las palabras clave del ejemplo pueden llevarle a crear los diccionarios siguientes:
- Diccionario
componentpara términos como motor y freno - Diccionario de
phenomenonpara términos como fuego, humo y chispa
Cuando aplica el enriquecimiento de diccionario a los datos, genera anotaciones. Puede pensar en las anotaciones como etiquetas que añade a las palabras o frases, donde la etiqueta categoriza o identifica el significado de la palabra o frase. Las anotaciones resultantes funcionan como nuevas facetas que puede utilizar para filtrar y diseccionar más los datos.
Con las nuevas facetas component y phenomenon, por ejemplo, puede buscar correlaciones entre componentes y fenómenos que están implicados en incidencias de tráfico.
Profundizando
Para profundizar aún más en sus datos, aplique o cree modelos de IA que puedan encontrar distintos tipos de información en sus documentos. Puede aplicar modelos de proceso de lenguaje natural incorporados, como por ejemplo el enriquecimiento Entidades que puede reconocer menciones de cosas comúnmente conocidas, como nombres de empresa o ubicación y otros tipos de nombres adecuados. O bien, puede aplicar un modelo personalizado que reconozca términos y categorías que sean exclusivos de sus datos.
Cómo empezar
Para poder utilizar la aplicación, debe crear un proyecto de Content Mining Discovery. Después de crear el proyecto y de cargar los datos, puede abrir la aplicación Content Mining.
Para obtener más información, consulte Creación de proyectos.
Por supuesto, no puede obtener información útil si no pone el tipo correcto de información. Asegúrese de incluir datos coherentes. Si desea encontrar tendencias a lo largo del tiempo, los datos deben incluir puntos de datos que especifiquen una fecha.
Los datos que se envían en formato de archivo CSV son óptimos. Para obtener un ejemplo de un archivo CSV que proporciona prestaciones de análisis interesantes, consulte Análisis de archivos CSV.