Analisando seus dados com o aplicativo Content Mining

Use o aplicativo Discovery Mineração de conteúdo para analisar seus dados. O aplicativo mostra subconjuntos de suas informações em visualizacoes que podem ajudá-lo a encontrar padrões, tendências e anomalias.

Somente os usuários de implantações instaladas ou de implantações gerenciadas pelos planos Enterprise e Premium podem usar o aplicativo Content Mining.

Vídeo geral

Transcrição de vídeo

Watson Discovery Projeto de Mineração de Conteúdo apresentado por Stuart Strolin. (Music intro) O objetivo deste vídeo é familiarizá-lo com o projeto de mineração de conteúdo em Watson Discovery.

A mineração de conteúdo é um dos casos de uso primário para o Watson Discovery e é usada para analisar e explorar dados estruturados e não estruturados para encontrar insights e extrair significado oculto. Ele é usado tanto pelo analista cidadão quanto pelo cientista de dados.

O projeto de mineração de conteúdo pode ser usado para todos os tipos de análise porque a interface do usuário não é específica para uma determinada indústria ou conjunto de dados.

Neste cenário, você é um analista de uma empresa automobilística fictícia. Os relatórios operacionais alertaram a empresa para uma taxa de acidentes inusitada para um de seus carros. Seu trabalho é descobrir o porquê.

Usando o projeto de mineração de conteúdo, você começa sua análise olhando para os dados não estruturados dos relatórios de incidentes do veículo a motor nacional. Você é apresentado com uma interface que permite selecionar o modelo de carro e iniciar a sua análise (na página Coleções). Neste caso, você está interessado no Hill Walker. Você poderia digitar essas informações na seção de procura no início da página. Mas é mais fácil apenas clicar no item. Você pode adicionar quantos termos de busca e condições como você gosta. Mas, na realidade, você quer deixar o aplicativo guiar sua análise.

O que se vê agora é a visão de navegação (no modo Guided). Ele mantém o controle de sua análise e fornece opções para próximos passos. Ele também fornece uma contagem do número de documentos que correspondem ao seu estado atual de análise. Nesta pequena coleção, o número de documentos relativos ao Hill Walker é de apenas 51. Em um conjunto de dados de produção, o número geralmente seria muito maior. Analisar tendências e anomalias é muitas vezes uma boa maneira de começar como permite que você veja se algo parece fora do comum.

Imediatamente, você percebe que o Hill Walker tem problemas em dezembro e janeiro. Você decide investigar mais ainda mais estreitando essa exploração inicial para apenas o mês de dezembro.

Observe como a visualização de navegação na parte superior sempre o mantém informado de onde você está em sua análise. Em seguida, selecione Analisar causa e características porque você está interessado em saber por que as coisas estão acontecendo.

Você nota que palavras como 'neve' e 'brake ' são destacadas em conjunto (na seção Part of Speech), assim você adiciina estas à sua análise.

O projeto Content Miner estreitou sua investigação a um pequeno número de reclamações que podem ser facilmente lidas. (cliques Mostrar Documentos)

O tema comum aqui é que há um problema inesperado com a forma como os freios estão funcionando em condições nevadas. Você agora tem as informações que precisa para pedir ao departamento de engenharia para realizar uma inspeção detalhada do sistema de frenagem e determinar por que ele não está funcionando como esperado em condições de neve.

Nesta demonstração, você viu como um analista de cidadão usando Watson Discovery e mineração de conteúdo pode facilmente descobrir significado oculto em texto não estruturado. (lista de recursos, funcionalidades e casos de uso)

O que você fará com Watson Discovery? (Música outro)

Como isso funciona

Para analisar seus dados, você usa facetas. As facetas lhe dão uma maneira de fatiar seus dados e visualizar um subconjunto de informações para que seja mais fácil de compreender.

A partir da página de análise de dados para sua coleção, você pode escolher para os dados a serem mostrados em uma das seguintes visualizações:

Aspectos
Mostra facetas que são derivadas de anotações que são adicionadas aos seus documentos por enriquecimentos que são aplicados em seus documentos. Os enriquecimentos podem incluir enriquecimentos de Processamento de Linguagem Natural Integrados, como Parte do Discurso ou Entidades. Eles também podem incluir enriquecimentos personalizados que você agrega, como dicionários, padrões de expressão regular e modelos de aprendizado de máquina.
Facetas de metadados
Mostra facetas que são derivadas de seus dados. Ao adicionar arquivos em uma coleção, Discovery analisa e indexa os dados. As anotações são adicionadas para identificar tipos de conteúdo e são mostradas como facetas de metadados. As melhores facetas de metadados resultam quando você ingere dados estruturados, como registros de um arquivo CSV. O comprimento máximo de um aspecto de metadados é de 256 caracteres.
Customizado
Mostra apenas as facetas que você escolhe para adicionar à vista. Você pode adicionar um mix de facetas derivadas de enriquecimento e derivadas de conteúdo para sua visualização customizada.

Quando você cria um tipo de projeto Content Mining, a faceta Parte do Discurso é aplicada aos seus dados automaticamente. Essa faceta é um ótimo lugar para começar porque ela é válida para todos os dados, não importa o assunto. A saída dá uma olhada rápida na terminologia que é mais comum nos dados.

Watson Discovery content mining launch page
Watson Discovery Content Mining application home page

A partir deste ponto de partida, é possível determinar outras formas de filtrar os dados que possam ser úteis.

Se seus dados consistem em relatórios de tráfego, por exemplo, a faceta Part of Speech pode mostrar que palavras-chave de alta frequência incluem termos como engine, brake, fire, smokee spark. Dada essa terminologia comum, é possível criar dicionários para ajudá-lo a categorizar e filtrar os dados. As palavras-chave a partir do exemplo podem levá-lo a criar os seguintes dicionários:

  • component dicionário para termos como motor e freio
  • phenomenon dicionário para termos como fogo, fumaça e faísca

Quando você aplica o enriquecimento do dicionário aos seus dados, ele gera anotações. Você pode pensar em anotações como tags que você adicionar a palavras ou frases, onde a tag categoriza ou identifica o significado da palavra ou frase. As anotações resultantes funcionam como novas facetas que você pode usar para filtrar e dissecar mais os seus dados.

Com suas novas facetas component e phenomenon, por exemplo, você pode procurar correlações entre componentes e fenômenos que estão envolvidos em incidentes de tráfego.

Saiba sobre as formas que você pode analisar seus dados.

Cavando mais

Para cavar ainda mais fundo em seus dados, aplique ou crie modelos de IA que possam encontrar diferentes tipos de informações em seus documentos. Você pode aplicar modelos de processamento de linguagem natural embutidos, como o enriquecimento de Entidades que podem reconhecer menções de coisas comumente conhecidas, como nomes de negócios ou de localização e outros tipos de substantivos adequados. Ou você pode aplicar um modelo personalizado que reconhece termos e categorias que são exclusivos de seus dados.

Estender sua análise adicionando suas próprias facetas.

Introdução

Antes de poder usar o aplicativo, você deve criar um projeto Discovery Conteúdo de Mineração. Após o projeto ser criado e os dados serem carregados, é possível abrir o aplicativo Content Mining.

Para obter mais informações, consulte Criando projetos.

É claro que você não pode sair insights úteis se você não colocar o tipo certo de informação em. Certifique-se de incluir dados consistentes. Se você deseja encontrar tendências ao longo do tempo, seus dados devem incluir pontos de dados que especificam uma data.

Os dados que são submetidos em formato de arquivo CSV são ideais. Para uma amostra de um arquivo CSV que fornece recursos de análise interessantes, consulte Analisando arquivos CSV.