Use o Watson NLP integrado para localizar termos comuns

Aprovete para premiar as capacidades do Watson Natural Language Processing (NLP), adicionando enriquecimentos pré-construídos aos seus documentos.

Com o Watson NLP, você pode identificar e marcar informações significativas em suas coleções para que você possa entender o que tudo significa e tomar decisões mais informadas.

Os enriquecimentos do Watson NLP a seguir estão disponíveis:

  • Entidades: Reconhece nouns adequados como pessoas, cidades e organizações que são mencionadas no conteúdo.
  • Palavras-chave: Reconhece termos significativos em seu conteúdo.
  • Parte do Discurso: Identifica as partes do discurso (substantivos e verbos, por exemplo) no conteúdo.
  • Sentimento: Compreende o sentimento geral do conteúdo.

Os demais enriquecimentos pré-treinados estão disponíveis com Discovery:

Enriquecimentos do Watson NLP

Por exemplo, a captura de tela a seguir mostra uma transcrição da Declaração de Independência dos EUA que foi adicionada a uma coleção Discovery onde as Entidades e os enriquecimentos Palavras-chave em Palavras-chave estão ativados. As menções que são reconhecidas pelos enriquecimentos destacam-se no texto do documento.

Mostra um trecho da Declaração de Independência dos EUA com vários termos destacados.
Excerpt of the US Declaration of Independence with highlighted terms

Alguns enriquecimentos do NLP são aplicados em projetos automaticamente. Você não precisa aplicá-los você mesmo se estiver usando um desses tipos de projeto.

Enriquecimentos padrão por tipo de projeto

Alguns enriquecimentos pré-construídos são aplicados automaticamente em coleções em um projeto baseado no tipo de projeto. A tabela a seguir mostra os enriquecimentos inadimplentes que são aplicados a cada tipo de projeto.

enriquecimentos padrão por tipo de projeto
Esta tabela tem cabeçalhos de linha e coluna. Os cabeçalhos de linha identificam os tipos de projeto. Os cabeçalhos da coluna identificam diferentes enriquecimentos. Para entender quais enriquecimentos são aplicados em um tipo de projeto por padrão, vá para a linha que descreve os enriquecimentos, e encontre as colunas para o tipo de projeto que você está interessado.
Enriquecimento Document Retrieval Recuperação de Documentos para Contratos Conversational Search Mineração de conteúdo
Contratos Ícone de visto
Entidades Ícone de visto Ícone de visto
Palavras-chave
Parte do discurso Ícone de visto
Sentimento de Documento
Table Understanding Ícone de visto

Para obter mais informações sobre os seguintes enriquecimentos pré-construídos, veja os tópicos a seguir:

Para obter mais informações sobre como criar enriquecimentos personalizados, consulte Adicionando recursos específicos de domínio.

Para obter mais informações sobre como obter o máximo de enriquecimentos, leia o post Enrichando seus documentos pode tornar a busca mais eficaz blog.

Para obter mais informações sobre como aplicar enriquecimentos usando a API, consulte Aplicando enriquecimentos usando a API.

Adicionar enriquecimentos

Para adicionar um enriquecimento de PNL, conclua as etapas a seguir:

  1. Abra o seu projeto e vá até a página Gerenciar coleções.

  2. Clique para abrir a coleção que deseja enriquecer.

  3. Abra a guia Enrichments (Enriquecimentos ).

  4. Role para encontrar o enriquecimento NLP que você deseja aplicar em seus documentos.

    Ambos os enriquecimentos embutidos e enriquecimentos customizados são listados. Os enriquecimentos embutidos têm um valor de tipo de System.

  5. Escolha um ou mais campos para aplicar o enriquecimento.

    Você pode aplicar enriquecimentos aos campos text e html, e a campos personalizados que foram adicionados a partir de arquivos JSON ou CSV carregados ou a partir da ferramenta Smart Document Understanding (SDU).

  6. Clique em Aplicar mudanças e processar novamente.

Enriquecimentos que você habilitar são aplicados aos documentos em ordem aleatória. Para obter informações sobre como remover um enriquecimento, consulte Gerenciando enriquecimento.

Entidades

Identifica entidades. Entidades são termos que geralmente representam nouns adequados como pessoas, cidades e organizações que são mencionadas na coleta de dados. Discovery podem reconhecer entidades que fazem parte de um sistema de tipo de entidade que é definido pelo serviço Watson Natural Language Processing (NLP).

Se você quer ser capaz de identificar termos incomuns que são significativos para o seu negócio, você pode treinar seu próprio modelo para reconhecer entidades customizadas. Para obter mais informações, consulte Extrator de Entidade.

O serviço de extrator da entidade Watson NLP que é usado pelo Discovery é chamado de sistema do tipo NLU. O nome origina-se do fato de que o sistema de tipo é usado pelo serviço Watson Natural Language Understanding (NLU), além do serviço Watson Discovery. No entanto, é a implementação do Watson NLP do sistema de tipo que é usado diretamente pelo Discovery, não a implementação do Watson NLU. Como resultado, as duas implementações podem produzir resultados diferentes. Para obter uma ideia geral dos tipos de entidades que são reconhecidas pelos serviços, consulte Entidades.

A captura de tela a seguir mostra que o enriquecimento de Entidades reconhece os termos Sistemas de Governo e King of Great Britain (entre outros) e as tags como menções entidade.

Mostra a declaração com os termos Governos e Rei da Grã-Bretanha destacada.
The recognized entities, Governments and King of Great Britain, are highlighted

A partir da visualização JSON do documento, é possível ver a estrutura JSON subjacente da menção da entidade.

Mostra a visualização JSON das entidades Systems of Government e King of Great Britain identificadas no
JSON de
de entidades reconhecidas*

Se você deseja pesquisar o tipo de entidade da Organização, por exemplo, você pode copiar todo o conteúdo JSON em um editor de texto e procurar por Organization. Clique no ícone Copiar a partir da raiz da visualização de árvore JSON.

Exemplo

Entrada

"IBM is an American multinational technology company headquartered in Armonk."

Resposta

Na saída JSON:

  • text = sequência. O texto da entidade
  • type = sequência. O tipo entidade, tal como Organization, Location, Person, Number.
  • mentions = matriz. As menções e os locais da entidade
  • model_name = sequência. Para modelos personalizados, esse campo contém o nome do modelo fornecido pelo usuário. Caso contrário, esse campo contém o nome padrão do modelo, como watson_knowledge_studio, dictionary, character_pattern, ou natural_language_understanding
{
  "entities": [
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.8317045,
          "location": {
            "end": 3,
            "begin": 0
          },
          "text": "IBM"
        }
      ],
      "text": "IBM",
      "type": "Organization"
    },
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.6114863,
          "location": {
            "end": 75,
            "begin": 69
          },
        "text": "Armonk"
        }
      ],
      "text": "Armonk",
      "type": "Location"
    }
  ]
}

Palavras-chave

Retorna palavras-chave importantes no conteúdo.

Por exemplo, a captura de tela a seguir mostra termos destacados da Declaração de Independência dos EUA que são reconhecidos pelo enriquecimento Palavras-chave.

Mostra as palavras-chave que são reconhecidas no{: caption="do documentoTermos reconhecidos pelo " caption-side="bottom"} de palavras-chave

A partir da visualização JSON do documento, é possível ver a estrutura JSON subjacente da menção palavra-chave Declaration.

Mostra a exibição JSON das palavras-chave identificadas no
JSON das
de enriquecimento de palavras-chave*

Exemplo

Entrada

"Watson Discovery is an award-winning AI search technology."

Resposta

Na saída JSON:

  • text = O texto de palavra-chave
  • mentions = As menções e os locais da entidade
{
  "keywords": [
    {
      "mentions": [
        {
          "location": {
            "end": 157,
            "begin": 141
          },
          "text": "Watson Discovery"
        }
      ],
      "text": "Watson Discovery",
      "relevance": 0.503613
    },
    {
      "mentions": [
        {
          "location": {
           "end": 177,
            "begin": 164
          },
          "text": "award-winning"
        }
      ],
      "text": "award-winning",
      "relevance": 0.728722
    },
    {
      "mentions": [
        {
          "location": {
            "end": 198,
            "begin": 181
          },
          "text": "search technology"
        }
      ],
      "text": "search technology",
      "relevance": 0.779356
    }
  ]
}

Limites de palavras-chave

O enriquecimento Palavras-chave em Palavras-chave pode identificar até 50 palavras-chave, cada uma com uma ou muitas menções, por documento.

Parte do discurso

Reconhece e tags partes de discurso, incluindo substantivos, verbos, adjetivos, advérbios, conjunções, interjeições e numerais.