Use o Watson NLP integrado para localizar termos comuns
Aprovete para premiar as capacidades do Watson Natural Language Processing (NLP), adicionando enriquecimentos pré-construídos aos seus documentos.
Com o Watson NLP, você pode identificar e marcar informações significativas em suas coleções para que você possa entender o que tudo significa e tomar decisões mais informadas.
Os enriquecimentos do Watson NLP a seguir estão disponíveis:
- Entidades: Reconhece nouns adequados como pessoas, cidades e organizações que são mencionadas no conteúdo.
- Palavras-chave: Reconhece termos significativos em seu conteúdo.
- Parte do Discurso: Identifica as partes do discurso (substantivos e verbos, por exemplo) no conteúdo.
- Sentimento: Compreende o sentimento geral do conteúdo.
Os demais enriquecimentos pré-treinados estão disponíveis com Discovery:
Enriquecimentos do Watson NLP
Por exemplo, a captura de tela a seguir mostra uma transcrição da Declaração de Independência dos EUA que foi adicionada a uma coleção Discovery onde as Entidades e os enriquecimentos Palavras-chave em Palavras-chave estão ativados. As menções que são reconhecidas pelos enriquecimentos destacam-se no texto do documento.
Alguns enriquecimentos do NLP são aplicados em projetos automaticamente. Você não precisa aplicá-los você mesmo se estiver usando um desses tipos de projeto.
Enriquecimentos padrão por tipo de projeto
Alguns enriquecimentos pré-construídos são aplicados automaticamente em coleções em um projeto baseado no tipo de projeto. A tabela a seguir mostra os enriquecimentos inadimplentes que são aplicados a cada tipo de projeto.
| Enriquecimento | Document Retrieval | Recuperação de Documentos para Contratos | Conversational Search | Mineração de conteúdo |
|---|---|---|---|---|
| Contratos | ||||
| Entidades | ||||
| Palavras-chave | ||||
| Parte do discurso | ||||
| Sentimento de Documento | ||||
| Table Understanding |
Para obter mais informações sobre os seguintes enriquecimentos pré-construídos, veja os tópicos a seguir:
Para obter mais informações sobre como criar enriquecimentos personalizados, consulte Adicionando recursos específicos de domínio.
Para obter mais informações sobre como obter o máximo de enriquecimentos, leia o post Enrichando seus documentos pode tornar a busca mais eficaz blog.
Para obter mais informações sobre como aplicar enriquecimentos usando a API, consulte Aplicando enriquecimentos usando a API.
Adicionar enriquecimentos
Para adicionar um enriquecimento de PNL, conclua as etapas a seguir:
-
Abra o seu projeto e vá até a página Gerenciar coleções.
-
Clique para abrir a coleção que deseja enriquecer.
-
Abra a guia Enrichments (Enriquecimentos ).
-
Role para encontrar o enriquecimento NLP que você deseja aplicar em seus documentos.
Ambos os enriquecimentos embutidos e enriquecimentos customizados são listados. Os enriquecimentos embutidos têm um valor de tipo de
System. -
Escolha um ou mais campos para aplicar o enriquecimento.
Você pode aplicar enriquecimentos aos campos
textehtml, e a campos personalizados que foram adicionados a partir de arquivos JSON ou CSV carregados ou a partir da ferramenta Smart Document Understanding (SDU). -
Clique em Aplicar mudanças e processar novamente.
Enriquecimentos que você habilitar são aplicados aos documentos em ordem aleatória. Para obter informações sobre como remover um enriquecimento, consulte Gerenciando enriquecimento.
Entidades
Identifica entidades. Entidades são termos que geralmente representam nouns adequados como pessoas, cidades e organizações que são mencionadas na coleta de dados. Discovery podem reconhecer entidades que fazem parte de um sistema de tipo de entidade que é definido pelo serviço Watson Natural Language Processing (NLP).
Se você quer ser capaz de identificar termos incomuns que são significativos para o seu negócio, você pode treinar seu próprio modelo para reconhecer entidades customizadas. Para obter mais informações, consulte Extrator de Entidade.
O serviço de extrator da entidade Watson NLP que é usado pelo Discovery é chamado de sistema do tipo NLU. O nome origina-se do fato de que o sistema de tipo é usado pelo serviço Watson Natural Language Understanding (NLU), além do serviço Watson Discovery. No entanto, é a implementação do Watson NLP do sistema de tipo que é usado diretamente pelo Discovery, não a implementação do Watson NLU. Como resultado, as duas implementações podem produzir resultados diferentes. Para obter uma ideia geral dos tipos de entidades que são reconhecidas pelos serviços, consulte Entidades.
A captura de tela a seguir mostra que o enriquecimento de Entidades reconhece os termos Sistemas de Governo e King of Great Britain (entre outros) e as tags como menções entidade.
A partir da visualização JSON do documento, é possível ver a estrutura JSON subjacente da menção da entidade.
Se você deseja pesquisar o tipo de entidade da Organização, por exemplo, você pode copiar todo o conteúdo JSON em um editor de texto e procurar por Organization. Clique no ícone Copiar a partir da raiz da visualização de
árvore JSON.
Exemplo
Entrada
"IBM is an American multinational technology company headquartered in Armonk."
Resposta
Na saída JSON:
text= sequência. O texto da entidadetype= sequência. O tipo entidade, tal comoOrganization,Location,Person,Number.mentions= matriz. As menções e os locais da entidademodel_name= sequência. Para modelos personalizados, esse campo contém o nome do modelo fornecido pelo usuário. Caso contrário, esse campo contém o nome padrão do modelo, comowatson_knowledge_studio,dictionary,character_pattern, ounatural_language_understanding
{
"entities": [
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.8317045,
"location": {
"end": 3,
"begin": 0
},
"text": "IBM"
}
],
"text": "IBM",
"type": "Organization"
},
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.6114863,
"location": {
"end": 75,
"begin": 69
},
"text": "Armonk"
}
],
"text": "Armonk",
"type": "Location"
}
]
}
Palavras-chave
Retorna palavras-chave importantes no conteúdo.
Por exemplo, a captura de tela a seguir mostra termos destacados da Declaração de Independência dos EUA que são reconhecidos pelo enriquecimento Palavras-chave.
{: caption="do documentoTermos reconhecidos pelo " caption-side="bottom"} de palavras-chave
A partir da visualização JSON do documento, é possível ver a estrutura JSON subjacente da menção palavra-chave Declaration.
Exemplo
Entrada
"Watson Discovery is an award-winning AI search technology."
Resposta
Na saída JSON:
text= O texto de palavra-chavementions= As menções e os locais da entidade
{
"keywords": [
{
"mentions": [
{
"location": {
"end": 157,
"begin": 141
},
"text": "Watson Discovery"
}
],
"text": "Watson Discovery",
"relevance": 0.503613
},
{
"mentions": [
{
"location": {
"end": 177,
"begin": 164
},
"text": "award-winning"
}
],
"text": "award-winning",
"relevance": 0.728722
},
{
"mentions": [
{
"location": {
"end": 198,
"begin": 181
},
"text": "search technology"
}
],
"text": "search technology",
"relevance": 0.779356
}
]
}
Limites de palavras-chave
O enriquecimento Palavras-chave em Palavras-chave pode identificar até 50 palavras-chave, cada uma com uma ou muitas menções, por documento.
Parte do discurso
Reconhece e tags partes de discurso, incluindo substantivos, verbos, adjetivos, advérbios, conjunções, interjeições e numerais.