Definir entidades customizadas
Ensine Discovery sobre termos que são significativos para seus negócios criando um extrator de entidade.
Um extrator de entidade é um modelo de aprendizado de máquina que reconhece e identifica termos que você indica serem significativos para sua necessidade de negócios ou caso de uso. Ao criar um extrator de entidade, você decide o conteúdo e o escopo de informações para localizar e extrair. Seu extrator pode extrair qualquer uma das seguintes coisas:
- Termos que representam objetos, como nomes de vegetais de receitas de culinária ou a marca e modelo de carros de relatórios de acidente
- Atributos de objetos, como cor e quantidade
- Frases curtas, como
107 deaths in France,revenue of $343M
Um tipo de entidade é um tipo de coisa Para criar um extrator de entidade, você define um conjunto de tipos de entidade que você se preocupa. Em seguida, você anota uma coleção de seus próprios documentos localizando termos ou frases que representam o tipo de informações que deseja extrair e rotulando como exemplos de entidade.
Após definir tipos de entidade e rotular exemplos de entidade, é possível gerar um modelo de aprendizado de máquina. O modelo aprende sobre as informações que você se preocupa com base em como os termos ou frases que você rotula como exemplos são referenciados em sentenças. O modelo aprende com o contexto e a linguagem com os quais os exemplos de entidade são referenciados nos dados de treinamento.
Após o modelo de aprendizado de máquina ser treinado o suficiente para reconhecer seus tipos de entidade, é possível publicar o modelo como um enriquecimento e aplicar o enriquecimento a novos documentos. O enriquecimento do extrator de entidade customizada reconhece e identifica novas menções dos mesmos termos e termos semelhantes como ocorrências dos tipos de entidade que você se preocupa.
Para obter mais informações sobre como usar o extrator de entidade para incluir customização de domínio em seus aplicativos de IA, consulte o Recurso do extrator de entidade no Watson Discovery v2 post no blog.
O Discovery também possui um enriquecimento Entidades integrado que pode ser aplicado diretamente à sua coleta. Não requer nenhum treinamento para reconhecer substantivos próprios comumente conhecidos. Para obter mais informações sobre o enriquecimento do Watson NLP Entities, consulte Entidades.
Você já construiu um sistema de tipos de entidade no Knowledge Studio? É possível usar o corpus associado ao seu modelo de aprendizado de máquina como um ponto de início para os dados de treinamento do extrator de entidade. Para obter mais informações, consulte Importando um corpus
Para obter informações sobre os idiomas com os quais o extrator de entidade pode ser usado, consulte Suporte ao Idioma
Vídeo de visão geral do extrator de entidade
Este vídeo fornece uma visão geral de como definir tipos de entidade customizados e, em seguida, usá-los para extrair termos de interesse de seus dados..
Para ler uma transcrição do vídeo, abra o vídeo no site YouTube.com, clique no ícone Mais ações e, em seguida, escolha Abrir transcrição.
Exemplo
Se você estiver familiarizado com o enriquecimento Entidades integradas, saberá que o enriquecimento pode reconhecer termos que correspondem a categorias generalizadas, como Person e Location. Com o extrator de entidade,
você controla quais termos ou frases são significativos.
A imagem a seguir mostra os termos que um enriquecimento que reconhece menções de tipo de entidade family members pode extrair do texto. O exemplo ilustra como menções de membros da família e outras menções de entidade (que são
reconhecidas pelo enriquecimento de Entidades integradas) podem ser previstas.
Este trecho vem do Capítulo 3 de Orgulho e Preconceito de Jane Austen.
Antes de Iniciar
Localize ou crie uma coleção com documentos que tenham vários exemplos dos tipos de entidade sobre os quais você deseja que o Discovery aprenda. Para ensinar o extrator, deve-se rotular exemplos de tipos de entidade É possível rotular exemplos somente se a sua coleção contiver exemplos válidos Tente localizar documentos que tenham muitos e variados termos que funcionem como exemplos de cada tipo de entidade que você deseja definir.
Incluindo um extrator de entidade
Para adicionar um extrator de entidades, conclua as etapas a seguir:
-
Abra o projeto no qual você deseja criar o extrator de entidades.
O projeto deve ter pelo menos uma coleção com documentos representativos de seus dados de domínio.
-
No painel Ferramentas de melhoria da página Melhorar e customizar, expanda Ensinar conceitos de domínio e, em seguida, clique em Extrair entidades.
-
Clique em Novo.
Se desejar criar um extrator de entidade que seja baseado no sistema de tipos de entidade a partir de um corpus IBM Watson® Knowledge Studio, clique na seta e, em seguida, escolha Importar um corpus Knowledge Studio. Para as próximas etapas, consulte Importando um Knowledge Studio corpus.
-
Inclua um nome do extrator e opcionalmente uma descrição.
Esse nome é usado como o nome do modelo e como o nome do enriquecimento que é criado quando você publica o modelo O nome é exibido como o nome do enriquecimento na página Enriquecimentos onde você e outros podem aplicá-lo a coleções. Ele também é exibido como o nome do modelo na representação JSON de documentos nos quais as entidades customizadas são localizadas O nome é armazenado com a capitalização e o espaçamento que você especificar.
-
Escolha uma coleção com documentos representativos de seus dados de domínio.
-
Escolha campos do documento para mostrar na visualização do documento em que você rotulará documentos da coleção.
- O Título do documento é mostrado no cabeçalho da página como o nome do documento Escolha um campo que tenha um valor exclusivo por documento, tal como o nome do arquivo, que é armazenado no campo
extracted_metadata.filename - Corpo do documento é onde você rotula os exemplos de entidade Escolha um campo que contenha a massa do conteúdo do documento, como o campo
text..
Label documents page - O Título do documento é mostrado no cabeçalho da página como o nome do documento Escolha um campo que tenha um valor exclusivo por documento, tal como o nome do arquivo, que é armazenado no campo
-
Clique em Criar.
Um documento da coleção selecionada é exibido na visualização Documentos do Rótulo. Você rotulará ocorrências dos tipos de entidade que deseja que a Descoberta reconheça a partir deste e de outros documentos na coleção
Se nenhum texto for exibido no corpo da página, inicie novamente agora criando um novo extrator de entidade Desta vez, quando você selecionar um valor para o campo Corpo do Documento, certifique-se de escolher um campo de seus documentos processados que contenha texto.
Definindo tipos de entidade
Defina os tipos de entidade concluindo as etapas a seguir:
-
Clique em Adicionar um tipo de entidade.
-
Inclua o nome do tipo de entidade e uma descrição opcional..
Use uma Convenção de nomenclatura que funcione para seus dados O enriquecimento Entidades integradas usa maiúsculas iniciais e nenhum espaço, por exemplo,
EmailAddress. Para distinguir suas entidades de entidades que são extraídas por outros enriquecimentos, talvez você queira usar uma convenção diferente. -
Opcional: Selecione a cor a ser usada para destacar o texto no documento que você deseja rotular como um exemplo desse tipo de entidade
É possível clicar em uma cor na paleta Cor do rótulo, clicar no ícone Renovar Cor para a guia de uma cor para a próxima. Para usar uma cor customizada, especifique seu código de cor hexadecimal (#fff0f7).
-
Clique em Criar.
-
Repita esse processo para incluir todos os tipos de entidade que você deseja que o extrator reconheça
Se você não tiver certeza do que incluir para os tipos de entidade, poderá ajudar a revisar os documentos na coleção primeiro Ao revisar o conteúdo, você pode ter uma ideia de quais termos têm significado significativo e procurar maneiras lógicas de agrupar tais termos.
Rotular termos significativos
Na visualização Documentos de rótulo, localize termos de significância nos documentos de sua coleta e rotule-os para indicar seus tipos de entidade.
Antes de iniciar a rotulagem de documentos, decida se deseja manter a rotulagem em massa ativada. O recurso de rótulo em massa é uma ótima maneira de acelerar o processo de rotulagem de seus documentos. Quando ativado, cada termo que você rotula é rotulado automaticamente em qualquer lugar que ocorra no documento. Caso contrário, você deve rotular cada ocorrência do termo um por vez.
Se você decidir que não deseja obter exemplos de rótulo em massa, configure o comutador Exemplos de entidade de rótulo em massa para Desativado. Para obter mais informações, consulte Exemplos de rotulagem em massa.
Dicas de rotulagem
Revise estas dicas antes de iniciar:
- A coleção de documentos que você rotula deve conter um conjunto de documentos representativo. Os documentos devem ter muitos e variados exemplos dos tipos de entidade que você deseja que o extrator de entidade reconheça Se a coleção selecionada quando você começou a criar o extrator de entidade não atender ao requisito, pare agora e inicie novamente com uma coleção de documentos diferente.
- Defina os tipos de entidade que são claramente diferentes uns dos outros
- O objetivo é rotular pelo menos 40 exemplos de cada tipo de entidade
- Rotule cada exemplo válido de um tipo de entidade.. Não ignore quaisquer ocorrências Para acelerar o processo, use o recurso de etiqueta em massa.
Rotulando exemplos de entidade
Rotule os termos no documento que representam exemplos dos tipos de entidade definidos. Quando terminar com um documento, alterne o status do documento de Em andamento para Concluídoe, em seguida, mova para o próximo documento
Para rotular exemplos de entidade, conclua as seguintes etapas:
-
Revise o texto do documento.. Procure exemplos de entidade a serem rotulados
A tabela a seguir mostra alguns exemplos.
Tipos de entidade e exemplos Tipo de entidade Exemplos para rotular no documento cor branco, verde, roxo car conversível, SUV, sedan AUTO_MODEL Explorer, Civic, Sorrento auto_fabricante Ford, Honda, Kia roupas camisa, blusa, skort instrumentos obrigações, acções, ETFs, munis Se um tipo de entidade que você deseja identificar ainda não tiver sido criado, inclua o tipo de entidade No painel Tipos de entidade, clique em Criar novo. Para obter mais informações sobre como incluir tipos de entidade, consulte Definindo tipos de entidade.
-
Primeiro, clique no tipo de entidade no painel Tipos de entidade.
-
No corpo do documento, selecione a palavra ou frase que representa o exemplo de entidade..
O termo é selecionado, e um rótulo de cor é aplicado ao termo. Os dois primeiros caracteres do nome do tipo de entidade são mostrados em maiúsculas sobrescritos dentro do limite do rótulo. O ID de 2 caracteres e a cor do rótulo ajudam a associar o exemplo ao tipo de entidade que ele representa.
A label is applied to an entity example O texto de exemplo também é incluído no painel Tipos de Entidade Se você clicar na divisa para visualizar detalhes, poderá ver que o exemplo está listado. O texto de exemplo é salvo em letras minúsculas, independentemente da capitalização que é usada no texto original.
-
Se a rotulagem em massa estiver ativada, uma notificação será exibida para mostrar o número de ocorrências do termo que foram localizadas e rotuladas no documento atual
-
Se você desejar rotular ocorrências do termo em todos os documentos na coleta, clique em Aplicar a todos os documentos
Ao ativar essa opção, as ocorrências do termo são rotuladas em todos os documentos na coleção, incluindo documentos que você já revisou e marcou como concluídos.
Você é solicitado a confirmar a ação porque ela não pode ser desfeita. Se você não desejar ter que confirmar a ação toda vez que optar por aplicar a rotulagem em massa a todos os documentos, selecione Não solicitar confirmação novamente Clique em ** Executar **.
Bulk labeling configuration confirmation Para obter mais informações, consulte Exemplos de rotulagem em massa.
-
Role pelo documento para identificar cada exemplo válido de cada tipo de entidade que você deseja que seu extrator reconheça.
É possível procurar termos que deseja rotular como exemplos de entidade. Para obter mais informações, consulte Procurando exemplos usando palavras-chave.
O modelo de aprendizado de máquina aprende tanto dos termos que você não rotula como os termos que você faz.
Se você não desejar rotular um exemplo válido, o modelo aprenderá que quando o termo for usado nesse contexto, ele não será uma menção válida do tipo de entidade Em alguns casos, uma omissão é apropriada Por exemplo, alguns termos têm significados diferentes em contextos diferentes. " Você não deseja rotular o termo quando ele for usado no contexto errado No entanto, se o termo for usado no contexto certo e você não rotulá-lo, você está ensinando o modelo a ignorá-lo. Você diminui a efetividade do modelo quando seus dados de treinamento estão inconsistentes
Depois de rotular muitos exemplos, as sugestões de exemplo de entidade são exibidas É possível aceitar ou rejeitar as sugestões de exemplo de entidade
Decide whether to accept a suggestion Aceitar sugestões de exemplo é outra maneira de acelerar o processo de rotulagem. Para obter mais informações, consulte Sugestões de exemplo de entidade.. Depois de aceitar uma sugestão, você pode rotular o termo em massa
-
Se você cometer um erro e rotular a palavra errada ou uma palavra foi rotulada incorretamente pelo processo de rotulagem em massa, você pode excluir a etiqueta..
Passe o mouse sobre a palavra rotulada até que a opção Excluir este exemplo seja exibida e, em seguida, clique nela É possível optar por excluir apenas essa menção ou todas as menções no documento. Faça uma escolha e, em seguida, clique em Excluir
-
Após rotular todos os exemplos de entidade no documento atual, altere o status do documento de Em andamento para Concluído.
Outro documento da coleção é exibido..
-
Exemplos de rótulo de seus tipos de entidade em cada documento na coleção
A qualquer momento durante o processo de rotulagem, é possível clicar em Salvar extrator de entidade para salvar seu trabalho..
-
Se você não tiver exemplos suficientes no conjunto atual de documentos, poderá incluir mais documentos.
No painel Lista de documentos, clique em Incluir documentos. A opção está disponível apenas quando mais documentos estão disponíveis na coleção.. Você pode adicionar até 20 documentos. Se a rotulagem em massa para todos os documentos estiver ativada, os rótulos serão aplicados aos documentos recém-incluídos automaticamente..
-
Depois de rotular exemplos em quantos documentos na coleção você deseja, clique em Salvar extrator de entidade e, em seguida, abra a página Treinar extrator.
Procurando exemplos usando palavras-chave
Usando o recurso de procura, é possível localizar exemplos de entidade em um documento e rotulá-los facilmente.. Também é possível usar a procura para localizar exemplos rotulados e exemplos não rotulados e corrigir quaisquer inconsistidades de rotulagem
Para procurar usando palavras-chave, conclua as etapas a seguir:
-
Na visualização Documentos de Rótulo, clique no ícone Localizar.
-
No campo Localizar, especifique uma palavra-chave para procurar no documento.
Os resultados da procura do documento são exibidos quando você insere a palavra-chave.
Para procurar os resultados da procura, é possível clicar nos ícones Próximo resultado e Resultado anterior Para escolher um rótulo para um exemplo não rotulado no resultado, clique no ícone Editar rótulo e selecione um rótulo Também é possível remover um rótulo de um exemplo já rotulado no resultado clicando no ícone Editar rótulo.
-
Para filtrar os resultados da procura, clique no ícone Mostrar opções de filtro..
A tabela a seguir descreve as opções de filtro.
Opções de filtro na localização Opção Descrição All Localizar todos os exemplos em um documento que correspondem à palavra-chave. Texto rotulado Para localizar exemplos rotulados existentes em um documento que correspondam à palavra-chave Texto não rotulado Para localizar exemplos não rotulados em um documento que corresponda à palavra-chave. Corresponder maiúsculas e minúsculas Para localizar exemplos que correspondem à palavra-chave e a seu caso. Palavras inteiras Para localizar exemplos que correspondem aos limites de palavra da palavra-chave. Por exemplo, se você especificar york como a palavra-chave, yorktown não será correspondente quando essa opção for selecionada.
Para os exemplos não rotulados nos resultados, é possível aceitar ou rejeitar uma sugestão de rótulo
Para resolver quaisquer exemplos de sobreposição, clique em Revisar sugestões e escolha uma sugestão de exemplo de entidade na caixa de diálogo Sugestões de exemplo de entidade de sobreposição.
Rotulando exemplos em massa
Para a maioria dos exemplos de entidade, a ativação do recurso de rótulo em massa é útil Você pode querer ignorá-lo se um termo tiver mais de um significado em contextos diferentes Nesse caso, avalie cada ocorrência individualmente. Lembre-se, se você ativar o recurso de rótulo em massa, será possível verificar a precisão dos rótulos que foram incluídos automaticamente e fazer correções quando necessário conforme você revisar o documento.
Após ativar o recurso de rótulo em massa, é exibida uma notificação indicando quantas ocorrências de um exemplo de entidade foram localizadas no documento atual. Na página atual, a ferramenta de rotulagem não pode acessar outros documentos para relatar quantas ocorrências existem em outros documentos da coleção. No entanto, a contagem de menções é mostrada no painel Tipos de Entidades Quando você abre pela primeira vez outros documentos, é possível verificar as contagens de menções para ver quantas menções foram rotuladas automaticamente
O recurso de rótulo em massa perdeu uma ocorrência?
Ocorrências do termo não serão rotuladas se ocorrerem na mesma frase na qual o termo já está rotulado. Por exemplo, a primeira ocorrência do termo husband não é rotulada quando o recurso de rótulo em massa é ativado para a segunda
ocorrência do termo na sentença a seguir:
Sugestões de exemplo de entidade
Depois de rotular exemplos suficientes, os exemplos de tipo de entidade sugeridos são exibidos O sistema aprende com os tipos de exemplos que você rotula e aplica o que ele aprende para identificar possíveis novos exemplos. Por exemplo, após
rotular red, orange, yellow, green e blue como exemplos do tipo de entidade color, o painel Sugestões de Exemplo pode mostrar indigo e violet como exemplos sugeridos para você rotular. Sugestões não são exibidas até que você rotule muitos exemplos de um tipo de entidade.
O exemplo a seguir mostra sugestões que são feitas para menções de familiares.
Você pode notar que um termo que você escolheu para rótulo em massa não está rotulado, mas é exibido como uma sugestão. Um termo é ignorado nas seguintes situações:
- O termo pode ocorrer em diferentes frases nominais em diferentes seções do documento Por exemplo, o termo
fatherpode ocorrer nas frases nominaisthe kindest *father*eto her *father*.. Quando uma palavra é incluída em uma frase nominal com adjetivos, o significado pode mudar. Portanto, tais termos às vezes são sugeridos em vez de rotulados automaticamente. - Uma palavra pode ser um exemplo válido sozinha e como parte de uma menção de várias palavras. Por exemplo, uma menção de
IBMpode se referir à empresa International Business Machines, Corp. ou pode ser usada como parte do nome de um produto, como IBM Cloud Pak for Data. No entanto, uma palavra ou frase pode fazer parte de apenas um exemplo. Rótulos de exemplo não podem se sobrepor uns aos outros. Portanto, você deve escolher qual sugestão de exemplo é mais precisa. Neste exemplo, em que o termo IBM é usado como parte de um nome de produto, é mais preciso rotular a frase completa como um exemplo do tipo de entidadeProduct. - O serviço pode reconhecer que um termo é um possível exemplo de mais de um tipo de entidade.. Por exemplo, a palavra
toppode significar o melhor ou camisa.
Para investigar uma sugestão, clique nela para ver a palavra no contexto dentro do documento. Ver o termo no contexto ajuda a decidir se a ocorrência é um exemplo de entidade válido para você rotular.
Exportando dados rotulados para um extrator de entidade
É possível exportar os dados rotulados para um extrator de entidade do Discovery. É possível usar os dados rotulados exportados para treinar ou construir grandes modelos de linguagem (LLMs) em um serviço como Watson Studio e Natural Language Processing (NLP).
Para exportar os dados rotulados, conclua as etapas a seguir:
-
No painel Ferramentas de Aprimoramento da página Melhorar e Customizar, expanda Ensinar Conceitos de Domínioe, em seguida, clique em Extrair entidades.
-
Para o extrator de entidade do qual você deseja exportar dados rotulados, clique no ícone Ações e, em seguida, selecione Fazer download de dados rotulados.
Um arquivo compactado é transferido por download com dados rotulados.. O arquivo compactado contém os seguintes arquivos JSON.
labeled_data.json: inclui o texto e rótulos. O formato de dados é baseado no formato de dados de entrada para extração de entidade no Watson Natural Language Processing. Para obter mais informações, consulte Formato de dados de entradametadata.json: Inclui metadados para a área de trabalho e dados rotulados
Importando um corpus do Knowledge Studio
Para implementações instaladas, o recurso de importação foi incluído com a liberação do 4.6.2
É possível importar um corpus de documentos que foram anotados em IBM Watson® Knowledge Studio para usar como dados de treinamento para um extrator de entidade em Discovery.
Os tipos de entidade que foram definidos em Knowledge Studio são mostrados como novos tipos de entidade em Discovery. É possível continuar a anotar os documentos importados quando você customizar o modelo do extrator de entidade
Os subtipos de entidade e as relações do modelo de aprendizado de máquina Knowledge Studio não são representados, assim como nenhum dicionário customizado que esteja associado ao modelo.
Antes de poder importar um corpus, deve-se exportar o conjunto de documentos de Knowledge Studio como um arquivo .zip. Siga as etapas apropriadas para exportar com base no tipo de implementação do Knowledge Studio:
Embora seja necessário fazer download do conjunto de documentos e do sistema de tipos para incluir anotações em documentos transferidos por upload para outra área de trabalho Knowledge Studio, o mesmo não é verdadeiro neste caso de uso. Você importa apenas o documento configurado para Discovery. Quaisquer anotações nos documentos são recriadas em Discovery. O sistema de tipos Knowledge Studio não é necessário.
Para importar um corpus do Knowledge Studio, conclua as etapas a seguir:
-
Abra o projeto para o qual você deseja importar o corpus.
-
No painel Ferramentas de melhoria da página Melhorar e customizar, expanda Ensinar conceitos de domínio e, em seguida, clique em Extrair entidades.
-
Clique na seta associada ao botão Novo. e, em seguida, clique em Importar um Knowledge Studio corpus.
-
Inclua um nome do extrator e opcionalmente uma descrição.
Esse nome é usado como o nome do modelo e como o nome do enriquecimento que é criado quando você publica o modelo O nome é exibido como o nome do enriquecimento na página Enriquecimentos onde você e outros podem aplicá-lo a coleções. Ele também é exibido como o nome do modelo na representação JSON de documentos nos quais as entidades customizadas são localizadas O nome é armazenado com a capitalização e o espaçamento que você especificar.
-
Clique em Fazer upload e, em seguida, procure e selecione o arquivo .zip que você exportou do Knowledge Studio. Clique em Criar.
Os documentos anotados transferidos por upload são armazenados com a área de trabalho do extrator de entidade, não como uma nova coleção no projeto. É possível continuar a anotar os documentos
Dê ao Discovery algum tempo para importar e processar o corpus do modelo de aprendizado de máquina. Após o extrator de entidade ser criado, o extrator é aberto para a página Documentos de rótulo.
Treinando o extrator
Após rotular documentos, revise os dados de treinamento que serão usados para treinar o modelo do extrator de entidade.
Para treinar o extrator, conclua a etapa a seguir:
-
Decida se você deseja aplicar uma opção avançada. A maioria dos modelos não requer mudanças para essas opções
As customizações a seguir estão disponíveis na página Revisar e concluir:
-
Incluir documentos que não foram revisados por uma pessoa no conjunto de treinamento..
Geralmente, apenas os documentos que uma pessoa rotulou, revisou e marcou explicitamente como concluídos podem ser candidatos para inclusão no conjunto de treinamento No entanto, se você desejar permitir que documentos que não foram marcados como completos sejam incluídos no conjunto de treinamento, poderá fazer isso.
-
Altere a proporção de documentos incluídos nos conjuntos de documentos que compõem seus dados de treinamento.
Os documentos de sua coleção são divididos aleatoriamente nos seguintes conjuntos:
- Conjunto de treinamento: os documentos que você rotula e que são usados para treinar o modelo de machine learning do extrator de entidade. O objetivo do conjunto de treinamento é ensinar o modelo de aprendizado de máquina sobre rótulos corretos.
- Conjunto de teste: os documentos usados para testar o modelo treinado. Depois de executar um teste, é possível revisar os resultados, analisar de perto as áreas em que o modelo obteve algo errado e encontrar maneiras de melhorar o desempenho do modelo
- Conjunto cego: documentos que são separados e usados para testar o modelo periodicamente após várias iterações de teste e melhoria serem concluídas. Os documentos no conjunto cego são intencionalmente ligados. Ao testar o modelo com documentos do conjunto de testes e analisar os resultados, você se familiariza com os documentos de teste subjacentes. Como os documentos de teste são usados iterativamente para aprimorar o modelo, eles podem começar a influenciar indiretamente o treinamento do modelo. É por isso que o conjunto cego de documentos é tão importante. O conjunto cego fornece uma maneira de gerar uma avaliação imparcial do modelo periodicamente.
A divisão padrão aplica uma razão (70 %-23 %-7%) que é comumente usada para o treinamento de aprendizado de máquina
-
-
Clique em Treinar Extrator
Ao treinar o extrator, o Discovery usa documentos do conjunto de treinamento para construir um modelo de aprendizado de máquina. Após o modelo ser gerado, ele executa um teste com relação aos documentos do conjunto de testes automaticamente. Os resultados do teste são exibidos para revisão.
Solucionar problemas de treinamento
Saiba sobre possíveis mensagens de erro e como abordá-las.
- Os dados de treinamento são muito grandes. "
-
Seus dados de treinamento contêm documento de texto grande ou muitos tipos de entidade e recursos que são necessários para processar os dados são maiores que os recursos que estão disponíveis para sua instância de serviço. Esse erro pode ocorrer mesmo quando a sua área de trabalho não exceder os limites do extrator de entidade documentada Para resolver o problema, você pode tentar uma das seguintes abordagens:
- Remova um ou mais tipos de entidade para diminuir o tamanho dos dados de treinamento.
- Remova os documentos extra grandes dos dados de treinamento Por exemplo, se um dos documentos rotulados for muito grande, mude seu status de Concluído para Em andamento para omitir dos dados de treinamento.
- Reduza o número de documentos incluídos no conjunto de treinamento. A razão de divisão padrão (70 %-23 %-7%) para os dados de treinamento usa 70% dos documentos no conjunto de treinamento.. É possível alterar a porcentagem dos documentos que são usados no conjunto de treinamento para um número menor Por exemplo, você pode alterar a proporção de divisão para 60 %-33 %-7%
- IBM Cloud Pak for DataIBM Software Hub Aumente a capacidade de sua instância de serviço implantada dimensionando os pods de serviço.
Avaliando o extrator
Para revisar métricas da execução de teste do modelo do extrator de entidade que você criou, clique na guia Avaliar extrator.
A tabela a seguir descreve as métricas de avaliação disponíveis.
| de Métrica | Descrição |
|---|---|
| Matriz de Confusão | Uma tabela que fornece um detalhamento numérico de conjuntos de documentos anotados. Use-o para comparar menções de tipo de entidade que são rotuladas pelo modelo de aprendizado de máquina com menções de tipo de entidade que são rotuladas nos dados de treinamento |
| Pontuação F1 | Mede se o equilíbrio ideal entre precisão e rechamada é atingido. A pontuação F1 pode ser interpretada como uma média ponderada dos valores de precisão e rechamada. Uma pontuação F1 atinge seu melhor valor em 1 e pior valor em 0. As pontuações gerais serão menores se o modelo não tiver dados de treinamento suficientes para aprender. |
| Precisão | Mede quantas das menções extraídas gerais são classificadas como o tipo de entidade correto Um falso positivo é quando uma entidade não deve ser extraída, mas foi extraída (Previsto = Positivo, Real = Negativo). Os falsos positivos geralmente significam baixa precisão |
| Rechamar | Mede com que frequência menções de tipo de entidade que devem ser extraídas são extraídas. Um falso negativo é quando um tipo de entidade deve ser extraído, mas não foi extraído (Previsto = Negativo, Real = Positivo). Os falsos negativos geralmente significam baixa rechamada. |
-
Revise as métricas que são fornecidas sobre a execução do teste de modelo do extrator para determinar se mais treinamento é necessário.
-
Explore os resultados de teste em mais detalhes clicando em Revisar resultados de treinamento no conjunto de testes
Os documentos do conjunto de testes são exibidos com os rótulos previstos mostrados em um painel e a verdade absoluta mostrada no outro.
- Rótulos previstos são os exemplos que o extrator de entidade identificou e rotulou como tipos de entidade.
- A verdade absoluta tem exemplos de que uma pessoa rotulou ou que foram rotulados em massa e revisados por uma pessoa Os rótulos na verdade absoluta são considerados os rótulos corretos.
O desempenho do modelo é classificado com base em quão próximo os rótulos previstos correspondem à verdade absoluta..
Melhorando o extrator
A tabela a seguir mostra correções sugeridas para problemas comuns.
| Problema | Ação para remediar o problema |
|---|---|
| Baixas pontuações gerais | Você pode não ter documentos suficientes com exemplos rotulados em seu conjunto de treinamento. Rotule mais exemplos em mais de seus documentos |
| Baixa rechamada | Rotule mais documentos com novos exemplos dos tipos de entidades que o extrator perdeu. |
| Baixa precisão | Procure os tipos de entidade que são comumente confusos Localize e rotule mais exemplos de cada tipo de entidade para ajudar o extrator de entidade a distinguir entre os tipos de entidade |
Incluindo documentos nos dados de treinamento
Para adicionar mais documentos, conclua as etapas a seguir:
-
Abra a guia Documentos de Rótulo
-
No painel Lista de documentos, escolha Incluir documentos.
Esse botão será desativado se nenhum outro documento estiver disponível para ser incluído no extrator de entidade da coleção atual. Para incluir mais documentos na coleção, acesse a página Atividade da coleção e, em seguida, clique no bloco Fazer upload de dados para procurar e incluir mais arquivos.
Não é possível escolher os documentos da coleção para mostrar na Lista de documentos para propósitos de rotulagem. Se houver tipos específicos de documentos que você deseja rotular, considere incluir documentos representativos em uma coleção que você possa usar para criar o extrator de entidade.
Há limites para o número de documentos que podem ser incluídos nos dados de treinamento Se seus dados de treinamento incluírem documentos com uma combinação de seções que são rotuladas e outras que não são, o sistema poderá experimentar alguns exemplos de sentenças não rotuladas. A subamostragem ajuda a equilibrar o número de exemplos positivos e negativos usados para treinamento. Equilibrar os exemplos no conjunto de treinamento melhora o desempenho do treinamento.
Publicando o extrator de entidade como um enriquecimento
Quando você achar que o extrator de entidade está pronto, publique o extrator de entidade Como sabe quando está pronto? Se a pontuação não for alterada após várias execuções de teste nas quais você faz melhorias, o modelo estará pronto É possível retornar para atualizar e retreinar o modelo após publicá-lo.
- Na página Avaliar extrator, clique em Publicar extrator.
- Clique em Aplicar aos dados.
- Escolha uma coleção e, em seguida, selecione o campo de documento no qual você deseja que o enriquecimento do extrator de entidade seja aplicado
- Clique em Aplicar.
Exportando o extrator de entidade
Para as implementações instaladas, o recurso de exportação foi incluído com a liberação 4.6.2
Um modelo do extrator de entidade que você cria e implementa em um projeto está disponível como um enriquecimento que pode ser aplicado a uma coleta de qualquer projeto na mesma instância de serviço.
Se desejar usar o modelo do extrator de entidade em um projeto de outra instância de serviço, será possível exportar o extrator de entidade. Para usá-lo em outro lugar; siga as etapas para criar um modelo de aprendizado de máquina em Usar modelos de ML importados para localizar termos customizados. Não é possível continuar a editar um extrator de entidade importado para outro projeto.
O extrator de entidade que você deseja exportar deve ser totalmente treinado
Para exportar um extrator de entidade, conclua as etapas a seguir:
-
Abra o projeto com o extrator de entidade que você deseja exportar
-
No painel Ferramentas de melhoria da página Melhorar e customizar, expanda Ensinar conceitos de domínioe, em seguida, clique em Extrair entidades.
-
Na lista Extratores de entidade, localize o extrator de entidade que deseja exportar.
-
Clique no ícone Ações para seu extrator e, em seguida, escolha Fazer download do modelo para salvar o modelo no sistema.
A opção Fazer download do modelo não está disponível, a menos que o modelo seja treinado
O modelo do extrator de entidade é salvo em um arquivo .ent. É possível importá-lo para um projeto em outra instância de serviço como um modelo de aprendizado de máquina e, em seguida, aplicá-lo em suas coleções Para obter mais informações sobre como importar o modelo, consulte Usar modelos de ML importados para localizar termos customizados
Aplicando um enriquecimento do extrator de entidade
Ao publicar o extrator, você especifica o campo no qual deseja que o extrator seja aplicado Se você decidir aplicar o enriquecimento a diferentes ou mais campos posteriormente, será possível seguir essas etapas para fazer isso:
- No painel de navegação, clique em Gerenciar coleções.
- Clique para abrir a coleção na qual você deseja aplicar o enriquecimento.
- Clique em Enriquecimentos
- Localize o nome do extrator de entidade na lista e, em seguida, escolha um campo para aplicar o enriquecimento.
- Clique em Aplicar mudanças e processar novamente.
Para obter mais informações sobre como remover um enriquecimento de extrator de entidade de uma coleta, consulte Gerenciando enriquecimentos.
Saída do extrator de entidade
Quando o enriquecimento reconhece uma de suas entidades customizadas em um documento, uma entrada é incluída na seção enriched_text.entities da representação JSON do documento.. A seção contém ocorrências de entidades que são
reconhecidas por seu modelo customizado juntamente com entidades que são reconhecidas pelo enriquecimento Entidades integradas. O enriquecimento integrado usa o serviço NLP do Watson para entidades de identidade que fazem parte do que ele
chama de sistema de tipos Natural Language Understanding. Para obter mais informações sobre o enriquecimento de entidades integradas, consulte Entidades.
A saída JSON a seguir é produzida por um modelo customizado denominado literatura que reconhece menções de membros de família.
Monitorando o desempenho ao longo do tempo
É possível treinar novamente o modelo do extrator de entidade a qualquer momento Cada vez que você treinar o modelo, revise as pontuações de métrica de desempenho para determinar se as mudanças mais recentes aumentam ou diminuem as pontuações do modelo.
-
Para comparar uma execução de teste com outra, clique em Visualizar histórico de pontuação.
A visualização de histórico mostra as últimas 5 execuções de treinamento
Para reter as informações de pontuação para mais do que as 5 execuções de treinamento mais recentes, é possível exportar as métricas no formato de valor separado por vírgula e controlar as pontuações em um aplicativo separado... Clique no ícone de representação tabular
e, em seguida, clique em Download como CSV.
Se uma execução de treinamento subsequente resultar em pontuações inferiores, não publique essa versão do modelo..
Excluindo um extrator de entidade
É possível excluir um extrator de entidade se ele não estiver em uso, o que significa que o enriquecimento publicado a partir do extrator de entidade não é aplicado a uma coleta.
Você pode desejar excluir um extrator de entidade se atingir o limite para o número máximo de extratores que são permitidos para seu plano, por exemplo.
Lembre-se, os limites são definidos por instância de serviço, não por projeto. Se não for possível criar novos extratores de entidade, mas não tiver o número máximo de extratores no projeto atual, verifique outros projetos na mesma instância do serviço Pode haver extratores de entidade que não estão sendo usados em outros projetos que podem ser excluídos
-
Remova o enriquecimento do extrator de entidade que foi publicado do extrator de entidade que você deseja excluir de quaisquer coleções nas quais ele está sendo usado.
Para obter mais informações, consulte Excluindo enriquecimentos..
-
No painel Ferramentas de melhoria da página Melhorar e customizar, expanda Ensinar conceitos de domínio e, em seguida, clique em Extrair entidades.
-
Localize o extrator de entidade que deseja excluir, clique no ícone Ações e selecione Excluir.
Limites do extrator de entidade
O número de extratores de entidade que podem ser criados por instância de serviço depende do tipo de plano Discovery.
| Plano | Extratores de entidade por instância de serviço[1] . | Máximo de tipos de entidade por extrator | Máximo de documentos em dados de treinamento |
|---|---|---|---|
| Cloud Pak for Data | Ilimitada | 18 | 1.000 |
| Premium | 22 | 18 | 1.000 |
| Enterprise | 22 | 18 | 1.000 |
| Mais (incluindo Avaliação) | 3 | 12 | 200 |
-
Esse número reflete o número de enriquecimentos do extrator de entidade publicados para a instância de serviço (incluindo a partir de modelos de extrator de entidade importados) se eles são aplicados a uma coleção ou não. ↩︎