Criando anotadores personalizados

Você pode criar um dicionário, expressão regular ou anotador de aprendizado de máquina para gerar novas facetas que podem ajudá-lo a analisar seus dados.

Antes de começar, tenha os seguintes dados prontos.

Dados de pré-requisitos do anotador personalizado
Tipo de anotador Descrição Dados
Dicionário Designa facetas para termos que combinam entradas de dicionário que você define ou faz upload. Você pode, opcionalmente, fazer o upload de um arquivo de termos de dicionário.
Machine learning Designa facetas para menções que são reconhecidas por um modelo de aprendizado de máquina que você faz upload. É necessário um arquivo compactado de um modelo de aprendizado de máquina.
Expressão Regular Designa facetas para texto que corresponde a padrões de expressão regular Java que você define ou faz upload. Você pode, opcionalmente, fazer o upload de um arquivo JSON que contém padrões de expressão regular.

Para criar um anotador personalizado, conclua as etapas a seguir:

  1. A partir da visualização de análise de sua coleção, clique no link Coleções no breadcrumb para abrir a página Criar uma coleção para suas soluções de analytics da aplicação de Mineração de Conteúdo.

  2. Para criar um anotador, clique em collection e, em seguida, selecione annotator personalizado na lista.

    Mostra o menu de
    de

  3. Clique em Criar anotador personalizado.

  4. Dê um nome ao seu anotador e, opcionalmente, adicione uma descrição.

  5. Escolha o tipo anotador e, em seguida, clique em Avançar.

  6. Siga as instruções em tela.

    Para obter mais informações sobre como configurar cada tipo de anotador, consulte uma das seguintes seções:

Configuração do dicionário

Você pode importar um dicionário existente fazendo o upload dele ou você pode criar um dicionário adicionando termos um de cada vez.

Se você planeja importar um dicionário, os termos do dicionário devem ser definidos em um arquivo CSV. Especifique cada termo e seus sinônimos em uma linha separada. Use a sintaxe a seguir para especificar cada termo:

{term},{synonym},{synonym},...

Para adicionar um dicionário, conclua as etapas a seguir:

  1. Execute um dos procedimentos a seguir:

    • Para importar os termos do dicionário:

      1. Clique em Importar e, em seguida, navegue pelo arquivo com seus termos de dicionário.
      2. Clique em Importar.
    • Para definir os termos do dicionário:

      1. Clique em Incluir.
      2. Clique em Lista de palavras para adicionar os termos do dicionário.
      3. Clique em Adicionar e, em seguida, inclua o termo no campo Palavra de Base e quaisquer sinônimos que você deseja definir para o termo no campo Outras palavras. Separe vários sinônimos com vírgulas. Clique em OK.
      4. Repita a etapa anterior para adicionar mais termos de dicionário.
      5. Depois de terminar de adicionar termos de dicionário, clique em Configurações básicas.
  2. Nomeia o dicionário.

  3. Se você planeja definir termos com uma parte de discurso diferente de um substantivo, especifique a parte da fala.

    Se o idioma selecionado for chinês, japonês, coreano ou hebraico, você só poderá especificar Noun para a classe gramatical.

  4. Decida como você quer tratar caso.

    Quando o caso é ignorado, os termos Sat, SAT e sat são todos rotulados como ocorrências do termo de dicionário Sat.

    Ao se deseleger a caixa de seleção Ignorar para criar um dicionário sensível a casos, utiliza-se a forma de superfície do termo com correspondência uppercase. As anotações são adicionadas para o termo exatamente como escrito e para variações do termo em que as letras são maiústicas.

    Por exemplo, uma entrada sat no dicionário resulta em anotações para sat, Sat ou SAT menciona quando elas ocorrem em texto. Para uma entrada Sat no dicionário, são adicionadas anotações para ocorrências de Sat e SAT, mas não para sat.

  5. Identifique o nome da faceta para usar para este dicionário.

    O nome de faceta que você especifica para o anotador é o nome de faceta que é exibido a partir da visualização da pesquisa de coleta.

    Você pode criar uma faceta hierárquica incluindo um período (.) no nome da faceta. Por exemplo, você pode criar um dicionário com o caminho de faceta Food.Vegetables e outros com os caminhos de faceta Food.Fruits e Food.Proteins. Adicionar mais grupos de faceta com mais períodos. Por exemplo, você pode adicionar Food.Proteins.Nuts e Food.Proteins.Meats para categorizar ainda mais as proteínas.

    Mostra como adicionar um
    um

  6. Se você deseja que os documentos que são retornados para uma subfaceta sejam incluídos quando um usuário filtra na faceta raiz, selecione Lift up words.

    Por exemplo, você pode ativar Lift up words para Food.Fruits e Food.Proteins mas não Food.Vegetables. Como resultado, quando um usuário clica na faceta de Alimentos, os documentos devolvidos incluem documentos que mencionam termos incluídos nos dicionários Fruits e Meats, como maçãs e beef.

    Mostra que os documentos com todos os termos, exceto aqueles no dicionário de Vegetais, são retornados quando a faceta de Alimentos é selecionada.
    Dictionary enrichment application

    No entanto, um usuário deve clicar na faceta Alimentação> Vegetais explicitamente para obter documentos que mencionam termos no dicionário de Vegetais, como lettuce, a ser devolvido.

    Mostra que apenas documentos que mencionam vegetais são devolvidos quando a faceta Vegetais é selecionada.
    Subfacets

  7. Repita os passos anteriores para adicionar mais dicionários.

  8. Clique em Salvar.

A partir da página do anotador personalizado, é possível ver dicionários que foram criados em outros projetos, incluindo projetos de Mineração sem Conteúdo. Dicionários de outros tipos de projeto mostram o nome de enriquecimento como nome do anotador. As configurações Ignore case e Lift up words são desativadas e o dicionário é denominado custom dict.

Limites de dicionário

Limites de plano de dicionário
Plano Número de dicionários por instância de serviço Número de palavras de base por dicionário Número de termos para quais sugestões podem ser geradas
Cloud Pak for Data Ilimitada Ilimitada 1.000
Premium 200 10.000 1.000
Enterprise 200 10.000 1.000

Os totais incluem enriquecimentos que você cria neste projeto de Mineração de Conteúdo e em outros projetos na mesma instância de serviço.

Configuração de aprendizagem de máquina

É possível importar um modelo de aprendizado de máquina existente.

Para usar o Discovery para criar um modelo, consulte Entity extractor.

Para importar um modelo, conclua as etapas a seguir:

  1. Clique em Selecionar arquivo e, em seguida, navegue pelo arquivo do modelo de aprendizado de máquina.

  2. No campo Caminho da Facet, especifique o nome da faceta raiz para usar para o modelo.

    O nome de faceta que você especifica para o anotador é o nome de faceta que é exibido a partir da visualização da pesquisa de coleta.

  3. Clique em Salvar.

Limites do modelo de aprendizado

Limites de plano do modelo ML
Plano Modelos de ML por instância de serviço
Cloud Pak for Data Ilimitada
Premium 22
Enterprise 22

Os totais incluem enriquecimentos que você cria neste projeto de Mineração de Conteúdo e em outros projetos na mesma instância de serviço.

Configuração de expressões regulares

Você pode importar padrões existentes carregando-os em um arquivo JSON ou você pode adicionar padrões.

Para adicionar padrões, conclua as etapas a seguir:

  1. Inclua o padrão de expressão regular no campo Novo padrão e, em seguida, clique em Adicionar.

  2. Especifique um nome para o padrão e, em seguida, identifique o nome da faceta para usar para este padrão.

    O nome de faceta que você especifica para o anotador é o nome de faceta que é exibido a partir da visualização da pesquisa de coleta.

  3. Opcional: Especificar um valor de faceta. Você pode especificar um valor a partir das opções que estão descritas na tabela.

    Opções de valor de faceta de expressão regular
    Valor do Fachet Descrição
    $0 Exibe o texto correspondido como-é.
    $n Se o seu padrão de expressão regular contém grupos, você pode especificar um número de grupo para retornar o texto correspondido somente do grupo de padrões. Por exemplo, se sua expressão regular consiste de 3 grupos que definem um padrão de número de telefone dos EUA, como (\d{3})-(\d{3})-(\d{4}), e você deseja retornar apenas a parte de código da área do número do telefone, você pode especificar $1. Se o texto correspondido for 212-555-1234, então o valor da faceta será exibido como 212. Especifique apenas um grupo como o valor de aspecto para os padrões que você sabe que retornarão correspondências..
    {prefix-text}:$0 Acrescenta texto codificado em frente ao nome de faceta. Você pode querer usar esta opção se quiser distinguir facetas que são geradas por essa expressão regular de facetas que são semelhantes mas geradas de alguma outra maneira. Por exemplo, MyRegex:$0 resulta em uma faceta denominada MyRegex:212-555-1234.
  4. Clique em Salvar.

Para importar padrões, conclua as etapas a seguir:

  1. Defina os padrões que você deseja adicionar em um arquivo JSON.

    A definição de padrão deve utilizar a seguinte sintaxe:

    [
      {
        "name": "US Phone number",
        "description": "US mobile phone number",
        "pattern": "(\\d{3})-(\\d{3})-(\\d{4})",
        "facetPath": ".regex.usphonenumber",
        "facetValue": "$0"
      }
    ]
    

    Tenha em mente as observações a seguir:

    • Os padrões devem ser definidos em uma matriz, mesmo que você planete definir apenas um padrão.
    • Escape qualquer barra backslash (\) com uma barra invernada.
    • Para obter mais informações sobre as opções de valor da faceta, consulte a tabela Opções de valor da faceta de expressão Regular.
  2. Clique em Importar e, em seguida, escolha o arquivo JSON onde os padrões estão definidos.

  3. Clique em Salvar.

Limites de expressão regular

Limites de plano de expressão regular
Plano Enriquecimentos de regex por instância de serviço Padrões de regex por instância de serviço
Cloud Pak for Data Ilimitada Ilimitada
Premium 100 50
Enterprise 100 50

Os totais incluem enriquecimentos que você cria neste projeto de Mineração de Conteúdo e em outros projetos na mesma instância de serviço.

Aplicando o anotador

Depois que o anotador é criado, você deve aplicá-lo em sua coleção.

  1. A partir do Criar um anotador personalizado para suas soluções de analytics página do aplicativo Content Mining, clique em custom annotator e, em seguida, selecione collection da lista.

  2. No azulejo para sua coleção, clique no ícone opções e escolha Editar coleção.

  3. Clique na guia Enrichment (Enriquecimento ) e selecione o anotador que você criou.

    Talvez você precise rolar a tela para encontrá-la.

  4. Clique em Salvar e confirme a ação.

Dê o tempo de índice para reconstruir.

Filtrando documentos com sua faceta

  1. Clique no azulejo da coleção para abrir sua coleção na página de análise de dados.

  2. Execute um dos procedimentos a seguir:

    • Suas facetas personalizadas estão listadas na visão Facets. Scroll e clique em Carregar mais repetidamente até que suas facetas sejam exibidas.

    • Envie uma pesquisa vazia para retornar todos os documentos. Na pane Facet analysis, selecione a faceta que você criou.

    • Para acessar suas facetas personalizadas mais rapidamente, inclua-as em uma visualização customizada. Selecione Custom como a visualização e, em seguida, clique em Editar. Selecione uma ou mais facetas para adicionar à vista e, em seguida, clique em Salvar.

      personalizada*Menu de