Essa documentação destina-se ao IBM Watson® Knowledge Studio no IBM Cloud®. Para ver a documentação para a versão anterior do Knowledge Studio no IBM Marketplace, clique neste link.

Incluindo documentos para anotação

Para treinar um modelo de aprendizado de máquina, deve-se incluir documentos que contêm conhecimento no assunto, como artigos de jornal ou outros textos específicos, em sua área de trabalho.

Sobre essa tarefa

Esta seção descreve como incluir documentos somente para anotação. Para definir regras para o modelo baseado em regra, você inclui ou faz upload de documentos dos quais é possível desenhar padrões para definir como regras. Veja Incluindo documentos para definir regras para obter mais informações.

Documentos

Para treinar um modelo de aprendizado de máquina, você precisa coletar documentos que são representantes de seu conteúdo de domínio e de valor alto para seu aplicativo.

Tente assegurar que seus documentos de treinamento sejam verdadeiramente representantes de conteúdo que é de interesse para seu domínio; ou seja, eles contêm muitas menções relevantes que podem ser anotadas. Para escolher os melhores documentos, siga estas diretrizes:

  • Tente fornecer um conjunto de documentos que tenham um tamanho total de cerca de 300.000 palavras. Forneça mais palavras para um sistema de tipos complexo e menos para um mais simples.
  • Limite cada documento a uma ou duas páginas de conteúdo; menos de 2.000 palavras, e mais perto de 1.000 palavras por documento é o ideal. Nos estágios iniciais de desenvolvimento de modelo, manter cada documento até alguns parágrafos também é uma boa prática. Um anotador humano pode marcar menções e relações em um documento longo, mas as tentativas de marcar correferência em múltiplas páginas podem ser difíceis.
  • Os documentos geralmente são limitados a 600 menções
  • Assegure-se de que os dados nos documentos sejam distribuídos entre todos os tipos de entidade, subtipos e funções possíveis e os relacionamentos entre eles. Um objetivo a ser atingido é ter eventualmente pelo menos 50 anotações para cada tipo de entidade e 50 para cada tipo de relação na coleção de documentos.
  • Novamente, os documentos devem representar a amplitude de assuntos que serão abordados pelo aplicativo, mas no caso de frequência de ocorrência desequilibrada de tipos de entidade e tipos de relação, tente conseguir pelo menos 50 exemplos de cada tipo, mais para tipos de entidade que têm menções que tendem a ser frases.
  • O conjunto que você cria para treinamento deve conter pelo menos 10 documentos anotados.

Quando você estiver pronto para criar e treinar o modelo, os documentos que você incluir na área de trabalho poderão ser divididos em conjuntos que são usados como dados de treinamento, dados de teste e dados ocultos. Os conjuntos de dados separados são importantes para avaliar o desempenho do modelo.

É possível incluir documentos das maneiras a seguir. Para obter mais informações sobre os tipos de documentos suportados, os limites de tamanho e outras informações, consulte Criando uma área de trabalho > Resumo de entradas, saídas e limitações.

  • Um arquivo CSV de duas colunas em formato UTF-8
  • Arquivos de texto no formato UTF-8
  • Arquivos HTML
  • Arquivos PDF (arquivos varridos e protegidos por senha não são suportados)
  • Arquivos DOC ou DOCX Microsoft Word (arquivos protegidos por senha não são suportados)
  • Um arquivo .zip que contém documentos transferidos por download de uma área de trabalho do Knowledge Studio
  • Um arquivo .zip que contém arquivos no formato UIMA CAS XMI

arquivos CSV

É possível fazer upload de um arquivo CSV de duas colunas que contém texto de amostra da sua máquina local. Faça upload de um arquivo CSV por vez. A primeira coluna no arquivo CSV especifica o nome do arquivo do documento. A segunda coluna no arquivo contém o texto do documento. Para um exemplo do formato necessário, consulte o documents-new.csv O arquivo Ícone de link externo nos arquivos de amostra do tutorial.

Arquivos PDF

O texto não pode ser extraído de um PDF em alguns casos, dependendo de como o PDF foi criado. Geralmente, o texto não pode ser extraído de fontes integradas que não são mapeadas para caracteres Unicode. Se você não tiver certeza de que o texto de um PDF pode ser extraído, será possível tentar copiar o texto do PDF e, em seguida, colá-lo em um editor de texto. Se você não vir os mesmos caracteres que estão visíveis no próprio PDF, então a extração de texto provavelmente falhará.

Documentos formatados

Quando documentos formatados são convertidos em texto sem formatação, é possível que perder a formatação possa resultar em uma tokenização insatisfatória de palavras. Por exemplo, se uma linha da tabela em um arquivo DOCX contiver valores de célula que não terminam com um ponto final, os valores poderão ser convertidos como uma sentença. Como outro exemplo, se um documento PDF contiver uma palavra muito longa que é hifenizada no término de uma linha, essa palavra poderá ser convertida como duas palavras. Em casos como esses, os documentos podem não ser adequados para aprendizado de máquina, a menos que você pré-processe os arquivos para corrigir as limitações de formatação.

Documentos de outra área de trabalho do Watson Knowledge Studio

Se você tiver feito download anteriormente de documentos de uma área de trabalho do Knowledge Studio, será possível fazer upload do arquivo .zip transferido por download. Uma opção permite especificar se você deseja que as anotações de verdade absoluta sejam incluídas nos arquivos importados.

Depois que os documentos são anotados, os documentos anotados são armazenados no formato JSON. A linguagem de marcações nesses arquivos, que mostra como o texto do documento original foi analisado e convertido em token, inclui elementos para todas as anotações que um anotador humano incluiu. Para melhorar a precisão do modelo ao longo do tempo, é possível fazer upload desses arquivos em outra área de trabalho, preservando assim todas as anotações existentes. Um anotador humano pode revisar, excluir e incluir anotações nesses documentos ou é possível ignorar a anotação humana e usar esses arquivos para criar treinamento, teste e conjuntos de documentos cegos para avaliar e melhorar o desempenho do modelo.

Arquivos UIMA CAS XMI

Para ajudar a treinar um modelo, é possível fazer upload de documentos que foram pré-anotados por um mecanismo de análise UIMA. Os arquivos pré-anotados devem estar na serialização XMI do formato UIMA Common Analysis Structure (UIMA CAS XMI) e combinados em um arquivo .zip. Por exemplo, é possível fazer upload de documentos que foram anotados em uma coleção do IBM Watson Explorer.

Um anotador humano pode revisar, excluir e incluir anotações nesses documentos ou é possível ignorar a anotação humana e usar esses arquivos para criar treinamento, teste e conjuntos de documentos cegos para avaliar e melhorar o desempenho do modelo. Para obter mais informações sobre como criar esses arquivos e requisitos para fazer upload deles, consulte Fazendo upload de documentos pré-anotados.

Anonimando dados

Se você deseja construir um modelo que é otimizado para seus dados, mas não deseja fazer upload dos dados no estado em que se encontram para o Knowledge Studio por razões de privacidade, é possível remover os documentos de quaisquer informações pessoalmente identificáveis (PII) primeiro e, em seguida, usar esses documentos anonimados para treinar o modelo. Não edite as informações ou substitua-as em massa por variáveis. Para obter melhores resultados, substitua as informações reais por informações falsas do mesmo tipo.

Por exemplo, se o PII que você deseja proteger são nomes de clientes, em vez de editar cada nome ou substituir cada nome por uma variável, como USER_NAME, substitua cada nome por um nome falso que usa uma variedade de estilos de sintaxe de nome típico, como Jane Doe, Sr. Smith, Dietrich ou Dr. Jones, PhD. Considere gravar um script que concatena uma variedade de nomes e sobrenomes, além de títulos e sobrenomes, e inclui sobrenomes sozinhos para criar nomes falsos que podem ser inseridos no documento para substituir as instâncias de nomes de usuários reais. O objetivo é simular o mais próximo possível valores reais nos documentos de origem. Se o mesmo texto (USER_NAME) for usado nos documentos ou o texto for editado, você basicamente estará treinando o modelo para esperar que todos os nomes tenham o mesmo valor ou sejam editados. Quando o modelo é usado no tempo de execução em novos documentos e encontra nomes nunca vistos antes em toda a sua variabilidade, você deseja que ele seja capaz de reconhecê-los como nomes.

Incluindo documentos em uma área de trabalho

Para treinar um modelo, deve-se incluir documentos que são representantes de seu conteúdo de domínio em sua área de trabalho.

Sobre essa tarefa

Como uma melhor prática, inicie com uma coleção relativamente pequena de documentos. Use esses documentos para treinar anotadores humanos (se sua área de trabalho envolve anotação humana) e para refinar as diretrizes de anotação. Os documentos pequenos podem ajudar os anotadores humanos a identificarem cadeias de correferência em todo o documento. À medida que a precisão de anotação melhora, é possível incluir mais documentos no corpus para fornecer maior profundidade para o esforço de treinamento.

Procedimento

Para incluir documentos em uma área de trabalho:

  1. Efetue login como um administrador ou gerente de projeto do Knowledge Studio e selecione a sua área de trabalho.

  2. Selecione a guia Ativos> Documentos > Conjuntos de documentação.

  3. Clique em Fazer upload de conjuntos de documentos para incluir documentos no corpus.

  4. Faça upload de documentos em um dos formatos suportados. Para obter mais informações sobre os tipos de documentos suportados, os limites de tamanho e outras informações, consulte Criando uma área de trabalho > Resumo de entradas, saídas e limitações.

    Notas sobre arquivos .zip de documentos transferidos por download de outra área de trabalho

    Quando os documentos anotados são importados, eles são novamente submetidos ao token. Esse processo pode mudar o que o Knowledge Studio considera serem os limites de sentença. Como as anotações são definidas por sentença, algumas anotações podem ser invalidadas durante esse processo. Depois de fazer upload de documentos de outra área de trabalho, faça uma revisão rápida das anotações para direcionar quaisquer discrepâncias.

    • Se você tiver feito download anteriormente de documentos de uma área de trabalho do Knowledge Studio, arraste o arquivo .zip que contém os documentos transferidos por download ou clique para localizar e selecionar o arquivo. Se você deseja incluir anotações que foram incluídas nos documentos antes que eles fossem transferidos por download, assegure-se de que a opção para incluir a verdade absoluta esteja selecionada antes de clicar em Fazer upload. Somente as anotações que foram promovidas para verdade absoluta antes que os documentos fossem transferidos por download serão importadas.
    • Deve-se fazer upload do sistema de tipos da área de trabalho original para a área de trabalho atual antes de fazer upload de anotações de verdade absoluta. Para obter mais informações, consulte Fazendo upload de recursos de outra área de trabalho.

    Notas sobre arquivos .zip de documentos no formato UIMA CAS XMI

    • Se você tiver feito download anteriormente de documentos anotados que estão no formato UIMA CAS XMI, será possível fazer upload do arquivo .zip que contém o conteúdo analisado. Especifique que esse é o tipo de conteúdo do qual você deseja fazer upload antes de clicar em Fazer upload. Para obter mais informações sobre como criar esses arquivos e requisitos para fazer upload deles, consulte Fazendo upload de documentos pré-anotados.

  5. Após os documentos terem sido incluídos, clique nos nomes dos documentos para visualizá-los e verificar se o conteúdo está OK. Por exemplo, verifique se os arquivos de texto estão no formato UTF-8 e se nenhum sinal diacrítico ou problema de normalização de caractere está visível nos documentos e verifique se há quebras de sentença inadequadas. Se existirem problemas, você pode precisar pré-processar os arquivos antes de incluí-los no corpus. Você deseja que os documentos fiquem o mais limpo e bem formatado possível antes de o dicionário ou a anotação humana ser iniciada.

O quê fazer em seguida

Antes de iniciar quaisquer tarefas de anotação humana, divida o corpus em múltiplos conjuntos de documentos e designe os conjuntos de documento a anotadores humanos.

Os administradores e gerentes de projeto podem anotar conjuntos de documentos diretamente sem criar tarefas de anotação.

Excluindo documentos

Será possível excluir um documento se você determinar que ele não representa o texto do segmento de mercado padrão que beneficiará o modelo.

Para excluir um documento, escolha a opção que se aplica à sua situação:

Excluindo um documento que não foi associado a uma tarefa de anotação

Se o documento que você deseja excluir não estiver associado a uma tarefa de anotação, conclua estas etapas para excluir o documento.

Procedimento

Efetue login como um administrador do Knowledge Studio e selecione a sua área de trabalho.

  1. Selecione a guia Ativos> Documentos > Conjuntos de documentos.
  2. Selecione o conjunto de documentos que contém o documento que você deseja excluir. O conjunto de documentos é aberto.
  3. Localize o documento que você deseja remover e, em seguida, clique em Excluir.

Excluindo um documento que está associado a uma tarefa de anotação e a anotação humana não foi iniciada

Se o documento que você deseja excluir estiver associado a uma tarefa de anotação e a anotação humana ainda não foi iniciada, conclua estas etapas para excluir o documento.

Procedimento

  1. Efetue login como um administrador do Knowledge Studio e selecione a sua área de trabalho.

  2. Exclua a tarefa de anotação:

    1. Abra a página Modelo de aprendizado de máquina > Anotações. Clique na guia Tarefas de anotação.
    2. Localize a tarefa de anotação à qual o documento está associado, clique no ícone Mostrar menu na tarefa e, em seguida, clique em Excluir.
  3. Exclua o documento, de acordo com o descrito em Excluindo um documento que não foi associado a uma tarefa de anotação.

  4. Depois de excluir o documento, recrie a tarefa de anotação e associe o mesmo conjunto de anotações, que agora contém um documento a menos.

Excluindo um documento que está associado a uma tarefa de anotação e a anotação humana foi iniciada

Se o documento que você deseja excluir estiver associado a uma tarefa de anotação e a anotação humana foi iniciada, conclua estas etapas para excluir o documento.

Não exclua uma tarefa se a anotação humana estiver em andamento ou você perderá o trabalho que está em andamento.

Procedimento

  1. Informe aos anotadores humanos para ignorar o documento não desejado no conjunto.
  2. Após todo o trabalho de anotação estar concluído nos outros documentos e os anotadores humanos enviarem todos os documentos para incluir o conjunto na verdade absoluta, revise e aceite os documentos enviados.
  3. Resolva quaisquer conflitos de anotação .
  4. Quando todos os documentos fizerem parte da verdade absoluta e a tarefa estiver concluída, exclua a tarefa conforme descrito em Excluindo um documento que está associado a uma tarefa de anotação e a anotação humana não foi iniciada.
  5. Exclua o documento, de acordo com o descrito em Excluindo um documento que não foi associado a uma tarefa de anotação.

É possível confirmar se as anotações nos documentos restantes não serão perdidas fazendo download dos conjuntos de documentos e revisando os documentos na pasta gt.

Modelo de dados

Os diagramas neste tópico resumem o fluxo de documentos em um sistema Knowledge Studio e as diferenças entre documentos no corpus, uma tarefa de anotação e a verdade absoluta.

O corpus contém documentos, que são particionados em conjuntos de documentos:

  • Um documento é nada mais do que sequências de texto.
  • Um conjunto de documentos é um ponteiro para um grupo de documentos. O conjunto de documentos não contém cópias dos documentos em si.
  • Alguns conjuntos de documentos podem apontar para um único documento, uma configuração que é possível controlar por meio do parâmetro de sobreposição que você especifica ao criar conjuntos de anotações.

Esta figura ilustra dois conjuntos de documentos que apontam para três documentos. Os documentos são divididos entre os conjuntos. Figura 1. Esta figura ilustra dois conjuntos de documentos que apontam para três documentos. Os documentos são divididos entre os conjuntos.

A verdade absoluta inclui as anotações (menções, relações e menções correferenciadas) que são incluídas em documentos. A verdade absoluta é singular para cada documento.

Esta figura ilustra que a verdade básica consiste nas anotações que são adicionadas ao documento 1, documento 2, documento 3 e assim por diante. Figura 2. Esta figura ilustra que a verdade básica consiste nas anotações que são adicionadas ao documento 1, documento 2, documento 3 e assim por diante.

Quando você cria uma tarefa de anotação, cópias das anotações são criadas para cada documento no conjunto de anotações incluído na tarefa. Os anotadores humanos anotam os documentos. As anotações são isoladas umas das outras e da verdade absoluta. Uma tarefa de anotação é um conceito temporal que existe para permitir que os anotadores humanos anotem texto em espaços isolados. Em contraste, a verdade absoluta é permanente e singular.

Esta figura ilustra que o gerente de projeto cria conjuntos de anotações e os atribui a uma tarefa de anotação. Dave e Phil, os anotadores humanos, anotam os documentos nos conjuntos que estão designados a eles. Figura 2. Esta figura ilustra que o gerente de projeto cria conjuntos de anotações e os atribui a uma tarefa de anotação. Dave e Phil, os anotadores humanos, anotam os documentos nos conjuntos que estão designados a eles.

Depois que o gerente de projeto aprova os conjuntos de anotações em uma tarefa de anotação, as anotações em documentos que não se sobrepõem com outros conjuntos de anotações se tornam verdade absoluta. Para documentos que se sobrepõem entre os conjuntos de anotações (representados por documento 2 neste exemplo), o gerente de projeto deve adjudicar e resolver os conflitos. As anotações em documentos de sobreposição não se tornam verdade absoluta até que sejam aprovadas por adjudicação.

A verdade absoluta é então usada para treinar e testar um modelo de aprendizado de máquina ou ela pode ser usada como a base para a próxima iteração de desenvolvimento de modelo. Para usar a verdade absoluta em uma nova iteração, deve-se criar uma nova tarefa de anotação.

Esta figura ilustra como as anotações adicionadas por dois anotadores humanos se tornam verdade absoluta. Um documento, rotulado documento 2, é anotado por ambos os anotadores humanos. As anotações neste documento de sobreposição devem ser adjudicadas antes de se tornarem verdade absoluta. Figura 3. Esta figura ilustra como as anotações adicionadas por dois anotadores humanos se tornam verdade absoluta. Um documento, rotulado documento 2, é anotado por ambos os anotadores humanos. As anotações neste documento de sobreposição devem ser adjudicadas antes de se tornarem verdade absoluta.