Fazendo upload de dados
É possível executar um upload de documento único de seu sistema de arquivos local a qualquer momento para incluir dados em um projeto.
Você pode fazer upload de até 200 arquivos por vez.
Para processar conjuntos de documentos maiores que 200 arquivos, é possível incluí-los em uma origem de dados externa e usar um crawler de origem de dados para fazer upload deles. Para implementações do IBM Cloud Pak for Data, é possível usar uma origem de dados do Sistema de Arquivos Local para esse propósito.
Para obter mais informações sobre o tamanho máximo permitido para cada arquivo, consulte Limites de documentos
Antes de fazer upload de um arquivo CSV para um projeto de Mineração de Conteúdo, considere incluir cabeçalhos no arquivo de origem para que quaisquer campos gerados a partir do arquivo tenham nomes significativos. Sem cabeçalhos, os campos recebem
nomes genéricos, como column_0, column_1, etc.
Para fazer upload de dados, conclua as etapas a seguir:
-
Abra seu projeto, acesse a página Gerenciar coleções e clique em Nova coleta.
-
Faça o seguinte com base em seu tipo de implementação:
IBM Cloud Pak for Data IBM Software Hub
-
Escolha Enviar dados como sua origem de dados e, em seguida, clique em Avançar.
Também é possível conectar a uma origem de dados diferente em vez de fazer upload de dados, como reutilizar dados de uma coleção ou efetuar crawl de uma origem de dados externa. Para obter mais informações, consulte Reutilizando dados de uma coleta e Visão geral do Cloud Pak for Data origens de dados.
-
Nomear a coleção. Se o idioma dos documentos no armazenamento não for o inglês, selecione o idioma apropriado Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.
-
Opcionalmente, clique em Configurações de processamento para expandir o menu. Você pode selecionar as seguintes configurações:
-
Configure o alternador Apply optical character recognition (OCR) como On para ativar o OCR.
Quando o OCR é ativado e seus documentos contêm imagens, o processamento leva mais tempo. Para obter mais informações, consulte Reconhecimento de caractere ótico.
-
Configure Usar lematização em vez de lematização ao indexar alternador para Ativado para usar lematização em vez de lematização para normalizar palavras no índice e consultas. Para obter mais informações, consulte Ativando stemming para dados não selecionados.
-
-
Clique em Avançar
-
Faça upload de dados procurando os arquivos que você deseja efetuar crawl.
É possível arrastar documentos que deseja incluir em sua coleta.
Para obter mais informações sobre tipos de arquivo suportados, consulte Tipos de arquivo suportados.
-
Clique em Finish.
IBM Cloud
-
Nomear a coleção. Se o idioma dos documentos no armazenamento não for o inglês, selecione o idioma apropriado Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.
-
Faça upload de dados procurando os arquivos que você deseja incluir.
É possível arrastar documentos que deseja incluir em sua coleta.
Para obter mais informações sobre tipos de arquivo suportados, consulte Tipos de arquivo suportados.
Também é possível conectar a uma origem de dados diferente em vez de fazer upload de dados, como reutilizar dados de uma coleção ou efetuar crawl de uma origem de dados externa. Para se conectar a uma origem de dados diferente, clique no link próximo a Necessidade de se conectar a uma origem de dados? campo. Para obter mais informações, consulte Reutilizando dados de uma coleta e Visão geral das origens de dados de Nuvem
-
Opcionalmente, clique em Configurações de processamento para expandir o menu. Você pode selecionar o seguinte:
-
Configure o alternador Apply optical character recognition (OCR) como On para ativar o OCR.
Quando o OCR é ativado e seus documentos contêm imagens, o processamento leva mais tempo. Para obter mais informações, consulte Reconhecimento de caractere ótico.
-
Configure Usar lematização em vez de lematização ao indexar alternador para Ativado para usar lematização em vez de lematização para normalizar palavras no índice e consultas. Para obter mais informações, consulte Ativando stemming para dados não curados
-
-
Clique em Finish.
-
O upload do arquivo é concluído rapidamente.. Leva mais tempo para que os dados sejam processados conforme são incluídos na coleção. Após os arquivos serem transferidos por upload e processados, a página Atividade mostra os resultados do upload.
Ao contrário das origens de dados com crawl, não é possível planejar atualizações regulares para arquivos transferidos por upload. Se desejar incluir uma versão posterior de um arquivo, exclua a versão anterior do arquivo e, em seguida, faça upload da versão mais recente.
Para obter informações sobre como resolver problemas que você pode encontrar ao incluir documentos em uma coleta, consulte Resolução de problemas de ingestão.
Para obter mais informações sobre o que acontece a seguir, consulte Como sua origem de dados é processada.