Sobre ingestão de dados
A ingestão de dados é o processo de importação e carregamento de dados em IBM® watsonx.data. Na interface do usuário (UI) de watsonx.data, você pode usar o módulo Ingest data da página Data manager para carregar dados com segurança e facilidade. Como alternativa, você também pode ingerir arquivos de dados locais ou remotos para criar tabelas usando a opção Criar tabela a partir de arquivo.
Ao alimentar um arquivo de dados no watsonx.data, o esquema de tabela é gerado e inferido quando uma consulta é executada. Os arquivos a serem ingeridos devem ter o mesmo tipo de formato e o mesmo esquema. watsonx.data descobre automaticamente o esquema com base no arquivo de origem que está sendo ingerido.
A seguir, alguns dos requisitos ou comportamentos da ingestão de dados:
- A evolução do esquema não é suportada
- A tabela de destino deve ser uma tabela de formato iceberg.
- IBM Storage Ceph, IBM Cloud Object Storage (COS), AWS, S3 e MinIO são suportados.
- A propriedade
pathStyleAccesspara o armazenamento de objeto não é suportada - os formatos de arquivo.txt,.csv, Parquet, JSON, ORC e Avro. são suportados como arquivos de dados de origem.
- O limite máximo para o tamanho cumulativo dos arquivos deve estar dentro de 500 MB para ingestão local.
- Arquivos Parquet, JSON, ORC e Avro. com mais de 2 MB não podem ser visualizados, mas ainda assim serão ingeridos com êxito.
- Os arquivos JSON com objetos e matrizes aninhados complexos não devem ser visualizados na interface do usuário.
- Os arquivos JSON complexos devem ser ingeridos no estado em que se encontram, resultando em matrizes como entradas de tabela. Isso não é recomendado para a visualização e análise ideais dos dados.
- As chaves nos arquivos JSON devem ser colocadas entre aspas para que sejam analisadas e interpretadas corretamente.
Carregando ou alimentando dados por meio da CLI
Uma tarefa de ingestão no watsonx.data pode ser executada com a ferramenta ibm-lh. A ferramenta deve ser extraída do ibm-lh-client e instalada no sistema local para executar a tarefa de ingestão por meio da CLI.
Para obter mais detalhes e instruções para instalar o pacote ibm-lh-client e usar a ferramenta ibm-lh para ingestão, consulte Instalando o ibm-lh-client e Configurando o utilitário de linha de comando ibm-lh.
ibm-lh-client no pacote IBM Client está obsoleto e deverá ser removido em uma versão futura. A ferramenta ibm-lh foi substituída por ./cpdctl wx-data ingestion com suporte na CLI IBM CPDCTL. Para obter
mais informações sobre como usar IBM CPDCTL CLI, consulte IBM cpdctl.
A ferramenta ibm-lh e o comando ./cpdctl wx-data ingestion oferecem suporte aos seguintes recursos:
-
Descoberta automática de esquema com base no arquivo de origem ou na tabela de destino
-
Opções avançadas de configuração de tabela para os arquivos CSV:
- Delimitador
- Cabeçalho
- Codificação de arquivo
- Delimitador de linha
- Caracteres de escape
-
Ingestão de um único, vários arquivos ou uma única pasta (sem subpastas) de S3 e arquivos Parquet locais.
-
Ingestão de um único, vários arquivos ou uma única pasta (sem subpastas) de S3 e arquivos CSV locais.