Sobre ingestão de dados

A ingestão de dados é o processo de importação e carregamento de dados em IBM® watsonx.data. Na interface do usuário (UI) de watsonx.data, você pode usar o módulo Ingest data da página Data manager para carregar dados com segurança e facilidade. Como alternativa, você também pode ingerir arquivos de dados locais ou remotos para criar tabelas usando a opção Criar tabela a partir de arquivo.

Ao alimentar um arquivo de dados no watsonx.data, o esquema de tabela é gerado e inferido quando uma consulta é executada. Os arquivos a serem ingeridos devem ter o mesmo tipo de formato e o mesmo esquema. watsonx.data descobre automaticamente o esquema com base no arquivo de origem que está sendo ingerido.

A seguir, alguns dos requisitos ou comportamentos da ingestão de dados:

  • A evolução do esquema não é suportada
  • A tabela de destino deve ser uma tabela de formato iceberg.
  • IBM Storage Ceph, IBM Cloud Object Storage (COS), AWS, S3 e MinIO são suportados.
  • A propriedade pathStyleAccess para o armazenamento de objeto não é suportada
  • os formatos de arquivo.txt,.csv, Parquet, JSON, ORC e Avro. são suportados como arquivos de dados de origem.
  • O limite máximo para o tamanho cumulativo dos arquivos deve estar dentro de 500 MB para ingestão local.
  • Arquivos Parquet, JSON, ORC e Avro. com mais de 2 MB não podem ser visualizados, mas ainda assim serão ingeridos com êxito.
  • Os arquivos JSON com objetos e matrizes aninhados complexos não devem ser visualizados na interface do usuário.
  • Os arquivos JSON complexos devem ser ingeridos no estado em que se encontram, resultando em matrizes como entradas de tabela. Isso não é recomendado para a visualização e análise ideais dos dados.
  • As chaves nos arquivos JSON devem ser colocadas entre aspas para que sejam analisadas e interpretadas corretamente.

Carregando ou alimentando dados por meio da CLI

Uma tarefa de ingestão no watsonx.data pode ser executada com a ferramenta ibm-lh. A ferramenta deve ser extraída do ibm-lh-client e instalada no sistema local para executar a tarefa de ingestão por meio da CLI. Para obter mais detalhes e instruções para instalar o pacote ibm-lh-client e usar a ferramenta ibm-lh para ingestão, consulte Instalando o ibm-lh-client e Configurando o utilitário de linha de comando ibm-lh.

ibm-lh-client no pacote IBM Client está obsoleto e deverá ser removido em uma versão futura. A ferramenta ibm-lh foi substituída por ./cpdctl wx-data ingestion com suporte na CLI IBM CPDCTL. Para obter mais informações sobre como usar IBM CPDCTL CLI, consulte IBM cpdctl.

A ferramenta ibm-lh e o comando ./cpdctl wx-data ingestion oferecem suporte aos seguintes recursos:

  • Descoberta automática de esquema com base no arquivo de origem ou na tabela de destino

  • Opções avançadas de configuração de tabela para os arquivos CSV:

    • Delimitador
    • Cabeçalho
    • Codificação de arquivo
    • Delimitador de linha
    • Caracteres de escape
  • Ingestão de um único, vários arquivos ou uma única pasta (sem subpastas) de S3 e arquivos Parquet locais.

  • Ingestão de um único, vários arquivos ou uma única pasta (sem subpastas) de S3 e arquivos CSV locais.