Manutenção da tabela Spark usando IBM cpdctl

Aplica-se a: Motor de faísca

Você pode executar operações de manutenção de tabelas do Iceberg enviando um aplicativo Spark com a ajuda da interface de linha de comando IBM Cloud Pak for Data ( IBM cpdctl). O utilitário tablemaint disponível no IBM cpdctl permite que você envie, liste e obtenha os detalhes de um aplicativo Spark.

Antes de Iniciar

  • watsonx.data com o mecanismo Native Spark provisionado.
  • Faça o download e instale o IBM cpdctl. Para obter informações, consulte Instalação do IBM cpdctl.
  • Configure o ambiente watsonx.data em IBM cpdctl. Para obter informações, consulte Configurar IBM cpdctl.

Manutenção da tabela

Você pode usar os recursos disponíveis no utilitário tablemaint para realizar as seguintes atividades de manutenção de tabelas.

  • Gerenciamento de captura instantânea

    • rollback_to_snapshot - Reverte uma tabela para um ID de snapshot específico.
    • rollback_to_timestamp - reverte a tabela para um instantâneo em um dia e hora específicos.
    • set_current_snapshot - Define o ID do instantâneo atual de uma tabela.
    • cherrypick_snapshot - seleciona as alterações de um instantâneo para o estado atual da tabela.
  • Gerenciamento de metadados

    • expire_snapshots - Remove snapshots antigos e seus arquivos que não são mais necessários.
    • remove_orphan_files - Usado para remover arquivos que não são referenciados em nenhum arquivo de metadados de uma tabela Iceberg.
    • rewrite_data_files - Combina arquivos pequenos em arquivos maiores para reduzir a sobrecarga de metadados e o custo de abertura de arquivos em tempo de execução.
    • rewrite_manifests - Reescreve manifestos de uma tabela para otimizar o planejamento de varredura.
  • Migração de tabelas

    • register_table - Cria uma entrada de catálogo para um arquivo metadata.json que existe, mas não tem um identificador de catálogo correspondente.

Para obter informações, consulte a seção Como usar o comando wx-data --help (-h).