Manutenzione delle tabelle di Spark utilizzando IBM cpdctl

Si applica a: Motore a scintilla

È possibile eseguire le operazioni di manutenzione delle tabelle Iceberg inviando un'applicazione Spark con l'aiuto di IBM Cloud Pak for Data Command Line Interface ( IBM cpdctl). L'utilità tablemaint, disponibile in IBM cpdctl, consente di inviare, elencare e ottenere i dettagli di un'applicazione Spark.

Prima di iniziare

Manutenzione della tabella

È possibile utilizzare le risorse disponibili nell'utilità tablemaint per eseguire le seguenti attività di manutenzione delle tabelle.

  • Gestione delle snapshot

    • rollback_to_snapshot - Esegue il rollback di una tabella a un ID snapshot specifico.
    • rollback_to_timestamp - Riporta la tabella a un'istantanea a un giorno e a un'ora specifici.
    • set_current_snapshot - Imposta l'ID dell'istantanea corrente per una tabella.
    • cherrypick_snapshot - Raccoglie le modifiche da un'istantanea nello stato attuale della tabella.
  • Gestione metadati

    • expire_snapshots - Rimuove le vecchie istantanee e i relativi file non più necessari.
    • remove_orphan_files - Utilizzato per rimuovere i file che non sono referenziati in alcun file di metadati di una tabella Iceberg.
    • rewrite_data_files - Combina file piccoli in file più grandi per ridurre l'overhead dei metadati e il costo di apertura dei file in runtime.
    • rewrite_manifests - Riscrive i manifesti per una tabella per ottimizzare la pianificazione delle scansioni.
  • Tabella Migrazione

    • register_table - Crea una voce di catalogo per un file metadata.json che esiste ma non ha un identificatore di catalogo corrispondente.

Per informazioni, vedere la sezione Come utilizzare il comando wx-data --help (-h).