Manutenzione delle tabelle di Spark utilizzando IBM cpdctl
Si applica a: Motore a scintilla
È possibile eseguire le operazioni di manutenzione delle tabelle Iceberg inviando un'applicazione Spark con l'aiuto di IBM Cloud Pak for Data Command Line Interface ( IBM cpdctl). L'utilità tablemaint, disponibile in IBM cpdctl, consente
di inviare, elencare e ottenere i dettagli di un'applicazione Spark.
Prima di iniziare
- watsonx.data con il motore Spark nativo in dotazione.
- Scaricare e installare IBM cpdctl. Per informazioni, vedere Installazione di IBM cpdctl.
- Configurare l'ambiente watsonx.data in IBM cpdctl. Per informazioni, vedere Configurazione di IBM cpdctl.
Manutenzione della tabella
È possibile utilizzare le risorse disponibili nell'utilità tablemaint per eseguire le seguenti attività di manutenzione delle tabelle.
-
Gestione delle snapshot
- rollback_to_snapshot - Esegue il rollback di una tabella a un ID snapshot specifico.
- rollback_to_timestamp - Riporta la tabella a un'istantanea a un giorno e a un'ora specifici.
- set_current_snapshot - Imposta l'ID dell'istantanea corrente per una tabella.
- cherrypick_snapshot - Raccoglie le modifiche da un'istantanea nello stato attuale della tabella.
-
Gestione metadati
- expire_snapshots - Rimuove le vecchie istantanee e i relativi file non più necessari.
- remove_orphan_files - Utilizzato per rimuovere i file che non sono referenziati in alcun file di metadati di una tabella Iceberg.
- rewrite_data_files - Combina file piccoli in file più grandi per ridurre l'overhead dei metadati e il costo di apertura dei file in runtime.
- rewrite_manifests - Riscrive i manifesti per una tabella per ottimizzare la pianificazione delle scansioni.
-
Tabella Migrazione
- register_table - Crea una voce di catalogo per un file metadata.json che esiste ma non ha un identificatore di catalogo corrispondente.
Per informazioni, vedere la sezione Come utilizzare il comando wx-data --help (-h).