Utilizzo di Spark SQL e di un metastore esterno
Spark SQL utilizza il metastore Hive per gestire i metadati delle tabelle delle applicazioni, delle colonne e delle informazioni sulla partizione di un utente.
Per impostazione predefinita, il database che alimenta questo metastore è un'istanza Derby integrata fornita con il cluster Spark. Puoi scegliere di esternalizzare questo database metastore a un archivio dati esterno, come ad esempio a un'istanza IBM Cloud Databases for PostgreSQL o IBM Cloud Data Engine (in precedenza SQL Query).
L'inserimento dei tuoi metadati al di fuori del cluster Spark ti consentirà di fare riferimento alle tabelle in diverse applicazioni nelle tue istanze IBM Analytics Engine. Questo, in combinazione con l'archiviazione dei tuoi dati in IBM Cloud Object Storage, ti aiuta a rendere persistenti dati e metadati e ti permette di lavorare con questi dati senza soluzione di continuità tra diversi carichi di lavoro Spark.
Abilitazione e test di un metastore esterno con IBM Analytics Engine
Per abilitare e verificare un metastore esterno con IBM Analytics Engine, devi eseguire la seguente procedura:
- Creare un metastore per memorizzare i metadati. Puoi scegliere di eseguire il provisioning di un'istanza IBM Cloud Databases for PostgreSQL o di un'istanza IBM Cloud Data Engine (in precedenza SQL Query).
- Configura IBM Analytics Engine per gestire l'istanza del database.
- Creare una tabella in un'applicazione Spark e accedere a questa tabella da un'altra applicazione Spark.