Utilisation de Spark SQL et d'un métamagasin externe
Spark SQL utilise le métamagasin Hive pour gérer les métadonnées des tables, colonnes et informations de partition d'un utilisateur.
Par défaut, la base de données qui alimente ce métamagasin est une instance Derby intégrée fournie avec le cluster Spark. Vous pouvez choisir d'externaliser cette base de données de métamagasin dans un magasin de données externe, par exemple dans une instance IBM Cloud Databases for PostgreSQL ou IBM Cloud Data Engine (précédemment SQL Query).
Le fait de placer vos métadonnées en dehors du cluster Spark vous permet de référencer les tables dans différentes applications dans vos instances IBM Analytics Engine. Ceci, en combinaison avec le stockage de vos données dans IBM Cloud Object Storage, permet de conserver les données et les métadonnées et vous permet d'utiliser ces données de manière transparente sur différentes charges de travail Spark.
Activation et test d'un métamagasin externe avec IBM Analytics Engine
Pour activer et tester un métamagasin externe avec IBM Analytics Engine, procédez comme suit:
- Créez un métamagasin pour stocker les métadonnées. Vous pouvez choisir de mettre à disposition une instance IBM Cloud Databases for PostgreSQL ou IBM Cloud Data Engine (précédemment SQL Query).
- Configurez IBM Analytics Engine pour qu'il fonctionne avec l'instance de base de données.
- Créez une table dans une application Spark, puis accédez à cette table à partir d'une autre application Spark.