Cómo trabajar con Spark SQL y un almacén de metadatos externo 

Spark SQL utiliza el almacén de metadatos Hive para gestionar los metadatos de las tablas, columnas e información de partición de las aplicaciones de un usuario.

De forma predeterminada, la base de datos que alimenta este almacén de metadatos es una instancia de Derby incorporada que se suministra con el clúster de Spark.  Puede optar por externalizar esta base de datos de almacén de metadatos a un almacén de datos externo, como en una instancia de IBM Cloud Databases for PostgreSQL o IBM Cloud Data Engine (anteriormente SQL Query).

Colocar los metadatos fuera del clúster de Spark le permitirá hacer referencia a las tablas en distintas aplicaciones en las instancias de IBM Analytics Engine. Esto, en combinación con el almacenamiento de sus datos en IBM Cloud Object Storage, ayuda a persistir los datos y metadatos y le permite trabajar con estos datos sin problemas en distintas cargas de trabajo de Spark.

Habilitación y prueba de un almacén de metadatos externo con IBM Analytics Engine

Para habilitar y probar un almacén de metadatos externo con IBM Analytics Engine, debe realizar los pasos siguientes:

  1. Cree un almacén de metadatos para almacenar los metadatos. Puede optar por suministrar una instancia de IBM Cloud Databases for PostgreSQL o una instancia de IBM Cloud Data Engine (anteriormente SQL Query).
  2. Configure IBM Analytics Engine para trabajar con la instancia de base de datos.
  3. Cree una tabla en una aplicación Spark y, a continuación, acceda a esta tabla desde otra aplicación Spark.