Trabalhando com a Spark SQL e uma metastore externa
A Spark SQL usa a metastore Hive para gerenciar os metadados das tabelas de aplicativos de um usuário, colunas, informações de partição.
Por padrão, o banco de dados que potenita esta metastore é uma instância Derby incorporada que vem com o cluster Spark. Você poderia optar por externalizar esse banco de dados de metastore para uma loja de dados externa, como para um IBM Cloud Databases for PostgreSQL ou uma instância IBM Cloud Data Engine (anteriormente SQL Query).
Colocar seus metadados fora do cluster Spark irá permitir que você faça referência às tabelas em diferentes aplicativos nas instâncias IBM Analytics Engine. Isso, em combinação com armazenar seus dados em IBM Cloud Object Storage, ajuda a persistir dados e metadados e permite que você trabalhe com esses dados perfeitamente através de diferentes cargas de trabalho do Spark.
Habilitando e testando uma metastore externa com IBM Analytics Engine
Para ativar e testar uma metastore externa com IBM Analytics Engine, é necessário realizar as seguintes etapas:
- Crie uma metastore para armazenar os metadados. Você pode optar por fornecer um IBM Cloud Databases for PostgreSQL ou um IBM Cloud Data Engine (anteriormente SQL Query) instância.
- Configure IBM Analytics Engine para trabalhar com a instância do banco de dados.
- Crie uma tabela em um aplicativo Spark e, em seguida, acesse esta tabela a partir de outro aplicativo Spark.