Mit Spark SQL und einem externen Metaspeicher arbeiten 

Spark SQL verwendet den Metaspeicher Hive, um die Metadaten der Anwendungstabellen, Spalten und Partitionsinformationen eines Benutzers zu verwalten.

Standardmäßig ist die Datenbank, die diesen Metaspeicher unterstützt, eine eingebettete Derby-Instanz, die mit dem Spark-Cluster geliefert wird.  You could choose to externalize this metastore database to an external data store, like to an IBM Cloud Databases for PostgreSQL or an IBM Cloud Data Engine (previously SQL Query) instance.

Wenn Sie Ihre Metadaten außerhalb des Spark-Clusters platzieren, können Sie auf die Tabellen in verschiedenen Anwendungen in Ihren IBM Analytics Engine-Instanzen verweisen. Dies in Kombination mit dem Speichern Ihrer Daten in IBM Cloud Object Storageunterstützt Sie beim Speichern von Daten und Metadaten und ermöglicht Ihnen das nahtlose Arbeiten mit diesen Daten über verschiedene Spark-Workloads.

Aktivieren und Testen eines externen Metaspeichers mit IBM Analytics Engine

Um einen externen Metaspeicher mit IBM Analytics Enginezu aktivieren und zu testen, müssen Sie die folgenden Schritte ausführen:

  1. Erstellen Sie einen Metaspeicher zum Speichern der Metadaten. Sie können entweder eine IBM Cloud Databases for PostgreSQL-oder eine IBM Cloud Data Engine-Instanz (zuvor SQL Query) bereitstellen.
  2. Konfigurieren Sie IBM Analytics Engine für die Arbeit mit der Datenbankinstanz.
  3. Erstellen Sie in einer Spark-Anwendung eine Tabelle und greifen Sie dann über eine andere Spark-Anwendung auf diese Tabelle zu.