使用 Spark SQL 和外部 meta 儲存庫 

Spark SQL 使用 Hive meta 儲存庫來管理使用者應用程式表格、直欄、分割區資訊的 meta 資料。

依預設,授權此 meta 儲存庫的資料庫是隨附於 Spark 叢集的內嵌 Derby 實例。  您可以選擇將此 meta 儲存庫資料庫外部化至外部資料儲存庫,例如 IBM Cloud Databases for PostgreSQL 或 IBM Cloud Data Engine (先前的 SQL Query) 實例。

將 meta 資料放置在 Spark 叢集外部可讓您在 IBM Analytics Engine 實例的不同應用程式中參照表格。 這與將資料儲存在 IBM Cloud Object Storage組合在一起,可協助持續保存資料和 meta 資料,並可讓您在不同的 Spark 工作負載之間無縫使用此資料。

使用 IBM Analytics Engine 啟用及測試外部 meta 儲存庫

若要使用 IBM Analytics Engine啟用及測試外部 meta 儲存庫,您需要執行下列步驟:

  1. 建立 meta 儲存庫以儲存 meta 資料。 您可以選擇佈建 IBM Cloud Databases for PostgreSQL 或 IBM Cloud Data Engine (先前 SQL Query) 實例。
  2. 配置 IBM Analytics Engine 以使用資料庫實例。
  3. 在一個 Spark 應用程式中建立表格,然後從另一個 Spark 應用程式存取此表格。