使用 Spark SQL 和外部元存储
Spark SQL 使用 Hive metastore 来管理用户的应用程序表,列和分区信息的元数据。
缺省情况下,支持此元存储的数据库是 Spark 集群随附的嵌入式 Derby 实例。 您可以选择将此元存储数据库外部化到外部数据存储,例如 IBM Cloud Databases for PostgreSQL 或 IBM Cloud Data Engine (先前为 SQL Query) 实例。
将元数据置于 Spark 集群外部将使您能够跨 IBM Analytics Engine 实例引用不同应用程序中的表。 这与在 IBM Cloud Object Storage中存储数据相结合,可帮助持久存储数据和元数据,并允许您在不同 Spark 工作负载之间无缝地处理此数据。
使用 IBM Analytics Engine 启用和测试外部元存储
要使用 IBM Analytics Engine来启用和测试外部元存储器,需要执行以下步骤:
- 创建元存储以存储元数据。 您可以选择供应 IBM Cloud Databases for PostgreSQL 或 IBM Cloud Data Engine (先前为 SQL Query) 实例。
- 配置 IBM Analytics Engine 以使用数据库实例。
- 在一个 Spark 应用程序中创建表,然后从另一个 Spark 应用程序访问此表。