Spark SQL및 외부 메타스토어에 대한 작업 

Spark SQL은 Hive 메타스토어를 사용하여 사용자 애플리케이션 테이블, 컬럼, 파티션 정보의 메타데이터를 관리합니다.

기본적으로 이 메타스토어를 구동하는 데이터베이스는 Spark 클러스터와 함께 제공되는 임베디드 Derby 인스턴스입니다.  이 메타스토어 데이터베이스를 IBM Cloud Databases for PostgreSQL 또는 IBM Cloud Data Engine (이전에는 SQL Query) 인스턴스와 같은 외부 데이터 스토어로 외부화하도록 선택할 수 있습니다.

Spark 클러스터 외부에 메타데이터를 배치하면 IBM Analytics Engine 인스턴스에서 다른 애플리케이션의 테이블을 참조할 수 있습니다. 이는 IBM Cloud Object Storage에 데이터를 저장하는 것과 결합하여 데이터 및 메타데이터를 지속하는 데 도움이 되며 다른 Spark 워크로드에서 이 데이터에 대해 원활하게 작업할 수 있습니다.

IBM Analytics Engine 을 사용하여 외부 메타스토어 사용 및 테스트

IBM Analytics Engine에서 외부 메타스토어를 사용으로 설정하고 테스트하려면 다음 단계를 수행해야 합니다.

  1. 메타데이터를 저장할 메타스토어를 작성하십시오. IBM Cloud Databases for PostgreSQL 또는 IBM Cloud Data Engine (이전에는 SQL Query) 인스턴스를 프로비저닝하도록 선택할 수 있습니다.
  2. 데이터베이스 인스턴스에 대해 작업하도록 IBM Analytics Engine 을 구성하십시오.
  3. 하나의 Spark 애플리케이션에서 테이블을 작성한 후 다른 Spark 애플리케이션에서 이 테이블에 액세스하십시오.