Spark SQL및 외부 메타스토어에 대한 작업
Spark SQL은 Hive 메타스토어를 사용하여 사용자 애플리케이션 테이블, 컬럼, 파티션 정보의 메타데이터를 관리합니다.
기본적으로 이 메타스토어를 구동하는 데이터베이스는 Spark 클러스터와 함께 제공되는 임베디드 Derby 인스턴스입니다. 이 메타스토어 데이터베이스를 IBM Cloud Databases for PostgreSQL 또는 IBM Cloud Data Engine (이전에는 SQL Query) 인스턴스와 같은 외부 데이터 스토어로 외부화하도록 선택할 수 있습니다.
Spark 클러스터 외부에 메타데이터를 배치하면 IBM Analytics Engine 인스턴스에서 다른 애플리케이션의 테이블을 참조할 수 있습니다. 이는 IBM Cloud Object Storage에 데이터를 저장하는 것과 결합하여 데이터 및 메타데이터를 지속하는 데 도움이 되며 다른 Spark 워크로드에서 이 데이터에 대해 원활하게 작업할 수 있습니다.
IBM Analytics Engine 을 사용하여 외부 메타스토어 사용 및 테스트
IBM Analytics Engine에서 외부 메타스토어를 사용으로 설정하고 테스트하려면 다음 단계를 수행해야 합니다.
- 메타데이터를 저장할 메타스토어를 작성하십시오. IBM Cloud Databases for PostgreSQL 또는 IBM Cloud Data Engine (이전에는 SQL Query) 인스턴스를 프로비저닝하도록 선택할 수 있습니다.
- 데이터베이스 인스턴스에 대해 작업하도록 IBM Analytics Engine 을 구성하십시오.
- 하나의 Spark 애플리케이션에서 테이블을 작성한 후 다른 Spark 애플리케이션에서 이 테이블에 액세스하십시오.