글루텐 가속 스파크 엔진 프로비저닝
글루텐 가속 스파크 엔진은 watsonx.data 에서 최적화된 고성능 엔진입니다. Spark 엔진은 오픈 소스 실행 엔진(C++로 구현)인 Velox에 SQL 실행을 오프로드하기 위해 Gluten을 사용하여 SparkSQL 의 계산을 가속화하여 워크로드 실행에 드는 비용을 절감합니다.
글루텐 가속 스파크 엔진 프로비저닝
적용 대상: 글루텐 가속 스파크 엔진
IBM watsonx.data 를 사용하면 복잡한 대규모 워크로드를 실행하기 위해 Gluten 가속 Spark 엔진을 프로비저닝할 수 있습니다. Gluten은 대규모 하드웨어에서 실행할 때 탁월한 성능을 제공합니다.
다음 방법을 사용하여 글루텐 가속 스파크 엔진을 프로비저닝할 수 있습니다:
- 콘솔을 통한 프로비저닝
- API를 통한 프로비저닝
전제조건
- Cloud에서 watsonx.data 구독이 있어야 합니다.
<engine-home-bucket>watsonx.data 에 저장소를 만들어야 하며, 이 저장소는 로그를 저장하기 위해 Gluten Accelerated Spark 엔진과 연결됩니다.
콘솔을 통한 프로비저닝
글루텐 가속 스파크 엔진을 추가하려면 다음 단계를 완료하세요.
-
watsonx.data 콘솔에 로그인하십시오.
-
탐색 메뉴에서 인프라 관리자를 선택하십시오.
-
Gluten 가속 Spark 엔진을 추가하려면 구성 요소 추가를 클릭하고 IBM Spark를 클릭한 후 다음을 클릭합니다.
-
컴포넌트 추가- IBM Spark 페이지의 유형 섹션에서 글루텐 가속 스파크 엔진을 선택합니다.
-
구성 요소 추가 - IBM 스파크 페이지에서 다음 세부 정보를 구성합니다:
a. 구성 요소 추가 - 글루텐 가속 스파크 엔진 창에서 글루텐 가속 스파크 엔진의 표시 이름을 입력합니다. c. 다음 세부 정보를 구성합니다:
글루텐 가속 스파크 엔진 프로비저닝 필드 설명 기본 Spark 버전 애플리케이션 처리를 위해 고려해야 하는 Spark 런타임 버전을 선택합니다. 글루텐 가속 스파크 엔진 지원 버전 3.4. 엔진 홈 버킷 목록에서 등록된 Cloud Object Storage 버킷을 선택하여 스파크 애플리케이션을 실행하는 동안 생성되는 스파크 이벤트 및 로그를 저장합니다.
참고 IBM-관리되는 버킷을 스파크 엔진 홈으로 선택하지 않았는지 확인하세요. IBM-관리되는 버킷을 선택하면 로그를 보기 위해 해당 버킷에 액세스할 수 없습니다.
자세한 정보는 시작하기 전에를 참조하십시오.예비 용량 (조건부) 버전 2.3 1보다 이전 버전을 사용하는 경우 watsonx.data 이 필드를 지정하십시오. 유 형을 Node 선택하십시오.
2. 노드 수 필드에 노드 수를 입력합니다.관련 카탈로그(선택 사항) 엔진과 연결해야 하는 카탈로그를 선택합니다. -
작성을 클릭하십시오. 엔진이 프로비저닝되어 인프라 관리자 페이지에 표시됩니다.
API를 통한 프로비저닝
- 다음 CURL 명령을 사용하여 글루텐 가속 스파크 엔진을 생성합니다.
v2 API
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
매개변수 값:
<region>인스턴스가 watsonx.data 사용 가능한 지역.<CRN>: watsonx.data 인스턴스 CRN. watsonx.data 정보 페이지에서 CRN을 검색할 수 있습니다.<engine-home-bucket>스파크 애플리케이션을 모니터링하고 디버깅할 수 있는 스토리지입니다.<gluten_engine_name>: 글루텐 가속 스파크 엔진의 이름을 지정합니다.<catalog_name>: 사용하는 카탈로그의 이름을 지정합니다. 글루텐 가속 Spark는 Iceberg, Hudi, Delta 및 Hive 카탈로그를 지원합니다.
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
글루텐 가속 스파크 엔진을 사용하여 스파크 애플리케이션을 제출하려면 스파크 애플리케이션 제출하기를 참조하세요.