글루텐 가속 스파크 엔진 프로비저닝

글루텐 가속 스파크 엔진은 watsonx.data 에서 최적화된 고성능 엔진입니다. Spark 엔진은 오픈 소스 실행 엔진(C++로 구현)인 Velox에 SQL 실행을 오프로드하기 위해 Gluten을 사용하여 SparkSQL 의 계산을 가속화하여 워크로드 실행에 드는 비용을 절감합니다.

글루텐 가속 스파크 엔진 프로비저닝

적용 대상: 글루텐 가속 스파크 엔진

IBM watsonx.data 를 사용하면 복잡한 대규모 워크로드를 실행하기 위해 Gluten 가속 Spark 엔진을 프로비저닝할 수 있습니다. Gluten은 대규모 하드웨어에서 실행할 때 탁월한 성능을 제공합니다.

다음 방법을 사용하여 글루텐 가속 스파크 엔진을 프로비저닝할 수 있습니다:

  • 콘솔을 통한 프로비저닝
  • API를 통한 프로비저닝

전제조건

  • Cloud에서 watsonx.data 구독이 있어야 합니다.
  • <engine-home-bucket> watsonx.data 에 저장소를 만들어야 하며, 이 저장소는 로그를 저장하기 위해 Gluten Accelerated Spark 엔진과 연결됩니다.

콘솔을 통한 프로비저닝

글루텐 가속 스파크 엔진을 추가하려면 다음 단계를 완료하세요.

  1. watsonx.data 콘솔에 로그인하십시오.

  2. 탐색 메뉴에서 인프라 관리자를 선택하십시오.

  3. Gluten 가속 Spark 엔진을 추가하려면 구성 요소 추가를 클릭하고 IBM Spark를 클릭한 후 다음을 클릭합니다.

  4. 컴포넌트 추가- IBM Spark 페이지의 유형 섹션에서 글루텐 가속 스파크 엔진을 선택합니다.

  5. 구성 요소 추가 - IBM 스파크 페이지에서 다음 세부 정보를 구성합니다:

    a. 구성 요소 추가 - 글루텐 가속 스파크 엔진 창에서 글루텐 가속 스파크 엔진의 표시 이름을 입력합니다. c. 다음 세부 정보를 구성합니다:

    글루텐 가속 스파크 엔진 프로비저닝
    필드 설명
    기본 Spark 버전 애플리케이션 처리를 위해 고려해야 하는 Spark 런타임 버전을 선택합니다. 글루텐 가속 스파크 엔진 지원 버전 3.4.
    엔진 홈 버킷 목록에서 등록된 Cloud Object Storage 버킷을 선택하여 스파크 애플리케이션을 실행하는 동안 생성되는 스파크 이벤트 및 로그를 저장합니다.
    참고 IBM-관리되는 버킷을 스파크 엔진 홈으로 선택하지 않았는지 확인하세요. IBM-관리되는 버킷을 선택하면 로그를 보기 위해 해당 버킷에 액세스할 수 없습니다.
    자세한 정보는 시작하기 전에를 참조하십시오.
    예비 용량 (조건부) 버전 2.3 1보다 이전 버전을 사용하는 경우 watsonx.data 이 필드를 지정하십시오. 형을 Node 선택하십시오.
    2. 노드 수 필드에 노드 수를 입력합니다.
    관련 카탈로그(선택 사항) 엔진과 연결해야 하는 카탈로그를 선택합니다.
  6. 작성을 클릭하십시오. 엔진이 프로비저닝되어 인프라 관리자 페이지에 표시됩니다.

API를 통한 프로비저닝

  1. 다음 CURL 명령을 사용하여 글루텐 가속 스파크 엔진을 생성합니다.

v2 API

curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines   -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {

    "description": "",

    "engine_details": {

        "default_version": "3.4",

        "scale_config": {

            "node_type": "small",

            "number_of_nodes": 1

        },

        "engine_home_bucket_name": "`<engine-home-bucket>`"

    },

    "engine_display_name": "`<gluten_engine_name>`",

    "associated_catalogs": [

        "<catalog_name>"

    ],

    "origin": "native",
    "type": "gluten"

}

   }

매개변수 값:

  • <region> 인스턴스가 watsonx.data 사용 가능한 지역.
  • <CRN>: watsonx.data 인스턴스 CRN. watsonx.data 정보 페이지에서 CRN을 검색할 수 있습니다.
  • <engine-home-bucket> 스파크 애플리케이션을 모니터링하고 디버깅할 수 있는 스토리지입니다.
  • <gluten_engine_name>: 글루텐 가속 스파크 엔진의 이름을 지정합니다.
  • <catalog_name>: 사용하는 카탈로그의 이름을 지정합니다. 글루텐 가속 Spark는 Iceberg, Hudi, Delta 및 Hive 카탈로그를 지원합니다.

V3 API


curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"

글루텐 가속 스파크 엔진을 사용하여 스파크 애플리케이션을 제출하려면 스파크 애플리케이션 제출하기를 참조하세요.