Provisioning Gluten 加速 Spark 引擎

Gluten accelerated Spark 引擎是經過優化的高性能引擎,在 watsonx.data. Spark 引擎使用 Gluten 將 SQL 執行卸載至 Velox,Velox 是一個開放原始碼執行引擎 (以 C++ 實作),藉此加速 SparkSQL 的計算,以降低執行工作負載的成本。

Provisioning Gluten 加速 Spark 引擎

適用於麩質加速火花引擎

IBM watsonx.data 可讓您配置 Gluten 加速 Spark 引擎,以執行複雜的大型工作負載。 在大型硬體上執行時,Gluten 可提供卓越的效能。

您可以使用下列方法配置 Gluten Accelerated Spark 引擎:

  • 透過主控台進行佈建
  • 透過 API 進行佈建

必要條件

  • 您必須訂閱 watsonx.data on Cloud。
  • <engine-home-bucket>:您必須在 中建立一個儲存空間,該儲存空間將與您的 Gluten Accelerated Spark 引擎關聯,以儲存日誌。watsonx.data

透過主控台進行佈建

若要新增 Gluten 加速 Spark 引擎,請完成下列步驟。

  1. 登入 watsonx.data 控制台。

  2. 從導覽功能表中,選擇基礎結構管理員

  3. 若要新增 Gluten 加速 Spark 引擎,請按一下新增元件,按一下 IBM Spark,然後按一下下一步

  4. Add component- IBM Spark 頁面,從 Type 區段選擇 Gluten accelerated Spark engine

  5. 新增元件 - IBM Spark 頁面,設定下列詳細資訊:

    a. 在 Add component - Gluten accelerated Spark engine 視窗中,輸入 Gluten accelerated Spark engine 的顯示名稱。 c. 設定下列詳細資訊:

    Provisioning Gluten 加速 Spark 引擎
    欄位 說明
    預設 Spark 版本 選擇處理應用程式時必須考慮的 Spark runtime 版本。 Gluten 加速 Spark 引擎支援版本 3.4。
    引擎回歸桶 從清單中選擇註冊的 Cloud Object Storage bucket,以儲存執行 spark 應用程式時產生的 Spark 事件和日誌。
    注意 確保您沒有選擇 IBM-managed bucket 作為 Spark 引擎原點。 如果您選擇 IBM 管理的儲存桶,則無法存取該儲存桶以檢視日誌。
    如需相關資訊,請參閱 開始之前
    備用容量(有條件) 若您使用的版本早於 1. watsonx.data 0 2.3 版,請指定此欄位。 選擇類型 Node
    2. 在 No of nodes(節點數目)欄位中輸入節點數目。
    相關目錄(選擇性) 選擇必須與引擎關聯的目錄。
  6. 按一下建立。 引擎已佈建,並顯示在 Infrastructure Manager 頁面。

透過 API 進行佈建

  1. 使用下列 CURL 指令建立 Gluten Accelerated Spark 引擎。

第 2 版 API

curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines   -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {

    "description": "",

    "engine_details": {

        "default_version": "3.4",

        "scale_config": {

            "node_type": "small",

            "number_of_nodes": 1

        },

        "engine_home_bucket_name": "`<engine-home-bucket>`"

    },

    "engine_display_name": "`<gluten_engine_name>`",

    "associated_catalogs": [

        "<catalog_name>"

    ],

    "origin": "native",
    "type": "gluten"

}

   }

參數值:

  • <region> 該 watsonx.data 實例可用的區域。
  • <CRN>: watsonx.data instance CRN。 您可以從 watsonx.data 資訊頁擷取 CRN。
  • <engine-home-bucket>:可讓您監控和調試 Spark 應用程式的儲存空間。
  • <gluten_engine_name>:指定 Gluten 加速 Spark 引擎的名稱。
  • <catalog_name>:指定您使用的目錄名稱。 Gluten accelerated Spark 支援 Iceberg、Hudi、Delta 和 Hive 目錄。

V3 API


curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"

若要使用 Gluten 加速 Spark 引擎提交 Spark 應用程式,請參閱 提交 Spark 應用程式