供应谷筋加速 Spark 引擎

面筋加速火花发动机是一种经过优化的高性能发动机,可在 watsonx.data 上运行。 Spark 引擎使用 Gluten 将 SQL 执行卸载到 Velox,Velox 是一个开源执行引擎(用 C++ 实现),从而加速了 SparkSQL 的计算,降低了运行工作负载的成本。

供应谷筋加速 Spark 引擎

适用对象麸质加速火花点火发动机

IBM watsonx.data 允许您配置一个 Gluten 加速 Spark 引擎,以运行复杂的大规模工作负载。 当在大型硬件上运行时,Gluten 可提供卓越的性能。

您可以使用以下方法配置 Gluten Accelerated Spark 引擎:

  • 通过控制台进行调配
  • 通过应用程序接口进行调配

先决条件

  • 您必须订阅 watsonx.data on Cloud。
  • <engine-home-bucket> 注意:必须在 中创建一个与 Gluten Accelerated Spark 引擎相关联的存储,以存储日志。watsonx.data

通过控制台进行调配

要添加 Gluten 加速 Spark 发动机,请完成以下步骤。

  1. 登录控制台 watsonx.data。

  2. 从导航菜单中选择基础设施管理器

  3. 要添加 Gluten 加速 Spark 引擎,请单击“添加组件”,单击 IBM Spark,然后单击“下一步”。

  4. 在“添加组件- IBM Spark”页面的“类型”部分,选择 Gluten 加速 Spark 引擎

  5. 添加组件 - IBM Spark 页面,配置以下详细信息:

    a. 在添加组件 - 谷蛋白加速 Spark 引擎窗口中,输入谷蛋白加速 Spark 引擎的显示名称。 c. 配置以下详细信息:

    供应谷筋加速 Spark 引擎
    字段 描述
    默认 Spark 版本 选择处理应用程序时必须考虑的 Spark 运行时版本。 Gluten 加速 Spark 引擎支持版本 3.4。
    发动机归位桶 从列表中选择已注册的 Cloud Object Storage bucket,以存储运行 spark 应用程序时生成的 Spark 事件和日志。
    注意,确保不要选择 IBM 管理的水桶作为火花引擎原点。 如果选择 IBM 管理的存储桶,则无法访问该存储桶查看日志。
    有关更多信息,请参阅 开始之前
    备用容量(有条件) 若您使用的版本早于 1. watsonx.data 0 2.3,请在此处指定该字段。 选择类型 Node
    2. 在 No of nodes(节点数 )字段中输入节点数。
    相关目录(可选) 选择必须与发动机关联的目录。
  6. 单击创建。 引擎已调配,并显示在基础架构管理器页面中。

通过应用程序接口进行调配

  1. 使用以下 CURL 命令创建 Gluten Accelerated Spark 引擎。

v2 API

curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines   -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {

    "description": "",

    "engine_details": {

        "default_version": "3.4",

        "scale_config": {

            "node_type": "small",

            "number_of_nodes": 1

        },

        "engine_home_bucket_name": "`<engine-home-bucket>`"

    },

    "engine_display_name": "`<gluten_engine_name>`",

    "associated_catalogs": [

        "<catalog_name>"

    ],

    "origin": "native",
    "type": "gluten"

}

   }

参数值:

  • <region> 实例 watsonx.data 可用的区域。
  • <CRN>: watsonx.data 实例 CRN。 您可以从 watsonx.data 信息页面检索 CRN。
  • <engine-home-bucket> 存储:用于监控和调试 Spark 应用程序的存储。
  • <gluten_engine_name>:为 Gluten 加速 Spark 引擎指定名称。
  • <catalog_name>:为使用的目录指定一个名称。 面筋加速 Spark 支持 Iceberg、Hudi、Delta 和 Hive 目录。

V3 应用程序接口


curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"

要使用 Gluten 加速 Spark 引擎提交 Spark 应用程序,请参阅 提交 Spark 应用程序