プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン

グルテン・アクセル・スパーク・エンジンは、 watsonx.data に最適化された高性能エンジンである。 Sparkエンジンは、SQLの実行をオープンソースの実行エンジンであるVelox(C++で実装されている)にオフロードするためにGlutenを使用し、それによってワークロードの実行コストを削減するために SparkSQL。

プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン

適用対象グルテン加速スパークエンジン

IBM watsonx.data は、複雑で大規模なワークロードを実行するために、グルテンアクセラレーションされたSparkエンジンをプロビジョニングすることができます。 グルテンは、大規模なハードウェア上で実行された場合、卓越したパフォーマンスを発揮する。

Gluten Accelerated Spark エンジンのプロビジョニングには、以下の方法を使用できます:

  • コンソールによるプロビジョニング
  • APIによるプロビジョニング

前提条件

  • watsonx.data on Cloudの契約が必要です。
  • <engine-home-bucket> watsonx.data に、ログを保存するための Gluten Accelerated Spark エンジンに関連付けられているストレージを作成する必要があります。

コンソールによるプロビジョニング

グルテン加速スパークエンジンを追加するには、以下の手順を実行します。

  1. watsonx.data コンソールにログインします。

  2. ナビゲーションメニューから、 インフラストラクチャマネージャー を選択してください。

  3. Gluten accelerated Spark エンジンを追加するには、[ Add component ] をクリックし、[ IBM Spark ] をクリックして [ Next] をクリックします。

  4. Add component- IBM Spark ページで、 Type セクションから Gluten accelerated Spark engine を選択する。

  5. Add component - IBM Spark ページで、以下の詳細を設定する:

    a. Add component - Gluten accelerated Spark engine ウィンドウで、Gluten accelerated Spark エンジンの表示名を入力します。 c. 以下の詳細を設定する:

    プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン
    フィールド 説明
    デフォルトのSparkバージョン アプリケーションの処理に使用する Spark ランタイムのバージョンを選択します。 グルテン アクセラレーション スパーク エンジン サポート バージョン 3.4.
    エンジンホームバケット 登録されている Cloud Object Storage バケットをリストから選択し、スパークアプリケーションの実行中に生成されるスパークイベントとログを保存します。
    注意 スパークエンジンホームとして IBM- 管理バケットを選択しないようにしてください。 IBM-管理バケットを選択した場合、そのバケットにアクセスしてログを見ることはできません。
    詳しくは、 始めにを参照してください。
    予備容量(条件付き) バージョン より 2.3 前のバージョンを watsonx.data 使用している場合は、このフィールドを指定してください。 タイプ Node を選択してください。
    2. No of nodes フィールドにノードの数を入力する。
    関連カタログ(オプション) エンジンに関連付けなければならないカタログを選択します。
  6. 「作成」 をクリックします。 エンジンがプロビジョニングされ、 Infrastructure Manager ページに表示されます。

APIによるプロビジョニング

  1. 以下のCURLコマンドを使用して、Gluten Accelerated Sparkエンジンを作成します。

v2 API

curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines   -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {

    "description": "",

    "engine_details": {

        "default_version": "3.4",

        "scale_config": {

            "node_type": "small",

            "number_of_nodes": 1

        },

        "engine_home_bucket_name": "`<engine-home-bucket>`"

    },

    "engine_display_name": "`<gluten_engine_name>`",

    "associated_catalogs": [

        "<catalog_name>"

    ],

    "origin": "native",
    "type": "gluten"

}

   }

パラメーター値:

  • <region> インスタンス watsonx.data が利用可能な地域。
  • <CRN>: watsonx.data インスタンス CRN。 CRNは、 watsonx.data の情報ページから取得できます。
  • <engine-home-bucket> Sparkアプリケーションの監視とデバッグを可能にするストレージ。
  • <gluten_engine_name>:グルテン アクセラレーション スパーク エンジンの名前を指定します。
  • <catalog_name>:使用するカタログの名前を指定します。 グルテン・アクセラレーション・スパークは、アイスバーグ、フーディ、デルタ、 Hive のカタログをサポートしている。

V3 API


curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"

Gluten accelerated Sparkエンジンを使用してSparkアプリケーションを提出するには、 Sparkアプリケーションの提出を 参照してください。