プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン
グルテン・アクセル・スパーク・エンジンは、 watsonx.data に最適化された高性能エンジンである。 Sparkエンジンは、SQLの実行をオープンソースの実行エンジンであるVelox(C++で実装されている)にオフロードするためにGlutenを使用し、それによってワークロードの実行コストを削減するために SparkSQL。
プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン
適用対象 : グルテン加速スパークエンジン
IBM watsonx.data は、複雑で大規模なワークロードを実行するために、グルテンアクセラレーションされたSparkエンジンをプロビジョニングすることができます。 グルテンは、大規模なハードウェア上で実行された場合、卓越したパフォーマンスを発揮する。
Gluten Accelerated Spark エンジンのプロビジョニングには、以下の方法を使用できます:
- コンソールによるプロビジョニング
- APIによるプロビジョニング
前提条件
- watsonx.data on Cloudの契約が必要です。
<engine-home-bucket>watsonx.data に、ログを保存するための Gluten Accelerated Spark エンジンに関連付けられているストレージを作成する必要があります。
コンソールによるプロビジョニング
グルテン加速スパークエンジンを追加するには、以下の手順を実行します。
-
watsonx.data コンソールにログインします。
-
ナビゲーションメニューから、 インフラストラクチャマネージャー を選択してください。
-
Gluten accelerated Spark エンジンを追加するには、[ Add component ] をクリックし、[ IBM Spark ] をクリックして [ Next] をクリックします。
-
Add component- IBM Spark ページで、 Type セクションから Gluten accelerated Spark engine を選択する。
-
Add component - IBM Spark ページで、以下の詳細を設定する:
a. Add component - Gluten accelerated Spark engine ウィンドウで、Gluten accelerated Spark エンジンの表示名を入力します。 c. 以下の詳細を設定する:
プロビジョニング・グルテン・アクセラレーション・スパーク・エンジン フィールド 説明 デフォルトのSparkバージョン アプリケーションの処理に使用する Spark ランタイムのバージョンを選択します。 グルテン アクセラレーション スパーク エンジン サポート バージョン 3.4. エンジンホームバケット 登録されている Cloud Object Storage バケットをリストから選択し、スパークアプリケーションの実行中に生成されるスパークイベントとログを保存します。
注意 スパークエンジンホームとして IBM- 管理バケットを選択しないようにしてください。 IBM-管理バケットを選択した場合、そのバケットにアクセスしてログを見ることはできません。
詳しくは、 始めにを参照してください。予備容量(条件付き) バージョン より 2.3 前のバージョンを watsonx.data 使用している場合は、このフィールドを指定してください。 タイプ Node を選択してください。
2. No of nodes フィールドにノードの数を入力する。関連カタログ(オプション) エンジンに関連付けなければならないカタログを選択します。 -
「作成」 をクリックします。 エンジンがプロビジョニングされ、 Infrastructure Manager ページに表示されます。
APIによるプロビジョニング
- 以下のCURLコマンドを使用して、Gluten Accelerated Sparkエンジンを作成します。
v2 API
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
パラメーター値:
<region>インスタンス watsonx.data が利用可能な地域。<CRN>: watsonx.data インスタンス CRN。 CRNは、 watsonx.data の情報ページから取得できます。<engine-home-bucket>Sparkアプリケーションの監視とデバッグを可能にするストレージ。<gluten_engine_name>:グルテン アクセラレーション スパーク エンジンの名前を指定します。<catalog_name>:使用するカタログの名前を指定します。 グルテン・アクセラレーション・スパークは、アイスバーグ、フーディ、デルタ、 Hive のカタログをサポートしている。
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
Gluten accelerated Sparkエンジンを使用してSparkアプリケーションを提出するには、 Sparkアプリケーションの提出を 参照してください。