Bereitstellung von Gluten beschleunigte Spark-Engine
Gluten beschleunigte Spark-Motor ist ein optimierter, leistungsstarker Motor in watsonx.data. Die Spark-Engine verwendet Gluten, um die SQL-Ausführung an Velox auszulagern. Velox ist eine Open-Source-Ausführungsengine (implementiert in C++), die die Berechnung von SparkSQL beschleunigt, um die Kosten für die Ausführung der Arbeitslasten zu senken.
Bereitstellung von Gluten beschleunigte Spark-Engine
Gilt für: Glutenbeschleunigter Spark-Motor
IBM watsonx.data ermöglicht Ihnen die Bereitstellung einer Gluten-beschleunigten Spark-Engine zur Ausführung komplexer, umfangreicher Arbeitslasten. Gluten bietet eine außergewöhnliche Leistung, wenn es auf großer Hardware ausgeführt wird.
Sie können die folgenden Methoden verwenden, um Gluten Accelerated Spark Engine bereitzustellen:
- Provisionierung über die Konsole
- Bereitstellung über API
Voraussetzungen
- Sie müssen ein Abonnement von watsonx.data on Cloud haben.
<engine-home-bucket>sie müssen einen Speicher in watsonx.data erstellen, der mit Ihrer Gluten Accelerated Spark-Engine verbunden wird, um die Protokolle zu speichern.
Provisionierung über die Konsole
Um einen beschleunigten Spark-Motor von Gluten hinzuzufügen, führen Sie die folgenden Schritte aus.
-
Melden Sie sich an der watsonx.data-Konsole an.
-
Wählen Sie im Navigationsmenü „Infrastrukturmanager“ aus.
-
Um eine Gluten beschleunigte Spark-Engine hinzuzufügen, klicken Sie auf Komponente hinzufügen, auf IBM Spark und auf Weiter.
-
Wählen Sie auf der Seite Komponente hinzufügen - IBM Spark im Abschnitt Typ die Option Gluten accelerated Spark engine aus.
-
Auf der Seite Komponente hinzufügen - IBM Spark konfigurieren Sie die folgenden Details:
a. Geben Sie im Fenster Komponente hinzufügen - Glutenbeschleunigte Spark-Engine den Anzeigenamen für Ihre Glutenbeschleunigte Spark-Engine ein. c. Konfigurieren Sie die folgenden Details:
Glutenbeschleunigte Spark-Engine für die Bereitstellung Feld Beschreibung Standard-Spark-Version Wählen Sie die Spark-Laufzeitversion, die für die Verarbeitung der Anwendungen berücksichtigt werden muss. Die glutenbeschleunigte Spark-Engine unterstützt die Version 3.4. Motor nach Hause Eimer Wählen Sie den registrierten Cloud Object Storage Bucket aus der Liste aus, um die Spark-Ereignisse und -Protokolle zu speichern, die während der Ausführung von Spark-Anwendungen erzeugt werden.
Hinweis Stellen Sie sicher, dass Sie nicht den IBM-managed Bucket als Spark-Engine-Home auswählen. Wenn Sie einen von IBM verwalteten Bucket auswählen, können Sie nicht auf ihn zugreifen, um die Protokolle anzuzeigen.
Weitere Informationen finden Sie unter Vorbereitende Schritte.Reservekapazität (bedingt) Geben Sie dieses Feld an, wenn Sie eine Version vor 2.3 von verwenden watsonx.data. 1. Wählen Sie den Node Typ aus.
2. Geben Sie die Anzahl der Knoten in das Feld Anzahl der Knoten ein.Zugehörige Kataloge (optional) Wählen Sie die Kataloge aus, die mit dem Motor verknüpft werden müssen. -
Klicken Sie auf Erstellen. Die Engine wird bereitgestellt und auf der Seite Infrastrukturmanager angezeigt.
Bereitstellung über API
- Verwenden Sie den folgenden CURL-Befehl, um eine Gluten Accelerated Spark Engine zu erstellen.
v2-API
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
Parameterwerte:
<region>Die Region, in der die watsonx.data Instanz verfügbar ist.<CRN>: Die watsonx.data Instanz CRN. Sie können die CRN auf der Informationsseite watsonx.data abrufen.<engine-home-bucket>der Speicher, mit dem Sie die Spark-Anwendung überwachen und debuggen können.<gluten_engine_name>: Geben Sie einen Namen für die glutenbeschleunigte Spark-Engine an.<catalog_name>: Geben Sie einen Namen für den Katalog an, den Sie verwenden. Der glutenbeschleunigte Spark unterstützt die Kataloge Iceberg, Hudi, Delta und Hive.
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
Um Spark-Anwendungen mit der beschleunigten Spark-Engine von Gluten einzureichen, siehe Einreichen einer Spark-Anwendung.