Approvisionnement du moteur Spark accéléré par Gluten
Le moteur accéléré Gluten Spark est un moteur optimisé et performant sur watsonx.data. Le moteur Spark utilise Gluten pour décharger l'exécution SQL sur Velox, qui est un moteur d'exécution open source (implémenté en C++), accélérant ainsi le calcul de SparkSQL pour réduire le coût d'exécution des charges de travail.
Approvisionnement du moteur Spark accéléré par Gluten
S'applique à: Moteur Spark accéléré par gluten
IBM watsonx.data vous permet de provisionner un moteur Spark accéléré par Gluten pour exécuter des charges de travail complexes à grande échelle. Gluten offre des performances exceptionnelles lorsqu'il est utilisé sur du matériel de grande taille.
Vous pouvez utiliser les méthodes suivantes pour provisionner le moteur Gluten Accelerated Spark :
- Approvisionnement par le biais de la console
- Approvisionnement par l'API
Prérequis
- Vous devez avoir un abonnement à watsonx.data on Cloud.
<engine-home-bucket>pour cela, vous devez créer un espace de stockage dans watsonx.data, qui sera associé à votre moteur Gluten Accelerated Spark pour stocker les logs.
Approvisionnement par le biais de la console
Pour ajouter un moteur Spark accéléré Gluten, suivez les étapes suivantes.
-
Connectez-vous à la console watsonx.data.
-
Dans le menu de navigation, sélectionnez Gestionnaire d'infrastructure.
-
Pour ajouter un moteur Spark accéléré Gluten, cliquez sur Ajouter un composant, cliquez sur IBM Spark et cliquez sur Suivant.
-
Dans la page Ajouter un composant - IBM Spark, dans la section Type, sélectionnez Gluten accelerated Spark engine.
-
Dans la page Ajouter un composant - IBM Spark, configurez les détails suivants :
a. Dans la fenêtre Ajouter un composant - Moteur Spark accéléré par Gluten, entrez le nom d'affichage de votre moteur Spark accéléré par Gluten. c. Configurez les détails suivants :
Approvisionnement du moteur Spark accéléré par Gluten Zone Description Version par défaut de Spark Sélectionnez la version d'exécution de Spark à prendre en compte pour le traitement des applications. Support du moteur Spark accéléré Gluten version 3.4. Godet pour le logement du moteur Sélectionnez le seau Cloud Object Storage enregistré dans la liste pour stocker les événements et les journaux Spark générés lors de l'exécution des applications Spark.
Note Assurez-vous de ne pas sélectionner le seau géré par IBM comme point de départ du moteur Spark. Si vous sélectionnez un godet géré par IBM, vous ne pouvez pas y accéder pour consulter les journaux.
Pour plus d'informations, reportez-vous à la rubrique Avant de commencer.Capacité de réserve (conditionnelle) Indiquez ce champ si vous utilisez une version antérieure à 2.3 de watsonx.data. 1. Sélectionnez le Node Type.
2. Saisissez le nombre de nœuds dans le champ No of nodes.Catalogues associés (facultatif) Sélectionnez les catalogues qui doivent être associés au moteur. -
Cliquez sur Créer. Le moteur est provisionné et s'affiche dans la page du gestionnaire d'infrastructure.
Approvisionnement par l'API
- Utilisez la commande CURL suivante pour créer un moteur Gluten Accelerated Spark.
API v2
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
Valeurs des paramètres :
<region>: La région dans laquelle watsonx.data l'instance est disponible.<CRN>: L'instance watsonx.data CRN. Vous pouvez récupérer le CRN à partir de la page d'information watsonx.data.<engine-home-bucket>le stockage qui vous permet de surveiller et de déboguer l'application Spark.<gluten_engine_name>: Spécifiez un nom pour le moteur Spark accéléré Gluten.<catalog_name>: Spécifiez un nom pour le catalogue que vous utilisez. Gluten accelerated Spark prend en charge les catalogues Iceberg, Hudi, Delta et Hive.
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
Pour soumettre des applications Spark à l'aide du moteur Spark accéléré Gluten, voir Soumettre une application Spark.