Aprovisionamiento Gluten motor Spark acelerado
Gluten aceleró el motor Spark es un motor optimizado de alto rendimiento en watsonx.data. El motor Spark utiliza Gluten para descargar la ejecución SQL a Velox, que es un motor de ejecución de código abierto (implementado en C++), acelerando así el cálculo de SparkSQL para reducir el coste de ejecución de las cargas de trabajo.
Aprovisionamiento Gluten motor Spark acelerado
Aplicable a: Motor Spark acelerado por gluten
IBM watsonx.data le permite aprovisionar un motor Spark acelerado por Gluten para ejecutar cargas de trabajo complejas a gran escala. Gluten ofrece un rendimiento excepcional cuando se ejecuta en hardware de gran tamaño.
Puede utilizar los siguientes métodos para aprovisionar el motor Gluten Accelerated Spark:
- Aprovisionamiento a través de la consola
- Aprovisionamiento a través de API
Requisitos previos
- Debe tener una suscripción de watsonx.data en Cloud.
<engine-home-bucket>: Debe crear un almacenamiento en watsonx.data, que se asociará con su motor Gluten Accelerated Spark para almacenar los registros.
Aprovisionamiento a través de la consola
Para añadir un motor Spark acelerado Gluten, complete los siguientes pasos.
-
Inicie una sesión en la consola de watsonx.data.
-
En el menú de navegación, seleccione Administrador de infraestructura.
-
Para añadir un motor Spark acelerado por Gluten, haga clic en Añadir componente, en IBM Spark y en Siguiente.
-
En la página Add component- IBM Spark, en la sección Type, seleccione Gluten accelerated Spark engine.
-
En la página Añadir componente - IBM Spark, configure los siguientes detalles:
a. En la ventana Añadir componente - Motor Spark acelerado por Gluten, introduzca el Nombre para mostrar de su motor Spark acelerado por Gluten. c. Configure los siguientes detalles:
Aprovisionamiento Gluten motor Spark acelerado Campo Descripción Versión Spark por defecto Seleccione la versión de tiempo de ejecución de Spark que debe tenerse en cuenta para procesar las aplicaciones. Gluten acelerado Spark motor de apoyo versión 3.4. Cubo de inicio del motor Seleccione el bucket Cloud Object Storage registrado de la lista para almacenar los eventos y registros de Spark que se generan durante la ejecución de aplicaciones Spark.
Nota Asegúrese de no seleccionar el cubo gestionado por IBM como Spark engine home. Si selecciona un bucket gestionado por IBM, no podrá acceder a él para ver los registros.
Para obtener más información, consulte la sección Antes de empezar.Capacidad de reserva (condicional) Especifique este campo si utiliza una versión anterior a 2.3 de watsonx.data. 1. Seleccione el Node Tipo.
2. Introduzca el número de nodos en el campo Nº de nodos.Catálogos asociados (opcional) Seleccione los catálogos que deben asociarse al motor. -
Pulse Crear. El motor se aprovisiona y se muestra en la página Administrador de infraestructuras.
Aprovisionamiento a través de API
- Utilice el siguiente comando CURL para crear un motor Gluten Accelerated Spark.
API de v2
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
Valores de parámetros:
<region>: La región en la que está disponible la watsonx.data instancia.<CRN>: El CRN de la instancia watsonx.data. Puede recuperar el CRN en la página de información watsonx.data.<engine-home-bucket>: El almacenamiento que permite monitorizar y depurar la aplicación Spark.<gluten_engine_name>: Especifique un nombre para el motor Spark acelerado por Gluten.<catalog_name>: Especifique un nombre para el catálogo que utiliza. Gluten accelerated Spark es compatible con los catálogos Iceberg, Hudi, Delta y Hive.
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
Para enviar aplicaciones Spark utilizando el motor Spark acelerado de Gluten, consulte Enviar una aplicación Spark.