Provisionamento do mecanismo Spark acelerado pelo Gluten
O motor Gluten acelerado Spark é um motor otimizado e de alto desempenho no site watsonx.data. O mecanismo Spark usa o Gluten para transferir a execução de SQL para o Velox, que é um mecanismo de execução de código aberto (implementado em C++), acelerando assim o cálculo de SparkSQL para reduzir o custo de execução das cargas de trabalho.
Provisionamento do mecanismo Spark acelerado pelo Gluten
Aplica-se a: Motor Spark acelerado por glúten
IBM watsonx.data permite que você provisione um mecanismo Spark acelerado por Gluten para executar cargas de trabalho complexas em grande escala. O Gluten oferece desempenho excepcional quando executado em hardware de grande porte.
Você pode usar os seguintes métodos para provisionar o mecanismo Gluten Accelerated Spark:
- Provisionamento por meio do console
- Provisionamento por meio de API
Pré-requisitos
- Você deve ter uma assinatura do watsonx.data on Cloud.
<engine-home-bucket>é necessário criar um armazenamento em watsonx.data, que será associado ao seu mecanismo Gluten Accelerated Spark para armazenar os registros.
Provisionamento por meio do console
Para adicionar um motor Gluten Spark acelerado, conclua as etapas a seguir.
-
Efetue login no console do watsonx.data.
-
No menu de navegação, selecione Gerenciador de infraestrutura.
-
Para adicionar um mecanismo Gluten accelerated Spark, clique em Add component, clique em IBM Spark e clique em Next.
-
Na página Add component- IBM Spark, na seção Type, selecione Gluten accelerated Spark engine.
-
Na página Adicionar componente - IBM Spark, configure os seguintes detalhes:
a. Na janela Adicionar componente - Mecanismo Spark acelerado por glúten, digite o Nome de exibição do mecanismo Spark acelerado por glúten. c. Configure os seguintes detalhes:
Provisionamento do mecanismo Spark acelerado pelo Gluten Campo Descrição Versão padrão do Spark Selecione a versão de tempo de execução do Spark que deve ser considerada para processar os aplicativos. Suporte ao mecanismo Spark acelerado por glúten versão 3.4. Balde de casa do motor Selecione o bucket Cloud Object Storage registrado na lista para armazenar os eventos e os logs do Spark que são gerados durante a execução de aplicativos Spark.
Observação Certifique-se de não selecionar o bucket gerenciado pelo IBM como Spark engine home. Se você selecionar um bucket gerenciado pelo IBM, não poderá acessá-lo para visualizar os logs.
Para obter mais informações, consulte Antes de iniciar.Capacidade de reserva (Condicional) Especifique este campo se estiver usando uma versão anterior à 2.3 1 watsonx.data. Selecione o Node Tipo.
2. Digite o número de nós no campo No of nodes (Número de nós ).Catálogos associados (opcional) Selecione os catálogos que devem ser associados ao mecanismo. -
Clique em Criar. O mecanismo é provisionado e exibido na página do Infrastructure Manager.
Provisionamento por meio de API
- Use o seguinte comando CURL para criar um mecanismo Gluten Accelerated Spark.
API v2
curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {
"description": "",
"engine_details": {
"default_version": "3.4",
"scale_config": {
"node_type": "small",
"number_of_nodes": 1
},
"engine_home_bucket_name": "`<engine-home-bucket>`"
},
"engine_display_name": "`<gluten_engine_name>`",
"associated_catalogs": [
"<catalog_name>"
],
"origin": "native",
"type": "gluten"
}
}
Valores de parâmetro:
<region>: A região onde a watsonx.data instância está disponível.<CRN>: A watsonx.data instância CRN. Você pode recuperar o CRN na página de informações watsonx.data.<engine-home-bucket>armazenamento: O armazenamento que permite monitorar e depurar o aplicativo Spark.<gluten_engine_name>: Especifique um nome para o mecanismo Spark acelerado por Gluten.<catalog_name>: Especifique um nome para o catálogo que você usa. O Spark acelerado por glúten é compatível com os catálogos Iceberg, Hudi, Delta e Hive.
V3 API
curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"
Para enviar aplicativos Spark usando o mecanismo Gluten Spark acelerado, consulte Envio de um aplicativo Spark.