Provisioning Gluten motore Spark accelerato

Il motore Gluten accelerato Spark è un motore ottimizzato ad alte prestazioni in watsonx.data. Il motore Spark utilizza Gluten per scaricare l'esecuzione di SQL su Velox, un motore di esecuzione open source (implementato in C++), accelerando così il calcolo di SparkSQL per ridurre i costi di esecuzione dei carichi di lavoro.

Provisioning Gluten motore Spark accelerato

Si applica a: Motore Spark accelerato dal glutine

IBM watsonx.data consente di fornire un motore Spark accelerato da Gluten per eseguire carichi di lavoro complessi su larga scala. Gluten offre prestazioni eccezionali quando viene eseguito su hardware di grandi dimensioni.

Per eseguire il provisioning del motore Gluten Accelerated Spark potete utilizzare i seguenti metodi:

  • Provisioning tramite console
  • Provisioning tramite API

Prerequisiti

  • È necessario avere un abbonamento a watsonx.data su Cloud.
  • <engine-home-bucket> è necessario creare un archivio in watsonx.data, che sarà associato al motore Gluten Accelerated Spark per memorizzare i registri.

Provisioning tramite console

Per aggiungere un motore Spark accelerato Gluten, completare i seguenti passaggi.

  1. Accedi alla watsonx.data console.

  2. Dal menu di navigazione, selezionare Gestione infrastrutture.

  3. Per aggiungere un motore Spark accelerato da Gluten, fate clic su Aggiungi componente, su IBM Spark e su Avanti.

  4. Nella pagina Aggiungi componente - IBM Spark, dalla sezione Tipo, selezionare Motore Spark accelerato con glutine.

  5. Nella pagina Aggiungi componente - IBM Spark, configurare i seguenti dettagli:

    a. Nella finestra Aggiungi componente - Motore Spark accelerato con glutine, inserire il nome del display per il motore Spark accelerato con glutine. c. Configurare i seguenti dettagli:

    Provisioning Gluten motore Spark accelerato
    Campo Descrizione
    Versione predefinita di Spark Selezionate la versione di runtime di Spark da considerare per l'elaborazione delle applicazioni. Supporto del motore Spark accelerato da glutine versione 3.4.
    Secchio del motore Selezionare il bucket Cloud Object Storage registrato dall'elenco per memorizzare gli eventi e i log di Spark generati durante l'esecuzione delle applicazioni spark.
    Nota Assicurarsi di non selezionare il bucket gestito da IBM come motore Spark home. Se si seleziona un bucket gestito da IBM, non è possibile accedervi per visualizzare i registri.
    Per ulteriori informazioni, vedi Prima di cominciare.
    Capacità di riserva (condizionata) Specificare questo campo se si utilizza una versione precedente alla 2.3 del watsonx.data. 1. Selezionare il Node Tipo.
    2. Inserire il numero di nodi nel campo No of nodes.
    Cataloghi associati (facoltativo) Selezionare i cataloghi che devono essere associati al motore.
  6. Fai clic su Crea. Il motore viene fornito e visualizzato nella pagina di Infrastructure Manager.

Provisioning tramite API

  1. Utilizzate il seguente comando CURL per creare un motore Gluten Accelerated Spark.

API v2

curl -X POST https://`<region>`.lakehouse.cloud.ibm.com/lakehouse/api/v2/spark_engines   -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: `<CRN>`" -d {

    "description": "",

    "engine_details": {

        "default_version": "3.4",

        "scale_config": {

            "node_type": "small",

            "number_of_nodes": 1

        },

        "engine_home_bucket_name": "`<engine-home-bucket>`"

    },

    "engine_display_name": "`<gluten_engine_name>`",

    "associated_catalogs": [

        "<catalog_name>"

    ],

    "origin": "native",
    "type": "gluten"

}

   }

Valori di parametro:

  • <region>: La regione in cui watsonx.data l'istanza è disponibile.
  • <CRN>: watsonx.data L'istanza CRN. È possibile recuperare il CRN dalla pagina informativa di watsonx.data.
  • <engine-home-bucket> l'archivio che consente di monitorare ed eseguire il debug dell'applicazione Spark.
  • <gluten_engine_name>: Specificare un nome per il motore Spark accelerato Gluten.
  • <catalog_name>: Specificare un nome per il catalogo utilizzato. Gluten accelerated Spark supporta i cataloghi Iceberg, Hudi, Delta e Hive.

V3 API


curl -X POST -H "content-type: application/json" -H "accept: application/json" -H "AuthInstanceId: {instance_id}" -d '{ "description": "spark engine description", "configuration": { "api_key": "apikey", "connection_string": "1.2.3.4", "instance_id": "spark-id", "managed_by": "fully/self" }, "display_name": "sampleEngine", "origin": "discover/external", "tags": [ "tag1", "tag2" ], "type": "spark" }' "https://{region}.lakehouse.cloud.ibm.com/lakehouse/api/v3/spark_engines"

Per presentare applicazioni Spark utilizzando il motore Spark accelerato Gluten, vedere Presentazione di un'applicazione Spark.