Server cronologia Spark
Le applicazioni Spark inoltrate in un'istanza IBM Analytics Engine inoltrano gli eventi Spark al bucket Object Storage definito come home dell'istanza. Il server della cronologia Spark fornisce un'interfaccia utente web ( Web UI ) per visualizzare questi eventi Spark. L' Web UI consente di analizzare il modo in cui vengono eseguite le applicazioni Spark visualizzando informazioni utili come:
- Un elenco delle fasi che l'applicazione attraversa quando viene eseguita
- Il numero di attività in ogni fase
- I dettagli di configurazione come gli executor in esecuzione e l'utilizzo della memoria
Per ulteriori dettagli, vedi la documentazione del server Spark History.
È possibile disabilitare l'inoltro di eventi Spark da una applicazione Spark impostando la proprietà spark.eventLog.enabled su false nella configurazione dell'applicazione Spark.
Avvio e arresto del server della cronologia Spark
Prima di accedere al server della cronologia Spark, è necessario avviare il server. Quando non è più necessario, arrestare il server. Ti verranno addebitati i core CPU e la memoria utilizzati dal server della cronologia Spark mentre è in esecuzione.
Il server della cronologia Spark può essere avviato e arrestato utilizzando:
- L' API RESTAnalytics Engine
- IU dell'istanza Analytics Engine
API REST Analytics Engine
Puoi utilizzare l'API REST Analytics Engine:
-
Per visualizzare lo stato del server di cronologia Spark
curl "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>" -
Per avviare il server di cronologia Spark
curl --location --request POST "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>" -
Per arrestare il server della cronologia Spark
curl --location --request DELETE "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>"
IU istanza Analytics Engine
Puoi utilizzare l'IU dell'istanza Analytics Engine:
-
Per visualizzare lo stato del server della cronologia Spark:
- Apri il tuo elenco di risorse su IBM Cloud.
- Fare clic su Servizi e software e selezionare l'istanza per aprire la pagina dei dettagli.
- Selezionare la scheda Spark history. Lo stato corrente del server viene visualizzato in questa pagina.
Se lo stato del server della cronologia Spark è impostato su
Started, è anche possibile fare clic su Visualizza cronologia Spark per avviare l' Web UI del server della cronologia Spark in una nuova scheda del browser. -
Per avviare il server della cronologia Spark:
- Nella pagina
Spark history, fare clic su Avvia server cronologia. - Scegliere la configurazione del server e fare clic su Avvia per avviare il server della cronologia Spark.
- Nella pagina
-
Per arrestare il server della cronologia Spark:
- Nella pagina di
Spark history, fare clic su Arresta server della cronologia.
- Nella pagina di
Apertura del server della cronologia Spark Web UI
Puoi aprire la Web UI della cronologia Spark aprendo la pagina dei dettagli dell'istanza del tuo servizio Analytics Engine, passando alla scheda Spark history e facendo clic su View Spark history.
In alternativa, l'URL Web UI del server della cronologia Spark può essere ottenuto tramite un endpoint del servizio reso disponibile come chiave del servizio (nota anche come credenziale del servizio). Vedi Richiamo degli endpoint del servizio.
Assicurarsi che il server della cronologia Spark sia in esecuzione prima di aprire l' Web UI.
I collegamenti di log nelle schede Stages e Executors della UI del server della cronologia Spark non funzioneranno poiché i registri non sono conservati con gli eventi Spark. Per esaminare i log dell'attività e dell'executor, abilitare la registrazione della piattaforma. Per i dettagli, vedi Configurazione e visualizzazione dei log.
Per visualizzare le applicazioni meno recenti nell'interfaccia utente del server della cronologia Spark, copia gli spark - events dal vecchio percorso al nuovo utilizzando il comando: ibmcloud cos object - copy -- bucket < porta_destinazione>
-- key
Accesso all'API REST del server della cronologia Spark
Oltre alla IU web, il server della cronologia Spark fornisce anche un'API REST che può essere interrogata per visualizzare gli eventi Spark generati dalle tue applicazioni Spark. L'API REST del server della cronologia Spark è disponibile come endpoint del servizio in una chiave del servizio (nota anche come credenziale del servizio). Vedi Richiamo degli endpoint del servizio.
Quando richiami l'API REST del server della cronologia Spark, devi specificare il tuo token IAM come token di connessione nell'intestazione Authorization. E.g.
curl --location --request GET 'https://spark-console.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance id>/spark_history_api/v1/applications?status=completed' \
--header 'Authorization: Bearer <iam token>'
Per ulteriori dettagli, vedi la documentazione API REST del server della cronologia Spark.
Personalizzazione del server di cronologia Spark
Per impostazione predefinita, il server della cronologia Spark utilizza 1 core CPU e 4 GiB di memoria mentre è in esecuzione. Se si desidera che il server della cronologia Spark utilizzi ulteriori risorse, è possibile impostare le proprietà riportate di seguito nelle configurazioni predefinite dell'istanza di Analytics Engine:
ae.spark.history-server.coresper il numero di core CPUae.spark.history-server.memoryper la quantità di memoria
Aggiornamento dei core della CPU e delle impostazioni della memoria utilizzando l'API REST
Puoi aggiornare i core della CPU e le impostazioni della memoria utilizzando l'API REST Analytics Engine come segue:
curl --location --request PATCH "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/default_configs" \
--header "Authorization: bearer <iam_token>" \
--header 'Content-Type: application/json' \
--data-raw '{
"ae.spark.history-server.cores": "2",
"ae.spark.history-server.memory": "8G"
}'
Sono supportati solo un elenco predefinito di combinazioni di driver ed executor Spark vCPUe dimensione della memoria. Vedi Supported Spark driver and executor vCPU e combinazioni di memoria.
Personalizzazioni aggiuntive
Puoi personalizzare ulteriormente il server della cronologia Spark aggiungendo proprietà alla configurazione Spark predefinita della tua istanza Analytics Engine. Vedi Opzioni di configurazione della cronologia Sparkstandard.
Poiché si tratta di un'offerta gestita, non è possibile personalizzare tutte le opzioni di configurazione Spark standard.
Per un elenco delle configurazioni supportate e i valori predefiniti per le impostazioni, vedi Configurazione Spark predefinita.
Procedure consigliate
Arrestare sempre il server della cronologia Spark quando non è più necessario utilizzarlo. Tieni presente che il server della cronologia Spark consuma continuamente risorse di memoria e CPU mentre il suo stato è Started.