Servidor de historial de Spark

Las aplicaciones Spark que se envían en una instancia de IBM Analytics Engine reenvían sus sucesos de Spark al grupo Object Storage que se ha definido como inicio de instancia. El servidor de historial de Spark proporciona una Web UI para ver estos sucesos de Spark. La Web UI le ayuda a analizar cómo se han ejecutado las aplicaciones Spark mostrando información útil como:

  • Una lista de las etapas por las que pasa la aplicación cuando se ejecuta
  • El número de tareas en cada etapa
  • Los detalles de configuración como, por ejemplo, los ejecutores en ejecución y el uso de memoria

Consulte la documentación del servidor de historial de Spark para obtener más detalles.

Puede inhabilitar el reenvío de sucesos de Spark desde una aplicación Spark estableciendo la propiedad spark.eventLog.enabled en false en la configuración de la aplicación Spark.

Inicio y detención del servidor de historial de Spark

Antes de acceder al servidor de historial de Spark, debe iniciar el servidor. Cuando ya no lo necesite, debe detener el servidor. Se le facturará por los núcleos de CPU y la memoria consumida por el servidor de historial de Spark mientras se está ejecutando.

El servidor de historial de Spark se puede iniciar y detener utilizando:

API REST de Analytics Engine

Puede utilizar la API REST Analytics Engine:

  1. Para ver el estado del servidor de historial de Spark

    curl "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>"
    
  2. Para iniciar el servidor de historial de Spark

    curl --location --request POST "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>"
    
  3. Para detener el servidor de historial de Spark

    curl --location --request DELETE "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/spark_history_server" --header "Authorization: bearer <iam token>"
    

Interfaz de usuario de instancia de Analytics Engine

Puede utilizar la interfaz de usuario de instancia de Analytics Engine: ​

  1. Para ver el estado del servidor de historial de Spark:

    1. Abra la lista de recursos en IBM Cloud.
    2. Pulse Servicios y software y seleccione la instancia para abrir la página de detalles.
    3. Seleccione la pestaña Historial de Spark. El estado actual del servidor se muestra en esta página.

    Si el estado del servidor de historial de Spark se establece en Started, también puede pulsar Ver historial de Spark para iniciar la Web UI del servidor de historial de Spark en una nueva pestaña del navegador.

  2. Para iniciar el servidor de historial de Spark:

    1. En la página Spark history, pulse Iniciar servidor de historial.
    2. Elija la configuración del servidor y pulse Iniciar para iniciar el servidor de historial de Spark.
  3. Para detener el servidor de historial de Spark:

    1. En la página Spark history, pulse Detener servidor de historial.

Apertura de la Web UI del servidor de historial de Spark

Puede abrir la Web UI del historial de Spark abriendo la página de detalles de instancia de la instancia de servicio de Analytics Engine, cambiando al separador Historial de Spark y pulsando Ver historial de Spark.

De forma alternativa, el URL de Web UI del servidor de historial de Spark se puede obtener a través de un punto final de servicio que se pone a su disposición como clave de servicio (también conocida como credencial de servicio). Consulte Recuperación de puntos finales de servicio.

Asegúrese de que el servidor de historial de Spark se esté ejecutando antes de abrir la Web UI.

Los enlaces de registro bajo las pestañas Etapas y Ejecutores de la interfaz de usuario del servidor de historial de Spark no funcionarán, ya que los registros no se conservan con los sucesos de Spark. Para revisar los registros de tarea y ejecutor, habilite el registro de plataforma. Para obtener detalles, consulte Configuración y visualización de registros.

Para ver aplicaciones más antiguas en la interfaz de usuario del servidor de historial de Spark, copie los sucesos spark de la vía de acceso antigua a la nueva utilizando el mandato: ibmcloud cos object-copy -- bucket < destination_bucket> -- key /spark-events/<eventlog_app-1>-- copy-source /spark-events/<eventlog_app-1>

Acceso a la API REST del servidor de historial de Spark

Además de la interfaz de usuario web, el servidor de historial de Spark también proporciona una API REST que se puede consultar para ver los sucesos de Spark generados por las aplicaciones Spark. La API REST del servidor de historial de Spark está disponible como un punto final de servicio en una clave de servicio (también conocida como credencial de servicio). Consulte Recuperación de puntos finales de servicio.

Al invocar la API REST del servidor de historial de Spark, debe especificar la señal de IAM como una señal portadora en la cabecera de autorización. E.g.

curl --location --request GET 'https://spark-console.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance id>/spark_history_api/v1/applications?status=completed' \
--header 'Authorization: Bearer <iam token>'

Consulte la documentación de la API REST del servidor de historial de Spark para obtener más detalles.

Personalización del servidor de historial de Spark

De forma predeterminada, el servidor de historial de Spark consume 1 núcleo de CPU y 4 GiB de memoria mientras se está ejecutando. Si desea que el servidor de historial de Spark utilice más recursos, puede establecer las propiedades siguientes en las configuraciones predeterminadas de la instancia de Analytics Engine:

  • ae.spark.history-server.cores para el número de núcleos de CPU
  • ae.spark.history-server.memory para la cantidad de memoria

Actualización de los núcleos de CPU y los valores de memoria utilizando la API REST

Puede actualizar los núcleos de CPU y los valores de memoria utilizando la API REST Analytics Engine de la siguiente manera:

curl --location --request PATCH "https://api.us-south.ae.cloud.ibm.com/v3/analytics_engines/<instance_id>/default_configs" \
--header "Authorization: bearer <iam_token>" \
--header 'Content-Type: application/json' \
--data-raw '{
        "ae.spark.history-server.cores": "2",
        "ae.spark.history-server.memory": "8G"
}'

Solo se da soporte a una lista predefinida de vCPUde controlador y ejecutor de Spark y a combinaciones de tamaño de memoria. Consulte Controlador y ejecutor de Spark soportado vCPU y combinaciones de memoria.

Personalizaciones adicionales

Puede personalizar más el servidor de historial de Spark añadiendo propiedades a la configuración de Spark predeterminada de la instancia de Analytics Engine. Consulte Opciones de configuración de historial de Sparkestándar.

Como se trata de una oferta gestionada, no puede personalizar todas las opciones de configuración estándar de Spark.

Para obtener una lista de las configuraciones soportadas y los valores predeterminados para los valores, consulte Configuración de Spark predeterminada.

Prácticas recomendadas

Detenga siempre el servidor de historial de Spark cuando ya no necesite utilizarlo. Tenga en cuenta que el servidor de historial de Spark consume recursos de CPU y memoria continuamente mientras su estado es Started.