Pannelli di controllo di supporto

PrestoIBM® watsonx.data ( Java ) offre un'osservabilità completa attraverso una serie di dashboard affidabili che forniscono visibilità sulle metriche delle prestazioni, consentendo una rapida diagnosi dei problemi e ottimizzando l'allocazione delle risorse.

Di seguito sono riportati i dashboard supportati:

  • Integrità del sistema
  • Stato delle prestazioni delle query
  • Integrità dei dati e dei metadati
  • Stato di salute del carico di lavoro
  • Stato della latenza delle query
  • Stato del ciclo di vita delle query
  • Approfondimenti su anomalie e tendenze
  • Registro e stato di errore

Lo Grafana strumento fornisce supporto solo per le seguenti quattro dashboard: integrità del sistema, integrità delle prestazioni delle query, integrità dei dati e dei metadati e integrità del carico di lavoro, mentre lo strumento Instana supporta tutte e otto le dashboard.

Il seguente elenco rappresenta l'insieme predefinito di metriche Presto ( Java ). Gli utenti possono estenderlo aggiungendo ulteriori metriche secondo necessità. Un elenco completo delle metriche disponibili e delle relative definizioni è disponibile in metriche Presto JMX esposte.

Integrità del sistema

Il monitoraggio dell'infrastruttura sottostante è fondamentale per Presto. Si concentra sull'infrastruttura di base, monitorando risorse fondamentali quali CPU, memoria e I/O per individuare eventuali colli di bottiglia e garantire operazioni stabili.

Presto ( Java ) motore:

  • Utilizzo della CPU- Monitora l'utilizzo della CPU tra Presto le istanze.

    • process_cpu_seconds_total
  • Utilizzo della memoria: tiene traccia della memoria totale utilizzata rispetto a quella disponibile

    • watsonx_data_presto_cluster_memory_manager_cluster_memory_bytes
    • watsonx_data_presto_cluster_memory_manager_leaked_bytes
    • watsonx_data_presto_memory_heap_memory_usage_committed_bytes
    • watsonx_data_presto_memory_heap_memory_usage_max_bytes
    • watsonx_data_presto_memory_non_heap_memory_usage_committed_bytes
    • watsonx_data_presto_memory_non_heap_memory_usage_max_bytes
    • watsonx_data_presto_cluster_memory_manager_cluster_user_memory_reservation
    • watsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservation
    • watsonx_data_presto_cluster_memory_manager_queries_killed_due_to_out_of_memory
    • jvm_memory_bytes_committed
  • Presto pool di memoria- Tiene traccia del consumo di memoria all'interno dei pool di memoria riservati e generali di Presto.

    • watsonx_data_presto_memory_pool_general_max_bytes
    • watsonx_data_presto_cluster_memory_pool_general_nodes
    • watsonx_data_presto_memory_pool_general_free_bytes
    • watsonx_data_presto_memory_pool_general_reserved_bytes
    • watsonx_data_presto_cluster_memory_pool_general_free_distributed_bytes
    • watsonx_data_presto_cluster_memory_pool_general_total_distributed_bytes
    • watsonx_data_presto_cluster_memory_pool_general_reserved_distributed_bytes
    • watsonx_data_presto_cluster_memory_pool_general_reserved_revocable_distributed_bytes
  • Cache Alluxio: tiene traccia dell'efficienza e dell'utilizzo dei dati memorizzati nella cache in Alluxio durante le query.

    • watsonx_data_presto_alluxio_cache_bytes_read_cache_count
    • watsonx_data_presto_alluxio_cache_bytes_requested_external_count
    • watsonx_data_presto_alluxio_cache_written_cache_external_count
    • watsonx_data_presto_alluxio_cache_get_errors_count
    • watsonx_data_presto_alluxio_cache_put_errors_count
    • watsonx_data_presto_alluxio_cache_pages_count
    • watsonx_data_presto_alluxio_cache_pages_evicted_count
    • watsonx_data_presto_alluxio_cache_space_available_value
    • watsonx_data_presto_alluxio_cache_space_used_value

Per generare le metriche della cache Alluxio, è necessario abilitare la cache Alluxio. Per ulteriori informazioni, consultare Miglioramento delle prestazioni delle query tramite la memorizzazione nella cache.

Inoltre, assicurarsi che le seguenti configurazioni siano incluse nel jvm.config file: -Dalluxio.metrics.key.including.unique.id.enabled=true -Dalluxio.user.app.id=presto

  • Cache dei frammenti: tiene traccia dell'utilizzo e dei tassi di successo o insuccesso dei frammenti di query memorizzati nella cache in Presto.
    • watsonx_data_presto_fragment_cache_stats_cache_entries
    • watsonx_data_presto_fragment_cache_stats_cache_hit
    • watsonx_data_presto_fragment_cache_stats_cache_removal
    • watsonx_data_presto_fragment_cache_stats_cache_size_in_bytes
    • watsonx_data_presto_fragment_cache_stats_inflight_bytes

Prestazioni delle query

Comprendere il comportamento delle query è fondamentale per un motore di ricerca. Le metriche relative alle prestazioni delle query includono:

Presto ( Java ) motore:

  • Query attualmente in esecuzione: monitora la frequenza delle richieste di query.

    • watsonx_data_presto_query_manager_running_queries
  • Tempo di esecuzione della query: tiene traccia della latenza della query.

    • watsonx_data_presto_query_manager_execution_time_five_minutes_p99
  • Dati elaborati- Misura la velocità di trasferimento dei dati durante l'esecuzione della query.

    • watsonx_data_presto_task_manager_input_data_size_five_minute_count
    • watsonx_data_presto_task_manager_output_data_size_five_minute_count
  • Tassi di errore: indica la percentuale di query che generano errori quando il sistema è sotto stress.

    • watsonx_data_presto_query_manager_user_error_failures_five_minute_count
    • watsonx_data_presto_query_manager_abandoned_queries_five_minute_count
    • watsonx_data_presto_query_manager_canceled_queries_five_minute_count
  • Richieste riuscite vs richieste fallite- Tiene traccia del numero di richieste riuscite e fallite.

    • watsonx_data_presto_query_manager_completed_queries_five_minute_count
    • watsonx_data_presto_query_manager_failed_queries_five_minute_count
    • watsonx_data_presto_query_manager_internal_failures_five_minute_count
    • watsonx_data_presto_task_manager_failed_tasks_five_minute_count

Integrità dei dati e dei metadati

Per un sistema che gestisce grandi quantità di dati, l'integrità dell'acquisizione dei dati e della gestione dei metadati è fondamentale.

Presto ( Java ) motore:

  • Acquisizione dati - Gestione query- Monitora il volume e la velocità dei dati acquisiti nel sistema.

    • watsonx_data_presto_query_manager_consumed_input_bytes_five_minute_count
    • watsonx_data_presto_query_manager_consumed_input_rows_five_minute_count
    • watsonx_data_presto_query_manager_wall_input_bytes_rate_five_minutes_p90
  • S3 Errori di archiviazione oggetti- Tiene traccia delle metriche di errore durante la lettura dei dati dai livelli di S3 archiviazione oggetti.

    • watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_other_read_errors_total_count
  • Metrica della coda: misura la dimensione e la velocità di elaborazione delle code interne di elaborazione dei dati.

    • watsonx_data_presto_dispatch_manager_queued_queries
    • watsonx_data_presto_split_scheduler_stats_mixed_split_queues_full_and_waiting_for_source_five_minute_count
    • watsonx_data_presto_task_executor_processor_executor_queued_task_count
    • watsonx_data_presto_task_executor_split_queued_time_all_time_max
    • watsonx_data_presto_task_executor_split_queued_time_all_time_avg
  • Metriche della cache dei metadati dei file: osserva i tassi di successo/insuccesso e l'efficienza della cache dei metadati per l'accesso ai file.

    • watsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_hit_rate
    • watsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_size
    • watsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_size
    • watsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_hit_rate
    • watsonx_data_presto_hive_cache_stats_mbean_stripe_footer_size
    • watsonx_data_presto_hive_cache_stats_mbean_stripe_stream_size

Stato di salute del carico di lavoro

Comprendere come i diversi carichi di lavoro interagiscono con il sistema è fondamentale per ottimizzare le risorse.

Presto ( Java ) motore:

  • Conteggio carico di lavoro: indica il numero di query attualmente in esecuzione.

    • watsonx_data_presto_query_manager_running_queries
  • Stato: indica se il carico di lavoro è attivo, inattivo o non riuscito.

    • watsonx_data_presto_query_manager_completed_queries_five_minute_count
    • watsonx_data_presto_query_manager_abandoned_queries_five_minute_count
    • watsonx_data_presto_query_manager_canceled_queries_five_minute_count
    • watsonx_data_presto_query_manager_failed_queries_five_minute_count
  • Tassi di errore- Tassi di errore

    • watsonx_data_presto_query_manager_user_error_failures_five_minute_count
    • watsonx_data_presto_query_manager_failed_queries_five_minute_count
    • watsonx_data_presto_query_manager_external_failures_five_minute_count
    • watsonx_data_presto_query_manager_internal_failures_five_minute_count
    • watsonx_data_presto_query_manager_insufficient_resources_failures_five_minute_count
  • Utilizzo delle risorse: tiene traccia dell'utilizzo della CPU, della memoria e del disco associato a ciascun carico di lavoro.

    • watsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_count
    • watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p25
    • watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p50
    • watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p75
    • watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p90
  • Numero di richieste: numero totale di richieste di esecuzione del carico di lavoro ricevute in un determinato periodo di tempo.

    • watsonx_data_presto_query_manager_running_queries
    • watsonx_data_presto_dispatch_manager_queued_queries

Stato del ciclo di vita delle query

Fornisce informazioni dettagliate su ogni fase del percorso di una query, dall'invio all'esecuzione, aiutando a identificare i colli di bottiglia nell'accodamento, nell'esecuzione delle attività e nel completamento.

Presto ( Java ) motore:

  • Errori in ogni fase: tiene traccia degli errori di esecuzione delle query nelle diverse fasi delle Presto istanze, identificando le aree problematiche della pipeline in cui le attività non vanno a buon fine.

    • watsonx_data_presto_task_manager_failed_tasks_five_minute_count
  • Utilizzo delle risorse per query: rileva l'utilizzo delle risorse di sistema per query, inclusi thread, divisioni e query in coda o in esecuzione.

    • watsonx_data_presto_task_executor_running_tasks_level0
    • watsonx_data_presto_task_executor_running_splits
    • watsonx_data_presto_query_manager_submitted_queries_five_minute_count
    • watsonx_data_presto_query_manager_queued_queries
    • watsonx_data_presto_dispatch_manager_queued_queries
    • watsonx_data_presto_task_executor_blocked_splits
  • Stato del pool di eseguitori: monitora il pool di thread interno utilizzato per eseguire Presto le attività.

    • watsonx_data_presto_task_executor_processor_executor_pool_size
    • watsonx_data_presto_task_executor_processor_executor_active_count
    • watsonx_data_presto_task_executor_processor_executor_completed_task_count
    • watsonx_data_presto_task_executor_processor_executor_queued_task_count
  • Tempo CPU suddiviso- Tiene traccia del tempo CPU consumato dalle suddivisioni foglia e intermedie.

    • watsonx_data_presto_task_executor_intermediate_split_cpu_time_count
    • watsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_count
    • watsonx_data_presto_task_executor_leaf_split_cpu_time_p99

Stato della latenza delle query

Si concentra sulla fase di esecuzione delle query, identificando le fonti di latenza e l'impatto della complessità delle query.

Presto ( Java ) motore:

  • Latenza (ms)- Misura il tempo di esecuzione nelle varie fasi.

    • watsonx_data_presto_query_manager_execution_time_five_minutes_p99
    • watsonx_data_presto_task_executor_split_wall_time_one_minute_max
    • watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_max
    • watsonx_data_presto_task_executor_split_wall_time_all_time_p99
    • watsonx_data_presto_task_executor_leaf_split_wall_time_p99
  • Volume delle richieste: tiene traccia delle attività, delle suddivisioni e della pianificazione.

    • watsonx_data_presto_task_executor_split_queued_time_five_minutes_count
    • watsonx_data_presto_split_scheduler_stats_get_split_time_five_minutes_p99
    • watsonx_data_presto_task_executor_split_wall_time_five_minutes_count

Registro e stato di errore

Monitora errori e guasti lungo l'intero processo di esecuzione delle query, evidenziando la stabilità del sistema e i modelli di guasto.

Presto ( Java ) motore:

  • Tasso di errore delle query: tiene traccia degli errori di esecuzione e dei colli di bottiglia.

    • watsonx_data_presto_query_manager_failed_queries_five_minute_count
    • watsonx_data_presto_query_manager_internal_failures_five_minute_count
    • watsonx_data_presto_query_manager_user_error_failures_five_minute_count
    • watsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_five_minute_count
  • Servizio/componente interessato - HiveS3 / FileSystem- Identifica i Presto componenti difettosi.

    • watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
  • Servizio/componente interessato - Task Executor- Identifica i Presto componenti difettosi.

    • watsonx_data_presto_task_executor_split_wall_time_all_time_max_error
    • watsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_error
    • watsonx_data_presto_task_executor_leaf_split_cpu_time_max_error
    • watsonx_data_presto_task_executor_intermediate_split_wall_time_max_error
    • watsonx_data_presto_task_executor_unblocked_quanta_wall_time_one_minute_max_error
    • watsonx_data_presto_task_executor_split_queued_time_one_minute_max_error
    • watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_count
    • watsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
  • Livello di gravità: classifica le metriche in base alla gravità dell'impatto.

    • Grave (critico)

      • watsonx_data_presto_query_manager_internal_failures_five_minute_count
      • watsonx_data_presto_task_executor_split_wall_time_all_time_max_error
      • watsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_error
      • watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_count
      • watsonx_data_presto_cache_stats_quota_exceeded
    • Moderato (Avviso)

      • watsonx_data_presto_query_manager_user_error_failures_five_minute_count
      • watsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_rate
      • watsonx_data_presto_hive_s3_presto_s3_file_system_get_object_errors_fifteen_minute_rate
      • watsonx_data_presto_hive_s3_presto_s3_file_system_read_retries_fifteen_minute_rate
    • Basso (Informazioni)

      • watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_retries_five_minute_count
      • watsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_total_count
      • watsonx_data_presto_task_executor_processor_executor_shutdown

Approfondimenti su anomalie e tendenze

Evidenzia modelli o deviazioni inaspettati nel comportamento delle query, aiutando a rilevare il degrado o il miglioramento delle prestazioni.

Presto ( Java ) motore:

  • Deriva della latenza: tiene traccia dell'evoluzione delle latenze delle query.

    • watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avg
    • watsonx_data_presto_task_executor_leaf_split_wait_time_avg
    • watsonx_data_presto_task_executor_intermediate_split_wall_time_avg
  • Tasso di errore rispetto al valore di riferimento: confronta le metriche di esecuzione recenti con i valori di riferimento storici.

    • watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avg
    • watsonx_data_presto_task_executor_leaf_split_wait_time_avg
    • watsonx_data_presto_task_executor_intermediate_split_wall_time_avg
  • Rilevatore di calo di produttività: rileva i cali nella velocità di elaborazione dei dati.

    • watsonx_data_presto_task_executor_global_scheduled_time_micros_five_minute_rate
    • watsonx_data_presto_hive_s3_presto_s3_file_system_successful_uploads_five_minute_rate
  • Durata della query: misura il tempo medio di esecuzione per attività o divisione.

    • watsonx_data_presto_task_executor_leaf_split_cpu_time_avg
    • watsonx_data_presto_task_executor_intermediate_split_cpu_time_avg
  • Tendenza della memoria: tiene traccia dell'utilizzo della memoria e delle potenziali perdite.

    • jvm_memory_bytes_used
    • watsonx_data_presto_memory_heap_memory_usage_used_bytes
  • Confronto dell'andamento del carico di lavoro: confronta l'utilizzo delle risorse in intervalli di tempo.

    • watsonx_data_presto_task_executor_global_cpu_time_micros_total_count
    • watsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservation
    • watsonx_data_presto_task_executor_blocked_quanta_wall_time_fifteen_minutes_avg