Pannelli di controllo di supporto
PrestoIBM® watsonx.data ( Java ) offre un'osservabilità completa attraverso una serie di dashboard affidabili che forniscono visibilità sulle metriche delle prestazioni, consentendo una rapida diagnosi dei problemi e ottimizzando l'allocazione delle risorse.
Di seguito sono riportati i dashboard supportati:
- Integrità del sistema
- Stato delle prestazioni delle query
- Integrità dei dati e dei metadati
- Stato di salute del carico di lavoro
- Stato della latenza delle query
- Stato del ciclo di vita delle query
- Approfondimenti su anomalie e tendenze
- Registro e stato di errore
Lo Grafana strumento fornisce supporto solo per le seguenti quattro dashboard: integrità del sistema, integrità delle prestazioni delle query, integrità dei dati e dei metadati e integrità del carico di lavoro, mentre lo strumento Instana supporta tutte e otto le dashboard.
Il seguente elenco rappresenta l'insieme predefinito di metriche Presto ( Java ). Gli utenti possono estenderlo aggiungendo ulteriori metriche secondo necessità. Un elenco completo delle metriche disponibili e delle relative definizioni è disponibile in metriche Presto JMX esposte.
Integrità del sistema
Il monitoraggio dell'infrastruttura sottostante è fondamentale per Presto. Si concentra sull'infrastruttura di base, monitorando risorse fondamentali quali CPU, memoria e I/O per individuare eventuali colli di bottiglia e garantire operazioni stabili.
Presto ( Java ) motore:
-
Utilizzo della CPU- Monitora l'utilizzo della CPU tra Presto le istanze.
process_cpu_seconds_total
-
Utilizzo della memoria: tiene traccia della memoria totale utilizzata rispetto a quella disponibile
watsonx_data_presto_cluster_memory_manager_cluster_memory_byteswatsonx_data_presto_cluster_memory_manager_leaked_byteswatsonx_data_presto_memory_heap_memory_usage_committed_byteswatsonx_data_presto_memory_heap_memory_usage_max_byteswatsonx_data_presto_memory_non_heap_memory_usage_committed_byteswatsonx_data_presto_memory_non_heap_memory_usage_max_byteswatsonx_data_presto_cluster_memory_manager_cluster_user_memory_reservationwatsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservationwatsonx_data_presto_cluster_memory_manager_queries_killed_due_to_out_of_memoryjvm_memory_bytes_committed
-
Presto pool di memoria- Tiene traccia del consumo di memoria all'interno dei pool di memoria riservati e generali di Presto.
watsonx_data_presto_memory_pool_general_max_byteswatsonx_data_presto_cluster_memory_pool_general_nodeswatsonx_data_presto_memory_pool_general_free_byteswatsonx_data_presto_memory_pool_general_reserved_byteswatsonx_data_presto_cluster_memory_pool_general_free_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_total_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_reserved_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_reserved_revocable_distributed_bytes
-
Cache Alluxio: tiene traccia dell'efficienza e dell'utilizzo dei dati memorizzati nella cache in Alluxio durante le query.
watsonx_data_presto_alluxio_cache_bytes_read_cache_countwatsonx_data_presto_alluxio_cache_bytes_requested_external_countwatsonx_data_presto_alluxio_cache_written_cache_external_countwatsonx_data_presto_alluxio_cache_get_errors_countwatsonx_data_presto_alluxio_cache_put_errors_countwatsonx_data_presto_alluxio_cache_pages_countwatsonx_data_presto_alluxio_cache_pages_evicted_countwatsonx_data_presto_alluxio_cache_space_available_valuewatsonx_data_presto_alluxio_cache_space_used_value
Per generare le metriche della cache Alluxio, è necessario abilitare la cache Alluxio. Per ulteriori informazioni, consultare Miglioramento delle prestazioni delle query tramite la memorizzazione nella cache.
Inoltre, assicurarsi che le seguenti configurazioni siano incluse nel jvm.config file:
-Dalluxio.metrics.key.including.unique.id.enabled=true
-Dalluxio.user.app.id=presto
- Cache dei frammenti: tiene traccia dell'utilizzo e dei tassi di successo o insuccesso dei frammenti di query memorizzati nella cache in Presto.
watsonx_data_presto_fragment_cache_stats_cache_entrieswatsonx_data_presto_fragment_cache_stats_cache_hitwatsonx_data_presto_fragment_cache_stats_cache_removalwatsonx_data_presto_fragment_cache_stats_cache_size_in_byteswatsonx_data_presto_fragment_cache_stats_inflight_bytes
Prestazioni delle query
Comprendere il comportamento delle query è fondamentale per un motore di ricerca. Le metriche relative alle prestazioni delle query includono:
Presto ( Java ) motore:
-
Query attualmente in esecuzione: monitora la frequenza delle richieste di query.
watsonx_data_presto_query_manager_running_queries
-
Tempo di esecuzione della query: tiene traccia della latenza della query.
watsonx_data_presto_query_manager_execution_time_five_minutes_p99
-
Dati elaborati- Misura la velocità di trasferimento dei dati durante l'esecuzione della query.
watsonx_data_presto_task_manager_input_data_size_five_minute_countwatsonx_data_presto_task_manager_output_data_size_five_minute_count
-
Tassi di errore: indica la percentuale di query che generano errori quando il sistema è sotto stress.
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_query_manager_abandoned_queries_five_minute_countwatsonx_data_presto_query_manager_canceled_queries_five_minute_count
-
Richieste riuscite vs richieste fallite- Tiene traccia del numero di richieste riuscite e fallite.
watsonx_data_presto_query_manager_completed_queries_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_task_manager_failed_tasks_five_minute_count
Integrità dei dati e dei metadati
Per un sistema che gestisce grandi quantità di dati, l'integrità dell'acquisizione dei dati e della gestione dei metadati è fondamentale.
Presto ( Java ) motore:
-
Acquisizione dati - Gestione query- Monitora il volume e la velocità dei dati acquisiti nel sistema.
watsonx_data_presto_query_manager_consumed_input_bytes_five_minute_countwatsonx_data_presto_query_manager_consumed_input_rows_five_minute_countwatsonx_data_presto_query_manager_wall_input_bytes_rate_five_minutes_p90
-
S3 Errori di archiviazione oggetti- Tiene traccia delle metriche di errore durante la lettura dei dati dai livelli di S3 archiviazione oggetti.
watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_other_read_errors_total_count
-
Metrica della coda: misura la dimensione e la velocità di elaborazione delle code interne di elaborazione dei dati.
watsonx_data_presto_dispatch_manager_queued_querieswatsonx_data_presto_split_scheduler_stats_mixed_split_queues_full_and_waiting_for_source_five_minute_countwatsonx_data_presto_task_executor_processor_executor_queued_task_countwatsonx_data_presto_task_executor_split_queued_time_all_time_maxwatsonx_data_presto_task_executor_split_queued_time_all_time_avg
-
Metriche della cache dei metadati dei file: osserva i tassi di successo/insuccesso e l'efficienza della cache dei metadati per l'accesso ai file.
watsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_hit_ratewatsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_sizewatsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_sizewatsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_hit_ratewatsonx_data_presto_hive_cache_stats_mbean_stripe_footer_sizewatsonx_data_presto_hive_cache_stats_mbean_stripe_stream_size
Stato di salute del carico di lavoro
Comprendere come i diversi carichi di lavoro interagiscono con il sistema è fondamentale per ottimizzare le risorse.
Presto ( Java ) motore:
-
Conteggio carico di lavoro: indica il numero di query attualmente in esecuzione.
watsonx_data_presto_query_manager_running_queries
-
Stato: indica se il carico di lavoro è attivo, inattivo o non riuscito.
watsonx_data_presto_query_manager_completed_queries_five_minute_countwatsonx_data_presto_query_manager_abandoned_queries_five_minute_countwatsonx_data_presto_query_manager_canceled_queries_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_count
-
Tassi di errore- Tassi di errore
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_external_failures_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_query_manager_insufficient_resources_failures_five_minute_count
-
Utilizzo delle risorse: tiene traccia dell'utilizzo della CPU, della memoria e del disco associato a ciascun carico di lavoro.
watsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_countwatsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p25watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p50watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p75watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p90
-
Numero di richieste: numero totale di richieste di esecuzione del carico di lavoro ricevute in un determinato periodo di tempo.
watsonx_data_presto_query_manager_running_querieswatsonx_data_presto_dispatch_manager_queued_queries
Stato del ciclo di vita delle query
Fornisce informazioni dettagliate su ogni fase del percorso di una query, dall'invio all'esecuzione, aiutando a identificare i colli di bottiglia nell'accodamento, nell'esecuzione delle attività e nel completamento.
Presto ( Java ) motore:
-
Errori in ogni fase: tiene traccia degli errori di esecuzione delle query nelle diverse fasi delle Presto istanze, identificando le aree problematiche della pipeline in cui le attività non vanno a buon fine.
watsonx_data_presto_task_manager_failed_tasks_five_minute_count
-
Utilizzo delle risorse per query: rileva l'utilizzo delle risorse di sistema per query, inclusi thread, divisioni e query in coda o in esecuzione.
watsonx_data_presto_task_executor_running_tasks_level0watsonx_data_presto_task_executor_running_splitswatsonx_data_presto_query_manager_submitted_queries_five_minute_countwatsonx_data_presto_query_manager_queued_querieswatsonx_data_presto_dispatch_manager_queued_querieswatsonx_data_presto_task_executor_blocked_splits
-
Stato del pool di eseguitori: monitora il pool di thread interno utilizzato per eseguire Presto le attività.
watsonx_data_presto_task_executor_processor_executor_pool_sizewatsonx_data_presto_task_executor_processor_executor_active_countwatsonx_data_presto_task_executor_processor_executor_completed_task_countwatsonx_data_presto_task_executor_processor_executor_queued_task_count
-
Tempo CPU suddiviso- Tiene traccia del tempo CPU consumato dalle suddivisioni foglia e intermedie.
watsonx_data_presto_task_executor_intermediate_split_cpu_time_countwatsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_countwatsonx_data_presto_task_executor_leaf_split_cpu_time_p99
Stato della latenza delle query
Si concentra sulla fase di esecuzione delle query, identificando le fonti di latenza e l'impatto della complessità delle query.
Presto ( Java ) motore:
-
Latenza (ms)- Misura il tempo di esecuzione nelle varie fasi.
watsonx_data_presto_query_manager_execution_time_five_minutes_p99watsonx_data_presto_task_executor_split_wall_time_one_minute_maxwatsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_maxwatsonx_data_presto_task_executor_split_wall_time_all_time_p99watsonx_data_presto_task_executor_leaf_split_wall_time_p99
-
Volume delle richieste: tiene traccia delle attività, delle suddivisioni e della pianificazione.
watsonx_data_presto_task_executor_split_queued_time_five_minutes_countwatsonx_data_presto_split_scheduler_stats_get_split_time_five_minutes_p99watsonx_data_presto_task_executor_split_wall_time_five_minutes_count
Registro e stato di errore
Monitora errori e guasti lungo l'intero processo di esecuzione delle query, evidenziando la stabilità del sistema e i modelli di guasto.
Presto ( Java ) motore:
-
Tasso di errore delle query: tiene traccia degli errori di esecuzione e dei colli di bottiglia.
watsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_five_minute_count
-
Servizio/componente interessato - HiveS3 / FileSystem- Identifica i Presto componenti difettosi.
watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
-
Servizio/componente interessato - Task Executor- Identifica i Presto componenti difettosi.
watsonx_data_presto_task_executor_split_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_leaf_split_cpu_time_max_errorwatsonx_data_presto_task_executor_intermediate_split_wall_time_max_errorwatsonx_data_presto_task_executor_unblocked_quanta_wall_time_one_minute_max_errorwatsonx_data_presto_task_executor_split_queued_time_one_minute_max_errorwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
-
Livello di gravità: classifica le metriche in base alla gravità dell'impatto.
-
Grave (critico)
watsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_task_executor_split_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_errorwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_cache_stats_quota_exceeded
-
Moderato (Avviso)
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_get_object_errors_fifteen_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_read_retries_fifteen_minute_rate
-
Basso (Informazioni)
watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_retries_five_minute_countwatsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_total_countwatsonx_data_presto_task_executor_processor_executor_shutdown
-
Approfondimenti su anomalie e tendenze
Evidenzia modelli o deviazioni inaspettati nel comportamento delle query, aiutando a rilevare il degrado o il miglioramento delle prestazioni.
Presto ( Java ) motore:
-
Deriva della latenza: tiene traccia dell'evoluzione delle latenze delle query.
watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avgwatsonx_data_presto_task_executor_leaf_split_wait_time_avgwatsonx_data_presto_task_executor_intermediate_split_wall_time_avg
-
Tasso di errore rispetto al valore di riferimento: confronta le metriche di esecuzione recenti con i valori di riferimento storici.
watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avgwatsonx_data_presto_task_executor_leaf_split_wait_time_avgwatsonx_data_presto_task_executor_intermediate_split_wall_time_avg
-
Rilevatore di calo di produttività: rileva i cali nella velocità di elaborazione dei dati.
watsonx_data_presto_task_executor_global_scheduled_time_micros_five_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_successful_uploads_five_minute_rate
-
Durata della query: misura il tempo medio di esecuzione per attività o divisione.
watsonx_data_presto_task_executor_leaf_split_cpu_time_avgwatsonx_data_presto_task_executor_intermediate_split_cpu_time_avg
-
Tendenza della memoria: tiene traccia dell'utilizzo della memoria e delle potenziali perdite.
jvm_memory_bytes_usedwatsonx_data_presto_memory_heap_memory_usage_used_bytes
-
Confronto dell'andamento del carico di lavoro: confronta l'utilizzo delle risorse in intervalli di tempo.
watsonx_data_presto_task_executor_global_cpu_time_micros_total_countwatsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservationwatsonx_data_presto_task_executor_blocked_quanta_wall_time_fifteen_minutes_avg