Unterstützende Dashboards
PrestoIBM® watsonx.data ( Java ) bieten umfassende Beobachtbarkeit durch eine Reihe robuster Dashboards, die Einblick in Leistungskennzahlen geben, eine schnelle Fehlerdiagnose ermöglichen und die Ressourcenzuweisung optimieren.
Die folgenden Dashboards werden unterstützt:
- Systemzustand
- Abfrage-Leistungszustand
- Daten- und Metadatenintegrität
- Arbeitsbelastung
- Zustand der Abfrage-Latenz
- Lebenszyklus-Zustand abfragen
- Einblicke in Anomalien und Trends
- Protokoll und Fehlerzustand
Das Grafana Tool bietet nur Unterstützung für die folgenden vier Dashboards: Systemzustand, Abfrageleistung, Daten- und Metadatenzustand sowie Arbeitslastzustand, während das Instana-Tool alle acht Dashboards unterstützt.
Die folgende Liste enthält die Standardmetriken von Presto ( Java ). Benutzer können dies nach Bedarf durch Hinzufügen weiterer Metriken erweitern. Eine vollständige Liste der verfügbaren Metriken und ihrer Definitionen finden Sie unter Presto offengelegte JMX-Metriken.
Systemzustand
Die Überwachung der zugrunde liegenden Infrastruktur ist von größter Bedeutung für Presto. Konzentriert sich auf die grundlegende Infrastruktur und überwacht Kernressourcen wie CPU, Arbeitsspeicher und E/A, um Engpässe zu erkennen und einen stabilen Betrieb sicherzustellen.
Presto ( Java ) Motor:
-
CPU-Auslastung – Überwacht die CPU-Auslastung über Presto alle Instanzen hinweg.
process_cpu_seconds_total
-
Speichernutzung – Verfolgt den insgesamt verwendeten Speicher im Vergleich zum verfügbaren Speicher
watsonx_data_presto_cluster_memory_manager_cluster_memory_byteswatsonx_data_presto_cluster_memory_manager_leaked_byteswatsonx_data_presto_memory_heap_memory_usage_committed_byteswatsonx_data_presto_memory_heap_memory_usage_max_byteswatsonx_data_presto_memory_non_heap_memory_usage_committed_byteswatsonx_data_presto_memory_non_heap_memory_usage_max_byteswatsonx_data_presto_cluster_memory_manager_cluster_user_memory_reservationwatsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservationwatsonx_data_presto_cluster_memory_manager_queries_killed_due_to_out_of_memoryjvm_memory_bytes_committed
-
Presto Speicherpool – Verfolgt den Speicherverbrauch innerhalb der reservierten und allgemeinen Speicherpools von Presto.
watsonx_data_presto_memory_pool_general_max_byteswatsonx_data_presto_cluster_memory_pool_general_nodeswatsonx_data_presto_memory_pool_general_free_byteswatsonx_data_presto_memory_pool_general_reserved_byteswatsonx_data_presto_cluster_memory_pool_general_free_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_total_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_reserved_distributed_byteswatsonx_data_presto_cluster_memory_pool_general_reserved_revocable_distributed_bytes
-
Alluxio-Cache – Verfolgt die Effizienz und Nutzung von zwischengespeicherten Daten in Alluxio während Abfragen.
watsonx_data_presto_alluxio_cache_bytes_read_cache_countwatsonx_data_presto_alluxio_cache_bytes_requested_external_countwatsonx_data_presto_alluxio_cache_written_cache_external_countwatsonx_data_presto_alluxio_cache_get_errors_countwatsonx_data_presto_alluxio_cache_put_errors_countwatsonx_data_presto_alluxio_cache_pages_countwatsonx_data_presto_alluxio_cache_pages_evicted_countwatsonx_data_presto_alluxio_cache_space_available_valuewatsonx_data_presto_alluxio_cache_space_used_value
Um Alluxio-Cache-Metriken zu generieren, muss der Alluxio-Cache aktiviert sein. Weitere Informationen finden Sie unter „ Verbessern der Abfrageleistung durch Caching “
Stellen Sie außerdem sicher, dass die folgenden Konfigurationen in der jvm.config Datei enthalten sind:
-Dalluxio.metrics.key.including.unique.id.enabled=true
-Dalluxio.user.app.id=presto
- Fragment-Cache – Verfolgt die Nutzung und Treffer- bzw. Fehlschlagraten von zwischengespeicherten Abfragefragmenten in Presto.
watsonx_data_presto_fragment_cache_stats_cache_entrieswatsonx_data_presto_fragment_cache_stats_cache_hitwatsonx_data_presto_fragment_cache_stats_cache_removalwatsonx_data_presto_fragment_cache_stats_cache_size_in_byteswatsonx_data_presto_fragment_cache_stats_inflight_bytes
Abfrageleistung
Das Verständnis des Abfrageverhaltens ist für eine Abfrage-Engine von entscheidender Bedeutung. Zu den Leistungsmetriken für Abfragen gehören:
Presto ( Java ) Motor:
-
Derzeit ausgeführte Abfragen – Überwacht die Abfrageanforderungsrate.
watsonx_data_presto_query_manager_running_queries
-
Abfrageausführungszeit – Verfolgt die Abfragelatenz.
watsonx_data_presto_query_manager_execution_time_five_minutes_p99
-
Verarbeitete Daten – Misst die Datenübertragungsraten während der Ausführung von Abfragen.
watsonx_data_presto_task_manager_input_data_size_five_minute_countwatsonx_data_presto_task_manager_output_data_size_five_minute_count
-
Fehlerraten – Gibt den Prozentsatz der Abfragen an, die bei hoher Auslastung des Systems zu Fehlern führen.
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_query_manager_abandoned_queries_five_minute_countwatsonx_data_presto_query_manager_canceled_queries_five_minute_count
-
Erfolgreiche vs. fehlgeschlagene Anfragen – Verfolgt die Anzahl erfolgreicher vs. fehlgeschlagener Anfragen.
watsonx_data_presto_query_manager_completed_queries_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_task_manager_failed_tasks_five_minute_count
Daten- und Metadatenintegrität
Für ein System, das mit riesigen Datenmengen arbeitet, ist die Integrität der Datenerfassung und Metadatenverwaltung von entscheidender Bedeutung.
Presto ( Java ) Motor:
-
Datenaufnahme – Abfrage-Manager – Überwacht das Volumen und die Rate der in das System aufgenommenen Daten.
watsonx_data_presto_query_manager_consumed_input_bytes_five_minute_countwatsonx_data_presto_query_manager_consumed_input_rows_five_minute_countwatsonx_data_presto_query_manager_wall_input_bytes_rate_five_minutes_p90
-
S3 Objektspeicherfehler – Verfolgt Fehlermetriken beim Lesen von Daten aus S3 oder Objektspeicherschichten.
watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_other_read_errors_total_count
-
Warteschlangenmetrik – Misst die Größe und Verarbeitungsrate interner Datenverarbeitungswarteschlangen.
watsonx_data_presto_dispatch_manager_queued_querieswatsonx_data_presto_split_scheduler_stats_mixed_split_queues_full_and_waiting_for_source_five_minute_countwatsonx_data_presto_task_executor_processor_executor_queued_task_countwatsonx_data_presto_task_executor_split_queued_time_all_time_maxwatsonx_data_presto_task_executor_split_queued_time_all_time_avg
-
Datei-Metadaten-Cache-Metriken – Beobachtet Treffer-/Fehlerquoten und die Effizienz des Metadaten-Caches für den Dateizugriff.
watsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_hit_ratewatsonx_data_presto_hive_cache_stats_mbean_parquet_metadata_sizewatsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_sizewatsonx_data_presto_hive_cache_stats_mbean_orc_file_tail_hit_ratewatsonx_data_presto_hive_cache_stats_mbean_stripe_footer_sizewatsonx_data_presto_hive_cache_stats_mbean_stripe_stream_size
Arbeitsbelastung
Das Verständnis, wie verschiedene Workloads mit dem System interagieren, ist der Schlüssel zur Ressourcenoptimierung.
Presto ( Java ) Motor:
-
Workload-Anzahl – Gibt die Anzahl der aktuell ausgeführten Abfragen an.
watsonx_data_presto_query_manager_running_queries
-
Status – Gibt an, ob die Arbeitslast aktiv, inaktiv oder fehlgeschlagen ist.
watsonx_data_presto_query_manager_completed_queries_five_minute_countwatsonx_data_presto_query_manager_abandoned_queries_five_minute_countwatsonx_data_presto_query_manager_canceled_queries_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_count
-
Fehlerquoten – Fehlerquoten
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_external_failures_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_query_manager_insufficient_resources_failures_five_minute_count
-
Ressourcenauslastung – Verfolgt die CPU-, Speicher- und Festplattenauslastung für jede Arbeitslast.
watsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_countwatsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p25watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p50watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p75watsonx_data_presto_query_manager_cpu_input_byte_rate_five_minutes_p90
-
Anzahl der Anfragen – Gesamtzahl der Workload-Ausführungsanfragen, die über einen bestimmten Zeitraum eingegangen sind.
watsonx_data_presto_query_manager_running_querieswatsonx_data_presto_dispatch_manager_queued_queries
Lebenszyklus-Zustand abfragen
Es bietet Einblicke in jede Phase des Ablaufs einer Abfrage, von der Übermittlung bis zur Ausführung, und hilft dabei, Engpässe bei der Warteschlange, der Aufgabenausführung und der Fertigstellung zu identifizieren.
Presto ( Java ) Motor:
-
Fehler in jeder Phase – Verfolgt Fehler bei der Ausführung von Abfragen in verschiedenen Phasen der Presto Instanzen, indem die Problembereiche in der Pipeline identifiziert werden, in denen Aufgaben fehlschlagen.
watsonx_data_presto_task_manager_failed_tasks_five_minute_count
-
Ressourcenauslastung pro Abfrage – Erfasst die Nutzung der Systemressourcen pro Abfrage, einschließlich Threads, Splits und Abfragen in der Warteschlange oder in Ausführung.
watsonx_data_presto_task_executor_running_tasks_level0watsonx_data_presto_task_executor_running_splitswatsonx_data_presto_query_manager_submitted_queries_five_minute_countwatsonx_data_presto_query_manager_queued_querieswatsonx_data_presto_dispatch_manager_queued_querieswatsonx_data_presto_task_executor_blocked_splits
-
Executor-Pool-Zustand – Überwacht den internen Thread-Pool, der zum Ausführen von Presto Aufgaben verwendet wird.
watsonx_data_presto_task_executor_processor_executor_pool_sizewatsonx_data_presto_task_executor_processor_executor_active_countwatsonx_data_presto_task_executor_processor_executor_completed_task_countwatsonx_data_presto_task_executor_processor_executor_queued_task_count
-
Split-CPU-Zeit – Verfolgt die CPU-Zeit, die durch Blatt- und Zwischenaufteilungen verbraucht wird.
watsonx_data_presto_task_executor_intermediate_split_cpu_time_countwatsonx_data_presto_query_manager_consumed_cpu_time_seconds_five_minute_countwatsonx_data_presto_task_executor_leaf_split_cpu_time_p99
Zustand der Abfrage-Latenz
Konzentriert sich auf die Ausführungsphase von Abfragen, identifiziert Latenzquellen und die Auswirkungen der Komplexität von Abfragen.
Presto ( Java ) Motor:
-
Latenz (ms) – Misst die Ausführungszeit über verschiedene Phasen hinweg.
watsonx_data_presto_query_manager_execution_time_five_minutes_p99watsonx_data_presto_task_executor_split_wall_time_one_minute_maxwatsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_maxwatsonx_data_presto_task_executor_split_wall_time_all_time_p99watsonx_data_presto_task_executor_leaf_split_wall_time_p99
-
Anfragevolumen – Verfolgt Aufgaben, Aufteilungen und Planungsaktivitäten.
watsonx_data_presto_task_executor_split_queued_time_five_minutes_countwatsonx_data_presto_split_scheduler_stats_get_split_time_five_minutes_p99watsonx_data_presto_task_executor_split_wall_time_five_minutes_count
Protokoll und Fehlerzustand
Überwacht Fehler und Ausfälle in der gesamten Pipeline zur Ausführung von Abfragen und hebt dabei die Systemstabilität und Ausfallmuster hervor.
Presto ( Java ) Motor:
-
Abfragefehlerquote – Verfolgt Ausführungsfehler und Engpässe.
watsonx_data_presto_query_manager_failed_queries_five_minute_countwatsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_five_minute_count
-
Betroffener Dienst/betroffene Komponente – HiveS3 / FileSystem – Identifiziert fehlerhafte Presto Komponenten.
watsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
-
Betroffener Dienst/betroffene Komponente – Task Executor – Identifiziert fehlerhafte Presto Komponenten.
watsonx_data_presto_task_executor_split_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_leaf_split_cpu_time_max_errorwatsonx_data_presto_task_executor_intermediate_split_wall_time_max_errorwatsonx_data_presto_task_executor_unblocked_quanta_wall_time_one_minute_max_errorwatsonx_data_presto_task_executor_split_queued_time_one_minute_max_errorwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_errors_total_countwatsonx_data_presto_hive_s3_presto_s3_file_system_socket_timeout_exceptions_total_count
-
Schweregrad – Kategorisiert Metriken nach der Schwere ihrer Auswirkungen.
-
Schwerwiegend (kritisch)
watsonx_data_presto_query_manager_internal_failures_five_minute_countwatsonx_data_presto_task_executor_split_wall_time_all_time_max_errorwatsonx_data_presto_task_executor_blocked_quanta_wall_time_all_time_max_errorwatsonx_data_presto_hive_s3_presto_s3_file_system_failed_uploads_total_countwatsonx_data_presto_cache_stats_quota_exceeded
-
Mäßig (Warnung)
watsonx_data_presto_query_manager_user_error_failures_five_minute_countwatsonx_data_presto_hive_s3_presto_s3_file_system_aws_retry_count_fifteen_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_get_object_errors_fifteen_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_read_retries_fifteen_minute_rate
-
Niedrig (Info)
watsonx_data_presto_hive_s3_presto_s3_file_system_get_metadata_retries_five_minute_countwatsonx_data_presto_task_executor_split_skipped_due_to_memory_pressure_total_countwatsonx_data_presto_task_executor_processor_executor_shutdown
-
Einblicke in Anomalien und Trends
Hebt unerwartete Muster oder Abweichungen im Abfrageverhalten hervor und hilft so, Leistungsabfälle oder -verbesserungen zu erkennen.
Presto ( Java ) Motor:
-
Latenzabweichung – Verfolgt sich verändernde Abfragelatenzen.
watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avgwatsonx_data_presto_task_executor_leaf_split_wait_time_avgwatsonx_data_presto_task_executor_intermediate_split_wall_time_avg
-
Fehlerquote im Vergleich zum Basiswert – Vergleicht aktuelle Ausführungsmetriken mit historischen Basiswerten.
watsonx_data_presto_task_executor_split_wall_time_fifteen_minutes_avgwatsonx_data_presto_task_executor_leaf_split_wait_time_avgwatsonx_data_presto_task_executor_intermediate_split_wall_time_avg
-
Durchsatzabfall-Detektor – Erkennt Einbrüche in der Datenverarbeitungsrate.
watsonx_data_presto_task_executor_global_scheduled_time_micros_five_minute_ratewatsonx_data_presto_hive_s3_presto_s3_file_system_successful_uploads_five_minute_rate
-
Abfragedauer – Misst die durchschnittliche Ausführungszeit pro Aufgabe oder Split.
watsonx_data_presto_task_executor_leaf_split_cpu_time_avgwatsonx_data_presto_task_executor_intermediate_split_cpu_time_avg
-
Speichertrend – Verfolgt die Speichernutzung und potenzielle Speicherlecks.
jvm_memory_bytes_usedwatsonx_data_presto_memory_heap_memory_usage_used_bytes
-
Vergleich der Auslastungstrends – Vergleicht die Ressourcennutzung über Zeitfenster hinweg.
watsonx_data_presto_task_executor_global_cpu_time_micros_total_countwatsonx_data_presto_cluster_memory_manager_cluster_total_memory_reservationwatsonx_data_presto_task_executor_blocked_quanta_wall_time_fifteen_minutes_avg