Query dei dati direttamente dall'archivio

Puoi eseguire una query del tuo archivio IBM Cloud Logs utilizzando un framework di terze parti con il lettore Apache Parquet standard fornito dal framework pertinente e dallo schema richiesto.

Struttura della cartella di archivio

I dati di archivio IBM Cloud Logs sono archiviati in partizioni di tipo hive standard con i seguenti campi di partizione:

team_id=<team-id>: IBM Cloud Logs Team ID
dt=YYYY-MM-DD: Date of the data in UTC
hr=HH: Hour of the data in UTC

Questi campi possono essere definiti come colonne virtuali all'interno del framework e possono essere utilizzati come filtri in una query.

Tenere presente quanto segue:

  • dt e hr si basano sulla data/ora dell'evento.
  • La partizione team_id=<team-id> ti consente di riutilizzare lo stesso bucket e prefisso per scrivere i dati da più team IBM Cloud Logs ed eseguirne la query in un'unica query.

Campi

Ogni file Apache Parquet ha tre campi con dati come stringhe in formato JSON:

  • src_obj__event_metadata: un oggetto JSON contenente i metadati correlati all'evento.
  • src_obj__event_labels: un oggetto JSON contenente le etichette dell'evento (come ad esempio IBM Cloud Logs applicationName e subsystemName).
  • src_obj__user_data: un oggetto JSON che contiene i dati evento effettivi.

Di seguito è riportato un esempio di src_obj__event_metadata:

{
  "timestamp": "2022-03-28T08:50:57.946",
  "severity": "Debug",
  "priorityclass": "low",
  "logid": "some-uuid"
}

Di seguito è riportato un esempio di src_obj__event_labels:

{
  "applicationname": "some-app",
  "subsystemname": "some-subsystem",
  "category": "some-category",
  "classname": "some-class",
  "methodname": "some-method",
  "computername": "some-computer",
  "threadid": "some-thread-id",
  "ipaddress": "some-ip-address"
}

Di seguito è riportato un esempio di src_obj__user_data:

{
  "_container_id": "0f099482cf3b507462020e9052516554b65865fb761af8e076735312772352bf",
  "host": "ip-10-1-11-144",
  "short_message": "10.1.11.144 - - [28/Mar/2022:08:50:57 +0000] \\"GET /check HTTP/1.1\\" 200 16559 \\"-\\" \\"Consul Health Check\\" \\"-\\""
}

Query e parsing dell'archivio

Con la funzione Query dell'archivio IBM Cloud Logs è possibile eseguire query sui registri direttamente dall'archivio utilizzando Lucene, DataPrime, e la sintassi delle query regex senza contare la quota giornaliera, anche se i dati non sono mai stati indicizzati. È possibile archiviare una maggiore quantità di dati nelle pipeline Analizza e avvisa e Archivia e ricerca e sfruttare le funzionalità di analisi in tempo reale e di ricerca su storage remoto di IBM Cloud Logs. Ciò significa che è possibile utilizzare un periodo di conservazione più breve ed essere comunque in grado di interrogare rapidamente tutti i dati.

Le query di archivio vengono eseguite sull'archiviazione che hai impostato in IBM Cloud Logs e sono disponibili per tutti i livelli di registrazione TCO. Ad esempio, se si dà priorità ai registri per la pipeline Analizza e avvisa, è possibile interrogarli senza indicizzare i dati. È inoltre possibile visualizzarli e interrogarli all'interno del sito LiveTail, ricevere avvisi e notifiche di anomalie in tempo reale, utilizzare le regole di parsing, l'aggregazione dei registri e gli eventi per le metriche a un costo inferiore rispetto ai dati inviati alla pipeline Insight priorità.