Zum Inhalt

Grafana Dashboards & Monitoring

Grafana ist die zentrale Visualisierungs-Plattform der Open Data Infrastruktur (ODI) zur Überwachung des Systemzustands, der Auslastung und der Fehleranalyse in den Umgebungen Stage und Produktion.


Übersicht der Dashboards

1. Dashboard: Fehleranalyse & Logging

Das Fehleranalyse-Dashboard ist die primäre Anlaufstelle für den Support und den operativen Betrieb bei der Identifikation und Analyse von Störungen.

Grafana Fehleranalyse & Logging Dashboard

Hauptkomponenten:

  • Fehler-Rate über Zeit (Graph): Visualisiert die Anzahl von ERROR- und WARN-Einträgen pro Service im zeitlichen Verlauf.
  • HTTP Status-Codes: Trennung zwischen kritischen Server-Fehlern (5xx) und Client-Fehlern (4xx). !!! note "Log-Level bei unbekannten Routen (404)" Unbekannte Routen und nicht gefundene Ressourcen (404 Not Found) werden gezielt mit dem Log-Level WARN geloggt, um das Fehler-Log frei von Hintergrundrauschen (z. B. fehlerhaften Crawler-Anfragen) zu halten. Echte Server-Fehler (5xx) werden strikt als ERROR erfasst.
  • Zentraler Log-Stream: Live-Anzeige aller eingehenden JSON-Logs, filterbar nach Service (context), Umgebungen und Log-Level.
  • Request ID Filter (Correlation Tracing): Eingabefeld zur Filterung des gesamten Dashboards auf eine spezifische requestId (siehe Fehleranalyse & Request ID).

2. Service & Cluster Monitoring

Diese Dashboards bieten Echtzeit-Einblicke in die Systemleistung und Ressourcennutzung der Kubernetes-Cluster:

  • Pod Resource Usage: Auslastung von CPU, Arbeitsspeicher (Memory) und Netzwerk-I/O aller Microservices (odi-metadata-service, odi-ckan-service, odi-staging-backend, odi-schema-backend, odi-masterportal-service usw.).
  • HTTP Request Rate & Latency: Durchsatz (Requests/sec) und Antwortzeiten (Percentiles p50, p90, p99) pro Endpunkt.
  • Container Restarts & Uptime: Früherkennung von OOM-Kills (Out Of Memory) oder Crash-Loops einzelner Microservices.

Zugänge & Umgebungen

Grafana ist für befugte Personen über die internen Monitoring-Ingresses der jeweiligen Umgebung erreichbar:

Umgebung Grafana Hauptseite Direktlink: Fehleranalyse (Request ID Suche)
Produktion (Prod) https://grafana.odi.schleswig-holstein.de 🚀 Request ID Suche Dashboard (Prod)
Staging (Stage) https://grafana.odi-stage.schleswig-holstein.de 🧪 Request ID Suche Dashboard (Stage)

Tipps zur effizienten Nutzung

  1. Zeitfenster eingrenzen: Verwende oben rechts in Grafana ein enges Zeitfenster (z. B. Last 15 minutes oder den genauen Zeitraum eines gemeldeten Fehlers), um relevante Log-Streams schnell einzugrenzen.
  2. Auto-Refresh aktivieren: Schalte bei Live-Deployments oder Wartungen das automatische Aktualisierungsintervall (z.B. 5s oder 10s) ein.
  3. Log-Zeile aufklappen: Klicke im Log-Stream auf eine fehlerhafte Zeile, um den vollständigen interaktiven JSON-Baum mit allen Details zu öffnen.