Meinungen und Analysen

Warum die Systemüberwachung mehr als Liniendiagramme braucht?

Yao Yue zufolge kann die nahezu vollständige Abhängigkeit von Liniendiagrammen bei der Systemüberwachung wichtige Muster verbergen, insbesondere wenn Messdaten dicht oder unregelmäßig sind. Sie schlägt vor, die Visualisierung anhand von Form und Art der Daten sowie der betrieblichen Fragestellung auszuwählen, einschließlich der Verwendung von Punkten, Verteilungsdiagrammen und einer Gruppierung nach Auslastung oder Softwareversion.

2026-09-02
6 Min. Lesezeit
8 Aufrufe
فريق تحرير certi.news
Warum die Systemüberwachung mehr als Liniendiagramme braucht?

Yao Yue plädiert in ihrem Vortrag auf der QCon San Francisco dafür, die Darstellung von Messdaten aus Systemen zu überdenken. Das Liniendiagramm, das zur Standarddarstellung der meisten Überwachungs-Dashboards geworden ist, kann für saubere und kontinuierliche Daten geeignet sein. Es wird jedoch weniger nützlich, wenn die Zahl der Zeitreihen zunimmt, das Rauschen stärker wird oder die eigentliche Frage nicht grundsätzlich zeitbezogen ist.

Yue stützt sich auf 15 Jahre Betrieb groß angelegter Systeme, darunter sieben Jahre, in denen sie im Bereitschaftsdienst für einen Service der Stufe 1 tätig war, sowie auf ihre frühere Erfahrung bei Twitter, wo sie ein Caching-Team leitete und anschließend ein Performance-Team aufbaute. Nach November 2022 war sie an der Gründung von IOP Systems beteiligt, einem Unternehmen, das die Effizienz und Zuverlässigkeit von Software durch intelligente Performance-Engineering-Verfahren verbessert.

Das Problem liegt nicht in der Linie selbst

Yue erklärt, dass ein Liniendiagramm nicht nur Messpunkte darstellt, sondern Linien zwischen jeweils zwei aufeinanderfolgenden Punkten zeichnet. Dadurch werden visuelle Elemente hinzugefügt, die in den Daten tatsächlich nicht vorhanden sind – etwas, das sie als Extrapolation beschreibt, also als Interpolation zwischen Messungen. Das kann bei regelmäßigen Daten hilfreich sein, kann jedoch einen Verlauf zwischen zwei Messungen suggerieren, über den keine direkten Informationen vorliegen, insbesondere bei Metriken, bei denen unbekannt ist, was zwischen den Messpunkten geschehen ist.

Das Problem verschärft sich bei Systemen mit einer großen Zahl von Instanzen oder Zeitreihen. Viele Linien und Farben können einem Überwachungs-Dashboard ein reichhaltiges Erscheinungsbild verleihen, machen die Beantwortung von Fragen wie „Hat sich die Produktionsrate verändert?“ oder „Hat die neue Bereitstellung zu einer merklichen Verschlechterung geführt?“ jedoch nicht zwangsläufig klarer. In vielen Fällen kann nur ein erfahrener Ingenieur die Grafik interpretieren und verbringt viel Zeit damit, die Details anzustarren – ein Muster, das Yue für eine zuverlässige Technik ungeeignet hält.

Die Darstellung an die Art der Messung anpassen

Die Vortragende schlägt vor, mit drei Überlegungen zu beginnen: der Form der Daten, der Art der Messung und dem, was das Team daraus erfahren möchte. Wenn die Daten überladen sind, können Mittelwerte innerhalb von Zeitfenstern verwendet oder Minimum, Maximum und Mittelwert berechnet werden, um das Rauschen zu reduzieren und Trends hervorzuheben. Diese Umwandlung sollte jedoch der gestellten Frage dienen und nicht lediglich dazu, die Grafik optisch aufzuwerten.

Yue warnt davor, dass eine Zusammenfassung der Daten wichtige Unterschiede verbergen kann. Sie verweist auf die Idee des „Datasaurus“, bei der Datensätze denselben Mittelwert und dieselbe Standardabweichung aufweisen können, obwohl ihre Formen bei der Darstellung der Rohwerte grundlegend verschieden sind. Daher kann die Darstellung von Punkten ohne Linien in manchen Fällen wahrheitsgetreuer sein, weil sie die tatsächlichen Messungen sichtbar macht und keinen unsicheren visuellen Verlauf hinzufügt.

Dem Vortrag zufolge lassen sich die meisten Messdaten in drei Haupttypen einteilen: Zähler, Momentanwerte und Histogramme. Zähler, die mit der Zeit zunehmen, können für Liniendiagramme geeignet sein. In Überwachungsanwendungen wird jedoch häufig nicht der rohe Zähler angezeigt, sondern die Differenz zwischen zwei aufeinanderfolgenden Werten, etwa die Rate von Anfragen oder Fehlern. Yue ist der Ansicht, dass die Darstellung dieser Differenz als Segmente oder Balken die kumulative Veränderung und die Streuung genauer veranschaulichen kann.

Momentanwerte garantieren dagegen nichts über den Zeitraum zwischen zwei Messungen. Der Wert kann zwischen den beiden Messpunkten steigen oder fallen, ohne dass dies in den Daten sichtbar wird. Deshalb bevorzugt die Vortragende, die Punkte unverändert und mit möglichst wenig Extrapolation darzustellen. Bei der Antwortzeit betont sie, dass ein einzelner Wert nicht ausreicht, weil sie eine Verteilung und keine einzelne Zahl darstellt. Histogramme sind ihrer Ansicht nach besser geeignet, Informationen über den Randbereich wie P99 und P99.9 zu erhalten, anstatt sie auf eine einzige Linie zu reduzieren.

Was ändert sich in der Praxis?

Die wichtigste These des Vortrags besteht nicht darin, alle Liniendiagramme zu ersetzen, sondern die Visualisierung an die betriebliche Fragestellung zu koppeln. Wenn die Frage lautet, wie sich die Auslastung auf das Service-Level-Agreement auswirkt, können die Daten nach Auslastungsbereichen gruppiert werden, etwa nach Bereichen von 500 oder 5000 Anfragen pro Sekunde, und anschließend mit Antwortzeitverteilungen verknüpft werden. Dadurch wird die direkte Beziehung zwischen Auslastung und Antwortzeit sichtbar, anstatt verschiedene Tage zu untersuchen, um den Zeitpunkt zu finden, an dem die Auslastung ihren Höchststand erreicht hat.

Beim Vergleich zweier Softwareversionen können die Messungen ebenfalls nach Version gruppiert und anschließend die Verteilungen oder Perzentile verglichen werden, ohne die Zeit zum wichtigsten Analyseparameter zu machen. Bei der Auswahl des Hardwaretyps schlägt die Idee vor, Performance-Daten mit weiteren Informationen wie Instanztyp und Preis zusammenzuführen, um eine Tabelle zu erstellen, die genau das vergleicht, was für die Skalierungsentscheidung tatsächlich relevant ist.

Die Einschätzung von certi.news

Diese Perspektive macht eine Einschränkung in der Architektur von Überwachungswerkzeugen ebenso sichtbar wie ein Problem des visuellen Designs. Systeme zur Speicherung von Messdaten sind üblicherweise auf der einen Seite um den Namen und die Merkmale der Metrik und auf der anderen Seite um Werte und Zeitstempel herum aufgebaut. Dadurch sind Abfragen, die einen Wert über die Zeit betreffen, relativ einfach. Schwieriger wird jedoch die Verknüpfung der Werte einer Metrik mit den Werten einer anderen Metrik, etwa die Verbindung von Antwortzeit und Auslastung oder der Vergleich der Performance nach Softwareversion.

In der Praxis bedeutet das, dass die Verbesserung eines Überwachungs-Dashboards nicht immer mit der Auswahl einer neuen Farbe oder eines neuen Diagramms beginnt, sondern mit der Bestimmung der Entscheidung, die es unterstützen soll. Teams müssen die Daten möglicherweise neu gruppieren oder Quellen außerhalb der Zeitreihendatenbank einbinden. Gleichzeitig liefert der Vortrag kein allgemeingültiges Rezept: Er betont, dass Art und Form der Messung sowie die jeweilige Fragestellung die geeignetste Darstellung bestimmen und dass die Quelle nicht belegt, dass jedes aktuelle Überwachungswerkzeug diese Umwandlungen automatisch unterstützt. Daher bleiben Experimentierbarkeit, der Zugriff auf Rohdaten und das Verständnis der Grenzen jeder Zusammenfassung praktische offene Fragen für Zuverlässigkeits- und Performance-Engineering-Teams.

Nachrichtenquelle
InfoQ - Architecture Articles
Originalquelle öffnen ↗
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen