Cloudflare hat die Funktion Issues zur Fehlerüberwachung in Cloudflare Workers eingeführt, die derzeit als offene Betaversion verfügbar ist. Die Funktion bündelt wiederkehrende Fehler in einem einzigen Issue und ermöglicht anschließend, dessen Details an einen Programmieragenten zu senden, damit dieser die Untersuchung fortsetzt, eine Lösung vorschlägt und einen Pull Request eröffnet.
Cloudflare zielt auf eine praktische Lücke im Ablauf zur Bearbeitung von Produktionsausfällen: Agenten können Überwachungsdaten abfragen, sich in einem Quellcode-Repository bewegen, Tests schreiben und Code ändern. Die Verbindung dieser Schritte erforderte jedoch bisher menschliches Eingreifen, um Protokolle und Traces zusammenzutragen und sicherzustellen, dass mehrere Fehler auf dieselbe Störung zurückzuführen sind.
Was überwacht Issues?
Die Funktion arbeitet innerhalb der Workers-Umgebung und erfordert weder die Installation eines SDK noch das Hinzufügen eines Wrappers zur Anwendung. Nach der Aktivierung erfasst sie unbehandelte Ausnahmen, fehlgeschlagene Aufrufe, HTTP-Antworten der Klasse 5xx sowie Ausgaben von console.log() und console.error(), zusätzlich zu Protokollen, die einen Aufruf-Stack enthalten. Außerdem erkennt sie wiederholte Ausführungen von Alarmen und das Schreiben großer Protokollmengen innerhalb von Schleifen.
Statt jede fehlgeschlagene Anfrage als separaten Fall anzuzeigen, bündelt Issues ähnliche Fehler und zeigt an, wann sie erstmals aufgetreten sind, wie oft sie aufgetreten sind und ob ihre Rate zunimmt. Das Issue zeigt den Fehler, sofern verfügbar den Aufruf-Stack, vorherige und nachfolgende Protokolle und Traces, die Worker-Version, Anfragedetails sowie den Verlauf des Issues im Zeitverlauf.
Anwendungskontext zur Untersuchung hinzufügen
Entwickler können die in die Workers-Umgebung integrierte OpenTelemetry-Schnittstelle nutzen, um Kennungen wie Benutzer, Konto und Sitzung anzuhängen. Diese Daten werden mit jedem occurrence angezeigt und helfen dabei, vor der Weiterleitung an den Agenten festzustellen, ob die Störung auf ein bestimmtes Konto oder eine bestimmte Sitzung konzentriert ist.
Von der Überwachungsübersicht zum Programmieragenten
Automation kann so konfiguriert werden, dass die Übermittlung ausgelöst wird, wenn ein Issue einen festgelegten Schwellenwert für die Anzahl der Vorkommen überschreitet oder nach einer Ruhephase erneut auftritt. Cloudflare unterstützt die Anbindung von Claude Code über eine routine ID und ein Token, von Cursor über eine Webhook-Adresse und von Devin über ein API-Token und eine Organisationskennung sowie allgemeine Webhooks, Chat-Systeme und Incident-Management-Systeme.
Der übermittelte Kontext umfasst eine Zusammenfassung des Fehlers, die Ausnahme, den nach der Zuordnung zum Quellcode aufgelösten Aufruf-Stack, Protokolle und Traces, die Worker-Version sowie den vom Entwickler hinzugefügten Anwendungskontext. Für eine eingehendere Untersuchung kann der Agent separat mit Cloudflare MCP verbunden werden, um die zugehörigen Protokolle und Traces abzufragen, Änderungen an Code und Tests vorzuschlagen und einen Pull Request zu eröffnen.
Was ändert sich in der Praxis?
Issues reduziert die manuellen Schritte zwischen der Erkennung einer Störung und ihrer Untersuchung, macht die Behebung jedoch nicht vollständig automatisiert. Die Prüfung des Pull Requests, die Veröffentlichung der Änderung und das Setzen des Issues auf den Status „gelöst“ bleiben unter der Kontrolle des Teams. Außerdem hängt die Qualität der Ergebnisse vom Kontext ab, den die Anwendung hinzufügt, sowie von den gewählten Betriebs- und Schwellenwerteinstellungen.
Cloudflare testete die Funktion mit Workflows, einer auf Workers aufbauenden Komponente für lang laufende Anwendungen mit mehreren Schritten. Innerhalb eines Tages half die Automatisierung, zwei Probleme zu erkennen: eine Wiederholungsschleife während einer Migration auf der Kontrollebene aufgrund eines SQLite-Fehlers im Zusammenhang mit einem Fremdschlüssel sowie einen Löschvorgang, der wegen der Überschreitung des Limits für untergeordnete Anfragen in Workers nicht abgeschlossen wurde. Die Automatisierung übermittelte beide Probleme an Cloudflare OS, das die Fehler im Workflows-Code zurückverfolgte und zwei Korrekturen vorschlug.
Für den Beginn der Nutzung muss observability.issues.enabled in der Datei wrangler.jsonc aktiviert und anschließend die erste Automation über die Cloudflare-Oberfläche eingerichtet werden, um das Ziel des Issues auszuwählen, sei es ein Agent, ein Webhook, ein Incident-Management-Tool oder eine Chat-Plattform.