In Systemen, die Geldtransfers, das Gesundheitswesen oder Infrastrukturen betreffen, reicht es nicht aus, dass der KI-Agent meistens erfolgreich ist. Der zentrale Gedanke der ersten Stufe eines aus sechs Stufen bestehenden Reifegradmodells für den Betrieb von Sprachmodellsystemen in der Produktion besteht darin, das Modell in einem einzigen Knoten einzuschließen, sodass der umliegende Teil gewöhnlicher Code bleibt, der getestet, überprüft und auditiert werden kann.
Der Beitrag beschreibt diesen Ansatz als „Determinismusschicht“: Das System behält die Fähigkeit des Modells zur Beurteilung komplexer Eingaben bei, hindert es jedoch daran, unmittelbar über den Geschäftszustand zu verfügen oder sensible Aktionen auszuführen.
Der Agent schlägt vor und führt nicht aus
Der Agent arbeitet als reine Funktion, die den Kontext in eine vorgeschlagene Entscheidung umwandelt. Er erzeugt die Entscheidungs-ID, die erforderliche Berechtigung, die vorgeschlagene Änderung, den Konfidenzwert, den Weiterleitungsweg sowie Begründungen und Nachweise, verändert jedoch nicht den Geschäftszustand. Das Ergebnis wird an eine separate Komponente weitergeleitet, die der Beitrag substrate nennt und die es erst nach Einholung der erforderlichen Genehmigung anwendet.
Diese Trennung verleiht dem System drei praktische Eigenschaften: Der Agent kann getestet werden, ohne die Außenwelt zu simulieren, die Auswirkungen fehlerhafter Ausgaben werden auf einen ablehnbaren Vorschlag begrenzt, und Ketten verborgener Seiteneffekte zwischen Agenten werden verhindert. Damit lautet die prüfbare Frage: Was hat das Modell vorgeschlagen, wer hat es genehmigt und was wurde tatsächlich angewendet?
Ein statischer Ablaufplan statt einer freien Schleife
Statt ein ReAct-Modell bei jedem Durchlauf den nächsten Schritt bestimmen zu lassen, schlägt der Beitrag für jede Fähigkeit einen statischen Ablaufplan vor. Die Anfrage durchläuft dem Beispiel zufolge Knoten für die Eingabe der Entscheidung, die Prüfung der Eingaben und das Laden des Kontexts, anschließend einen einzigen Knoten für die Sprachinferenz, gefolgt von Ausgabeschranken und Validierung, optionaler Schlichtung, Konfidenzaggregation, Weiterleitung, Vorbereitung des Vorschlags sowie dem Schreiben in den Speicher und das Entscheidungsprotokoll.
Diese Struktur macht den Ausführungspfad im Voraus bekannt, begrenzt Ausführungszeit und Kosten und ermöglicht es, jeden Knoten einzeln zu testen. Der nichtdeterministische Knoten ist llm_decision. Er nimmt eine strukturierte Eingabe entgegen und erzeugt eine strukturierte Ausgabe, während spezialisierter Code die zulässigen Werte, die Übereinstimmung mit dem Schema und die Geschäftsregeln überprüft.
Strukturierte Ausgaben bedeuten nicht, dass die Entscheidung korrekt ist
Der Beitrag warnt davor, sich auf freien Text zu verlassen und anschließend zu versuchen, die Entscheidung daraus zu extrahieren. Die Alternative besteht darin, ein JSON-Schema, Tool-Aufrufe oder eine durch Grammatiken eingeschränkte Generierung zu verwenden, anschließend das Ergebnis zu validieren und bei Nichtübereinstimmung einen erneuten Versuch zu unternehmen – mit einer begrenzten Anzahl von Versuchen und einem sicheren Fehlschlag, statt eine Vermutung an die nächsten Stufen weiterzugeben.
Dieses Verfahren kontrolliert jedoch die Form der Ausgabe, nicht die Richtigkeit des Urteils. Ein JSON-Objekt kann syntaktisch korrekt sein und dennoch eine falsche Entscheidung enthalten. Daher müssen die Prüfung der Geschäftsregeln, die Evaluierung und unabhängige Konfidenzsignale in nachgelagerten Schichten verbleiben.
Konfidenz, Eskalation und das unlöschbare Protokoll
Die Konfidenz wird aus dem Signal des Modells, den Validierungsergebnissen und der Überprüfung durch ein zweites Modell bei Stichproben sensibler Entscheidungen zusammengesetzt. Anschließend leitet das System die Entscheidung an die automatisierte Ausführung weiter, empfiehlt eine menschliche Prüfung, erzwingt eine solche oder lehnt die Entscheidung ab. Der Beitrag betont, dass der Konfidenzwert kein Feld sein sollte, das der Agent selbst festlegt, sondern ein aus unabhängigen Signalen berechnetes Ergebnis. Die Schwellenwerte sollten konservativ beginnen und nur dann gesenkt werden, wenn Daten die Sicherheit dieses Vorgehens belegen.
Außerdem sollte jede Entscheidung in einem zusätzlichen, unlöschbaren Protokoll erfasst werden, das die Version des Modells und des Prompts, eine Zusammenfassung der Entscheidungseingaben sowie die Entscheidung, die Konfidenz und den Weiterleitungsweg enthält. Korrekturen ändern frühere Protokolleinträge nicht, sondern werden als neue Einträge hinzugefügt, die auf die Entscheidung verweisen, die sie ersetzen. Der Beitrag empfiehlt, statt der Rohdaten sensible Eingaben zu hashen und das Schreiben auch unter Belastung nicht ausfallen zu lassen, da das Protokoll die maßgebliche Referenz und nicht bloß Überwachungsdaten ist.
Wann ist eine iterative Schleife zulässig?
Die Methode lehnt ReAct-Schleifen nicht vollständig ab, beschränkt sie jedoch auf Fälle, in denen die Anzahl und Reihenfolge der Schritte davon abhängen, was das Modell während der Suche entdeckt. Auch bei ihrer Verwendung müssen eine ausdrückliche Wiederholungsgrenze, eine Liste der für jede Fähigkeit zulässigen Tools und die Protokollierung jedes Schritts vorgeschrieben werden. Die Ausgabe muss erneut dieselben Schranken, Validierungen, Konfidenzprüfungen und Weiterleitungsregeln durchlaufen. Wird die Grenze erreicht, bevor ein Ergebnis vorliegt, führt der Pfad zu einer menschlichen Prüfung statt zu einer Endlosschleife.
Redaktionelle Einordnung: Die eigentliche Veränderung besteht hier nicht in der Auswahl eines besseren Modells, sondern darin, den Vertrauensschwerpunkt von der „Autonomie des Agenten“ auf die Gestaltung der ihn umgebenden Grenzen zu verlagern. Dieses Design löst weder das Problem der Richtigkeit des Urteils noch die Kalibrierung der Konfidenz automatisch, macht Fehler jedoch isolierbar, reproduzierbar und überprüfbar. Daher eignet es sich als Grundlage für Systeme mit hohen Konsequenzen, nicht als Ersatz für kontinuierliche Evaluierung oder die fachkundige Validierung jeder einzelnen Fähigkeit.