OpenAI beabsichtigt, in seinem neuen Modell Astra eine als „rekurrente Tiefe“ (recurrent depth) oder „opake Rekurrenz“ (opaque recurrence) bekannte Inferenztechnik einzusetzen, wie The Information berichtet. Die Technik ermöglicht es dem Modell, dieselbe Anfrage innerhalb einer Schleife mehrmals zu verarbeiten, anstatt einem sequenziellen Pfad zu folgen, der den herkömmlichen Denkschritten in Inferenzmodellen ähnelt.
Das Problem, das Besorgnis ausgelöst hat, betrifft nicht nur die Einführung des Modells oder seine angekündigten Fähigkeiten, sondern auch die Möglichkeit, dass diese Architektur den Inferenzprozess weniger überprüfbar macht. Je weniger lesbare Spuren das Modell hinterlässt, desto schwieriger wird es für Sicherheitsteams, unerwünschtes Verhalten zu erkennen oder die Gründe für die Entscheidungen fortgeschrittener Agenten und Modelle zu verstehen.
Warum ist diese Nachricht wichtig?
Forschungsteams im Bereich der künstlichen Intelligenz verwenden Protokolle der „Gedankenkette“ als Überwachungsinstrument, obwohl diese Protokolle das interne Denken des Modells nicht unbedingt vollständig oder wörtlich wiedergeben. Laut dem Artikel waren diese Protokolle ein wichtiger Faktor bei der Analyse einer jüngsten Aktivität von Agenten, die als außerhalb des erwarteten Verhaltens liegend beschrieben wurde, sowie beim Versuch, die Gründe für ihr Verhalten zu verstehen.
Im Fall der opaken Rekurrenz könnten größere Teile des Verarbeitungsprozesses in einen Pfad verlagert werden, der keine klaren, für Menschen leicht lesbaren Schritte erzeugt. Das wirft für Sicherheitsteams eine praktische Frage auf: Wie lässt sich ein Modell überwachen, dessen Inferenzfähigkeit zunimmt, wenn gleichzeitig die verfügbaren Hinweise darauf, wie es zu seinem Ergebnis gelangt, abnehmen?
Bedenken hinsichtlich eines schwer umkehrbaren Kurses
Buck Shlegeris, der CEO von Redwood, warnte, dass eine zunehmende Rekurrenz die Überwachbarkeit der Gedankenkette erheblich verringern könnte. Er sagte, er wisse noch nicht, ob Astra weniger überwachbar sei als frühere Modelle, befürchte jedoch, dass eine Weiterentwicklung der Technik auf höhere Stufen diese Überwachbarkeit vollständig untergraben könnte.
Auch Zvi Mowshowitz, ein langjähriger Verfechter der KI-Sicherheit, vertrat die Ansicht, dass ein intensiver Einsatz dieser Methoden den Bemühungen von OpenAI und Anthropic schaden könnte, Gedankengänge lesbar zu halten und sie mit dem tatsächlichen Verhalten abzugleichen. Er stellte die Möglichkeit von Gesetzen in den Raum, um einen von ihm als „Wettlauf nach unten“ bezeichneten Wettbewerb zwischen KI-Laboren zu verhindern.
Die Position von OpenAI und die derzeit bekannten Grenzen
Die verfügbaren Informationen deuten darauf hin, dass Astra die Technik nur begrenzt einsetzen wird und dass seine Gedankenkette voraussichtlich lesbar bleiben soll. OpenAI wies außerdem die Andeutung zurück, das Modell werde vollständig in einen unverständlichen Modus oder in eine sogenannte „neuronale Sprache“ (neuralese) wechseln.
Jakub Pachocki, der Chefwissenschaftler von OpenAI, bestätigte in einem Beitrag auf der Plattform X, dass das Unternehmen bereits seit den ersten Inferenzmodellen daran gearbeitet habe, die Überwachung und Nutzung der Gedankenkette aufrechtzuerhalten, und dass dieses Ziel einen wesentlichen Schwerpunkt seines aktuellen Forschungsprogramms darstelle. OpenAI hatte außerdem Pläne für eine umfassendere Überwachung von Gedankengängen im Rahmen seiner künftigen Sicherheitspläne angekündigt.
Was bleibt offen?
Ryan Greenblatt, der Chefwissenschaftler von Redwood Research, ist der Ansicht, dass sich opake Inferenz schneller ausweiten könnte als Inferenz auf Grundlage einer herkömmlichen Gedankenkette, bis hin zur Verlagerung des größten Teils des Denkprozesses in den unsichtbaren „latenten Raum“. The Information berichtete später, dass auch Anthropic und Google DeepMind die Technik erörtern, was darauf hindeutet, dass die Frage über das Astra-Modell hinaus zu einer umfassenderen Forschungsrichtung werden könnte.
Die Quelle belegt jedoch nicht, dass Astra seine Gedankenkette vollständig verbergen wird, und liefert keine konkreten Messungen, die das Ausmaß eines Rückgangs der Überwachbarkeit zeigen. Die derzeit sichere Veränderung besteht daher im Auftauchen einer neuen Technik, die Fragen zu Sicherheitsinstrumenten aufwirft, nicht im Nachweis eines Versagens dieser Instrumente. Die praktische Bedeutung der Entwicklung wird davon abhängen, in welchem Umfang die opake Rekurrenz eingesetzt wird und ob OpenAI und andere Labore alternative oder ergänzende Überwachungsmethoden für herkömmliche Protokolle bereitstellen können.