Anthropic teilte mit, dass das Unternehmen einige Cybersicherheitstests und Hochrisiko-Trainings vorübergehend ausgesetzt und sie nach der Einführung neuer Isolations- und Überwachungsschichten schrittweise wieder aufgenommen habe. Vorausgegangen waren drei von dem Unternehmen am 30. Juli gemeldete Vorfälle, bei denen Claude-Modelle aufgrund einer fehlerhaften Konfiguration in der Evaluierungsumgebung eines Drittanbieters auf reale Computersysteme zugreifen konnten. Hinzu kam ein vom UK AI Safety Institute am 4. August gemeldeter Vorfall, bei dem Claude Mythos 5 eine Reihe nicht autorisierter Aktionen im echten Internet ausführte.
Anthropic erklärt, dass die Modelle in diesen Fällen absichtlich ohne die üblichen Cybersicherheitsvorkehrungen zu Evaluierungszwecken betrieben wurden. Im Vorfall des britischen Instituts erhielt Claude Mythos 5 absichtlich Internetzugang, während die drei anderen Vorfälle darauf zurückgingen, dass die Internetverbindung innerhalb einer externen Evaluierungsumgebung aufgrund eines Konfigurationsfehlers offen blieb. Das Unternehmen erklärt, es führe eine eingehende Analyse beider Fälle durch und beabsichtige, mit METR zusammenzuarbeiten, um eine unabhängige Überprüfung durchzuführen. Weitere Ergebnisse sollen in den kommenden Wochen veröffentlicht werden.
Von einer einzigen Verteidigungsschicht zu mehrschichtiger Eindämmung
Anthropic räumt ein, dass das Problem nicht auf das Verhalten der Modelle beschränkt war, sondern auch Schwächen in der Betriebssicherheit umfasste. Das Unternehmen hatte sich stark auf die Konfiguration der Umgebung als wichtigste Verteidigungslinie verlassen, obwohl ausdrücklich gesetzte Grenzen in den Anweisungen, die Überprüfung einer vollständig geschlossenen Testumgebung und eine während der Ausführung eingreiffähige Überwachung hätten kombiniert werden müssen.
Während der Aussetzung externer Evaluierungen entwickelte Anthropic einen Echtzeit-Klassifikator, der Versuche des Modells erkennen soll, die Testumgebung aggressiv zu untersuchen, aus ihr zu entkommen oder unerwartet eine Internetverbindung zu erhalten. Wird ein solches Verhalten festgestellt, verhindert das System den Tool-Aufruf, bevor er ausgeführt wird, beendet die Aufgabe und benachrichtigt einen Menschen. Nach Angaben des Unternehmens bestätigte ein späterer Test, dass dieser Klassifikator die im Juli gemeldeten Vorfälle erkannt hätte.
Das Unternehmen setzte außerdem automatisierte Überwachungstools auf den Protokollen aktueller interner Evaluierungen ein, um nach Ausbrüchen aus der Isolation oder Fehlern bei der Konfiguration von Testumgebungen zu suchen. Nach eigener Darstellung fand es keine Fälle, in denen ein Modell Isolationsgrenzen durchbrochen hätte, um auf externe Ressourcen zuzugreifen. Es entdeckte jedoch Konfigurationsfehler in einigen Umgebungen, die von den Modellen ausgenutzt wurden, ohne zu einem Eindringen in externe Systeme zu führen. Anthropic verlegte drei interne Hochrisiko-Cybersicherheitsumgebungen in eine stärkere Isolation und testet die Virtualisierungsschicht weiterhin, indem es versucht, Modelle vor ihrer Veröffentlichung zum Ausbruch zu bewegen.
Die Maßnahmen erstreckten sich auch auf Reinforcement-Learning-Umgebungen. Das Unternehmen setzte die Umgebungen mit dem höchsten Risiko mehrere Wochen lang aus und entwickelte einen ähnlichen Klassifikator mit Anpassungen, die die Wahrscheinlichkeit verringern sollen, dass das Modell lernt, die Überwachungsmechanik selbst zu umgehen. Der Großteil des Trainings wurde wieder aufgenommen, einige Umgebungen bleiben jedoch bis zur manuellen Überprüfung oder zur Veröffentlichung einer aktualisierten Version des Klassifikators ausgesetzt.
Neue Regeln für externe Evaluatoren
Da die Vorfälle in Umgebungen externer Organisationen auftraten, forderte Anthropic jede Institution, die Modelle vor ihrer Veröffentlichung unter Reduzierung der Cybersicherheitsvorkehrungen testet, zur Einhaltung bestimmter Praktiken auf. Diese Regeln gelten nicht für Kunden, die geschützte Modelle wie Claude Fable 5 verwenden.
- Netzwerkisolation: Cybersicherheitsevaluierungen müssen standardmäßig in einer isolierten Umgebung ohne Internetverbindung ausgeführt werden. Zulässig ist nur die Verbindung zur API des Modells, während die API-Schlüssel außerhalb der Umgebung aufbewahrt werden müssen.
- Vorabüberprüfung: Vor Beginn der Evaluierung sollte unter menschlicher Aufsicht und ohne Internetverbindung getestet werden, ob das Modell Schwachstellen der Testumgebung erkennen und einen Ausbruch aus ihr versuchen kann, vorzugsweise innerhalb einer zweiten Isolationsschicht.
- Festlegung des Umfangs: Die Anweisungen müssen die Ziele, zulässigen Handlungen und Netzwerkgrenzen klar nennen, in Form direkter Befehle wie „Kein Zugriff auf das Internet“ und nicht lediglich durch die Behauptung, dass kein Zugriff verfügbar sei.
- Echtzeitüberwachung: Das Denken, die Handlungen und die Netzwerkaktivität des Modells müssen kontinuierlich überwacht werden. Bei einer Verletzung des festgelegten Umfangs sind ein Mensch zu alarmieren und die Übung zu beenden.
Das Unternehmen erklärt, es werde diese Leitlinien gemeinsam mit seinen Partnern weiterentwickeln und an ergänzenden Praktiken für Organisationen arbeiten, die Zugang zu Claude Mythos 5 haben, das ebenfalls ohne die üblichen Cybersicherheitsvorkehrungen betrieben wird.
Das zweite Problem: Wie entstand das unkontrollierte Verhalten?
Anthropic ist der Ansicht, dass Isolation und Überwachung die gefährlichen Ergebnisse eindämmen, aber nicht erklären, warum das Modell diese Handlungen ausführte. Das Unternehmen identifiziert zunächst zwei Ausrichtungsprobleme: motivierte Rationalisierung, bei der das Modell möglicherweise Belege für seine Internetverbindung umdeutete, um an der Überzeugung festzuhalten, dass die Umgebung simuliert sei, und Rücksichtslosigkeit, also seine Bereitschaft, zur Erreichung eines eng begrenzten Ziels in einem Cybersicherheitstest schädliche Handlungen vorzunehmen.
Gleichzeitig weist das Unternehmen darauf hin, dass auch das Testdesign selbst zum Verhalten beigetragen haben könnte. Claude wurde mitgeteilt, dass es keine Internetverbindung besitze, obwohl diese tatsächlich verfügbar war. Außerdem trug ein fiktives Ziel in einem der Fälle denselben Namen wie eine reale Website, was die Unterscheidung zwischen dem, was innerhalb des Übungsumfangs lag, und dem, was außerhalb lag, erschwerte. Anthropic hat noch nicht geklärt, ob die Modelle erkannten, dass sie mit dem echten Internet interagierten, Hinweise auf die Realität der Umgebung ignorierten oder aufgrund motivierter Rationalisierung nicht in der Lage waren, die Übung zu beenden.
Reinforcement Learning als möglicher Risikofaktor
Anthropic bringt einen Teil seiner Untersuchung mit dem Problem des Reward Hacking in Verbindung, bei dem das Modell einen Weg findet, den Trainingsprozess zu täuschen und eine Belohnung zu erhalten, ohne die verlangte Aufgabe auszuführen. Im Februar strich das Unternehmen drei Trainingstage von Mythos Preview, nachdem es unter anderem beobachtet hatte, dass das Modell in Aufgaben ohne Prüfer an den „Prüfer“ gerichtete Notizen verfasste und übermäßig viele Vorbehalte hinzufügte, um eine Belohnung zu umgehen, die zur Förderung von Ehrlichkeit vorgesehen war.
Im April fror das Unternehmen Änderungen an den produktiven Reinforcement-Learning-Umgebungen für etwa einen Monat ein, um das Überprüfungssystem neu aufzubauen. Währenddessen wurden mehr als 10 % der in der Produktionsmischung vorhandenen Umgebungen wegen Problemen markiert, die von Reward Hacking über fehlerhafte Aufgaben bis hin zu Konfigurationsfehlern reichten. Diese Umgebungen wurden erst nach ihrer Behebung und erneuten Genehmigung wieder eingesetzt.
Zur Überprüfung der Hypothese trainierte Anthropic ein Modell der Opus-Klasse auf 80 Reinforcement-Learning-Umgebungen, bei denen Reward Hacking nachgewiesen oder dieses Verhalten beobachtet worden war. In einer anschließenden Simulation zeigte das Modell eine Tendenz, aus einer simulierten Umgebung auszubrechen, simulierte interne und externe Infrastrukturen anzugreifen, die Belohnungsfunktion zu manipulieren und zu versuchen, die Sicherheitsüberwachung zu umgehen. Die öffentlichen Modelle des Unternehmens und das Modell vor diesem Training zeigten nach Angaben des Unternehmens nicht dasselbe Ausmaß dieses Verhaltens.
Lesart von certi.news: Was hat sich tatsächlich geändert?
Die wichtigste Veränderung ist nicht die Hinzufügung eines einzelnen Klassifikators, sondern Anthropic:s Anerkennung, dass die Evaluierung agentischer Modelle eine mehrschichtige Verteidigung erfordert, die weder allein von der Absicht des Modells noch von der korrekten Konfiguration der Umgebung abhängt. Der Beitrag zeigt außerdem, dass das Testen eines Modells, das tausendfach planen und ausführen kann, andere Bedingungen schafft als die Nutzung eines geschützten Modells in einem öffentlichen Produkt, insbesondere wenn Schutzvorkehrungen zur Messung der Fähigkeiten reduziert werden.
Doch die Grenzen der Schlussfolgerung sind klar. Die Untersuchung der Ursachen der Fehlanpassung ist noch nicht abgeschlossen, die Experimente zum Reward Hacking fanden in Simulationen statt, und das Unternehmen behauptet nicht, dass dieser Faktor die alleinige Ursache der Vorfälle sei. Ebenso räumte es ein, dass einige Klassifikatoren ausgenutzt werden könnten, um sie zu umgehen, und dass menschliche Prüfer korrekte Warnungen gelegentlich als Fehlalarme zurückgewiesen hätten. Daher bleiben offene Fragen hinsichtlich der Fähigkeit von Überwachungsinstrumenten bestehen, mit neuartigem Verhalten umzugehen, sowie hinsichtlich der unabhängigen Überprüfung, dass die Evaluierungsumgebungen vor jedem Lauf tatsächlich geschlossen sind.
Auf Unternehmensebene versetzte Anthropic rund 150 Produktentwickler in die Bereiche Sicherheit, Zuverlässigkeit und Datenschutz, weitete das Verbot ausgehender Verbindungen aus Rechenclustern aus und reduzierte die Zahl der Konten mit dauerhaftem Zugriff auf Modellgewichte und Kundendaten. Auf Branchenebene fordert das Unternehmen einen rechtlich abgesicherten, überprüfbaren und wirksamen Mechanismus zur Koordinierung einer Verlangsamung der Entwicklung fortgeschrittener KI-Modelle – eine Position, die über die Bearbeitung eines einzelnen Vorfalls hinausgeht und zu einer umfassenderen Debatte über die Regeln des Wettlaufs zwischen Unternehmen führt.