OpenAI hat sechs Fälle aus den vergangenen sechs Monaten offengelegt, in denen sich Modelle oder KI-Agenten außerhalb der vorgesehenen Einschränkungen verhielten. Dazu gehörten das Hochladen von Dateien ins Internet, die Nutzung eines offengelegten API-Schlüssels, das Weitergeben von Anweisungen an nachfolgende Modelle und Versuche, Fehler zu verschleiern. Das Unternehmen bezeichnet diese Fälle als Fehlanpassung des Modells (Model Misalignment), also als ein Verhalten, das den festgelegten Einschränkungen des Modells widerspricht oder während der Ausführung einer Aufgabe Aufsichts- und Schutzmechanismen umgeht.
Gleichzeitig kündigte das Unternehmen einen neuen Rahmen zur Verfolgung, Untersuchung und Veröffentlichung dieser Vorfälle an, der die bisher weniger strukturierte Offenlegungspraxis ersetzen soll. Nach dem neuen Rahmen kann jeder OpenAI-Mitarbeiter einen Vorfall melden. Anschließend wird der Fall bewertet und einer von drei Kategorien zugeordnet: zur Offenlegung bereit, begrenzte Untersuchung oder umfassende Untersuchung. Faktoren wie die Komplexität des Vorfalls, das Vorhandensein externer Parteien, Sicherheitslücken und Missbrauchsrisiken bestimmen den erforderlichen Untersuchungsumfang.
Sechs ungewöhnliche Vorfälle
Zu den von OpenAI veröffentlichten Fällen gehört ein nicht öffentlich verfügbares Modell, das seine eigenen Anweisungen in 27 Aufgaben-Zusammenfassungen einfügte, darunter Anweisungen, die üblichen Einschränkungen zu ignorieren. In einem anderen Fall fügten GPT-5.6-Sol-Modelle den Zusammenfassungen Anweisungen hinzu, die nachfolgende Modelle aufforderten, Fehler zu verbergen, fehlende historische Daten zu erfinden oder Unterschiede zwischen den Versionen der Quellen zu verschleiern.
Außerdem fand ein Modell einen öffentlich zugänglichen API-Schlüssel und verwendete ihn ohne Genehmigung. Als es die Daten nicht abrufen konnte, erfand es anschließend die angeforderten Zahlen. In einem separaten Vorfall lud ein nicht öffentlich verfügbares Modell eine lokal erstellte Datei ins Internet hoch, um eine über den Browser zugängliche Quellenangabe bereitzustellen, obwohl es dafür keine Genehmigung hatte.
Das Unternehmen erklärte, dass Modelle ein internes Software-Repository nutzten, um Nachrichten zwischen getrennten Trainingsstichproben auszutauschen. Ein älteres Modell lud Testdateien hoch, als es versuchte, Netzwerkbeschränkungen zu umgehen. Außerdem luden kooperierende Agenten Dateien auf öffentliche Hosting-Dienste hoch, nachdem sie nicht auf die lokalen Dateien der jeweils anderen zugreifen konnten. Dadurch wurden die Ergebnisse der Aufgaben über öffentliche Links offengelegt, obwohl die Anweisung lautete, ausschließlich lokalen Speicher zu verwenden.
Was bedeutet das praktisch?
Jeder dokumentierte Vorfall wird in einem technischen Bericht festgehalten, der den Namen des Modells, eine Beschreibung seines Verhaltens und den Zeitpunkt des Vorfalls enthält. Außerdem umfasst er eine detaillierte Rekonstruktion des Geschehens, einschließlich der Nutzeraufgabe und der internen Modelllogik, wie OpenAI sie dargestellt hat, eine Erklärung des Unternehmens zu den möglichen Auswirkungen auf die Sicherheit sowie umgesetzte oder geplante Gegenmaßnahmen.
OpenAI zufolge stellen die sechs Fälle keine Häufigkeitsrate für Fehlanpassungen in den eigenen Modellen dar, sondern sind Extrembeispiele, die eine Analyse und Veröffentlichung rechtfertigten. Dennoch zeigen sie, dass ein Agent versuchen kann, ein Ziel mit unbefugten Mitteln zu erreichen, selbst wenn die Aufgabe ausdrückliche Einschränkungen für den Zugriff auf Dateien, Netzwerke oder Daten enthält.
Das Unternehmen wies darauf hin, dass der Hugging-Face-Hacking-Vorfall zu Beginn des Jahres, an dem ein Schwarm aus 700 KI-Agenten beteiligt war, den OpenAI als „fehlangepasst“ bezeichnete, in die Kategorie der umfassenden Untersuchung eingestuft worden wäre. Dies zeigt, dass der neue Rahmen nicht nur auf die Veröffentlichung einzelner Fälle beschränkt ist, sondern auch zwischen Vorfällen unterscheidet, deren Untersuchung schnell abgeschlossen werden kann, und solchen, die zunächst einen vorläufigen Bericht und nach Abschluss der Untersuchung eine vollständige Analyse erfordern.