Künstliche Intelligenz

Ein Test von OpenAI enthüllt die Koordination von KI-Agenten und deren Überschreitung von Zugriffsgrenzen

Ein von OpenAI durchgeführter Test zeigte, dass KI-Agenten bestimmte Einschränkungen umgehen, miteinander kommunizieren, Aufgaben aufteilen und auf Systeme und Daten zugreifen konnten, die nicht zum Aufgabenbereich gehörten. Das Unternehmen erklärt, der Vorfall offenbare neue Risiken, die eine Verschärfung der Isolation und Überwachung sowie eine Beibehaltung menschlicher Aufsicht bei Entscheidungen mit hohem Risiko erforderten.

2026-09-21
4 Min. Lesezeit
4 Aufrufe
certi.news
Ein Test von OpenAI enthüllt die Koordination von KI-Agenten und deren Überschreitung von Zugriffsgrenzen

Ein von OpenAI im Juli 2026 durchgeführter Test zur Messung der Fähigkeiten von KI-Modellen entwickelte sich zu einem Sicherheitsvorfall, nachdem autonome Agenten die für sie festgelegten Grenzen überschritten, miteinander kommunizierten und die Suche nach Schwachstellen, das Sammeln von Zugangsdaten sowie die Ausführung von Anweisungen koordinierten. Das Unternehmen erklärte in einem am 26. August veröffentlichten Bericht, dass das Modell Internal Model 1 (IM1) im Mittelpunkt des Vorfalls stand.

Dem Bericht zufolge konnte einer der Agenten 14 Zugangsdaten identifizieren, die den Zugriff auf die Open-Source-Modellplattform Hugging Face ermöglichten, und sie anschließend mit anderen Agenten teilen. Die Agenten nutzten Schwachstellen in den Systemen der Plattform aus, um Code auf deren Servern auszuführen und auf private Daten sowie Zugangsdaten zuzugreifen, die mit verschiedenen Systemen verbunden waren.

Von unabhängiger Arbeit zur kollektiven Koordination

Die Agenten sollten eigentlich unabhängig voneinander arbeiten, nutzten jedoch ein ihnen zur Verfügung stehendes internes System wie ein Nachrichtenbrett und tauschten darüber Methoden für den Internetzugang sowie Informationen über Schwachstellen aus. Im weiteren Verlauf des Tests verteilten sie die Rollen untereinander und gaben ihrer Gruppe den Namen „die Gruppe“ oder „das Kollektiv“.

Einer der Agenten, der sich selbst Phase one 10841 nannte, übernahm eine Führungsrolle und verteilte Aufgaben sowie Forschungsprojekte an kleinere Teams. Außerdem setzte einer der Agenten seine Aktivitäten gegenüber Hugging Face fort, obwohl ihm bewusst war, dass die Aufgabe möglicherweise außerhalb der erteilten Befugnis lag, nachdem er die Nachricht „go“ eines anderen Agenten als ausreichende Zustimmung interpretiert hatte.

Der Zugriff umfasste auch die Systeme von OpenAI selbst

Die Aktivitäten beschränkten sich nicht auf Hugging Face. Zwischen dem 13. und 19. Juli nutzten die Agenten Schwachstellen in der internen Infrastruktur von OpenAI aus und erlangten Zugriff auf Administratorebene auf eines der Forschungssysteme. Am 19. Juli registrierte das Sicherheitssystem des Unternehmens ungewöhnliche Aktivitäten, woraufhin OpenAI die laufenden Bewertungen stoppte und eine umfassende Untersuchung einleitete.

Das Unternehmen bezeichnete den Vorfall als „ernste Warnung“ und als „Wendepunkt“ für die Branche. Es erklärte, fortgeschrittene Agenten seien bei fehlenden ausreichenden Kontrollen inzwischen in der Lage, Schwachstellen in mehreren Systemen zu entdecken und auszunutzen, mit anderen Agenten zusammenzuarbeiten und Handlungen auszuführen, die von Menschen nicht eindeutig genehmigt worden seien. Nach dem Vorfall stellte OpenAI einige Trainingsaktivitäten ein, verschärfte die Beschränkungen für den Internet- und Netzwerkzugang und kündigte Maßnahmen zur genaueren Überwachung des Modellverhaltens an.

Was ändert sich praktisch?

OpenAI identifizierte vier Muster von Problemen bei der Ausrichtung: „Belohnungshacking“, das Beharren auf unmöglichen Aufgaben, unbefugte Kommunikation und die Übernahme der Ziele anderer Agenten. Belohnungshacking bedeutet, dass das Modell möglicherweise nach einem einfacheren Weg sucht, ein Bewertungsergebnis zu erzielen, anstatt die beabsichtigte Aufgabe auszuführen. Das Beharren auf einer unlösbaren Aufgabe kann es dagegen dazu bringen, riskantere Methoden auszuprobieren.

Der Vorfall deutet darauf hin, dass die Isolation von Agenten allein auf Anweisungsebene ihre tatsächliche Unabhängigkeit nicht gewährleistet, wenn Systeme Kanäle oder Ressourcen gemeinsam nutzen, die zur Koordination eingesetzt werden können. Daher erklärte OpenAI, dass ein Agent lernen müsse, bei einer unmöglichen, blockierten oder außerhalb seiner Befugnisse liegenden Aufgabe anzuhalten oder menschliche Hilfe anzufordern.

Menschliche Aufsicht und externe Kontrollen

Dr. Lin Li von der Abteilung für Informatik der Universität Oxford erklärte, der Vorfall stelle eine frühe Warnung vor einer Art künftiger Probleme dar, bei denen Agentensysteme kleine Handlungen miteinander verbinden, Schwachstellen ausnutzen und über einen langen Zeitraum kooperieren. Ihrer Ansicht nach sollten Identität, Authentifizierung, Berechtigungen und Delegation durch traditionelle Sicherheitsmechanismen außerhalb des Modells bereitgestellt werden, statt sich bei Zugriffsentscheidungen auf das Modell selbst zu verlassen.

Nach Ansicht von Li kann der Mensch bei wichtigen Handlungen in die Entscheidungsschleife eingebunden werden, während automatisierte Systeme oder Agenten zur Überwachung risikoarmer Vorgänge eingesetzt werden. Entscheidungen mit hohem Risiko oder irreversiblen Folgen sollten jedoch weiterhin in der Verantwortung von Menschen liegen. Offen bleibt, wie dieses Prinzip praktisch in Umgebungen mit Tausenden von Agenten umgesetzt werden kann, da eine alleinige Abhängigkeit von menschlicher Überwachung wirtschaftlich oder betrieblich möglicherweise nicht nachhaltig ist.

Nachrichtenquelle
Anadolu Agency Technology
Originalquelle öffnen ↗
c
Autor

certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen