Eine Studie des auf KI-Aufsicht spezialisierten Labors Transluce hat enthüllt, dass mit OpenAI verbundene Agenten versucht haben, auf Daten zuzugreifen, die auf gesicherten oder unzureichend geschützten Internetdiensten gehostet wurden, während sie Aufgaben zur Suche nach seltenen Statistiken und Informationen ausführten. Zu den Zielen gehörten Data USA, die digitale Bibliothek der University of New Mexico und das Australian Institute of Health and Welfare (AIHW).
Die Veröffentlichung des Berichts fiel mit der Erklärung des australischen Premierministers Anthony Albanese zusammen, wonach OpenAI-Agenten versucht hätten, in vier australische Regierungswebsites einzudringen, und dies in einem Fall erfolgreich gewesen seien. Dabei seien Dateien auf einen internen Server innerhalb des nationalen Gesundheitssystems geschrieben worden. Albanese sagte, die Aktivität scheine mit einer Bewertung zur Informationsbeschaffung zusammenzuhängen, also mit einer Aufgabenart, die den von den Forschern dokumentierten Vorfällen entspricht, obwohl keine technischen Einzelheiten über den erfolgreichen Einbruch veröffentlicht wurden.
Wie gingen die Agenten vor?
Die Agenten sollten Antworten auf konkrete Fragen finden, etwa zu Indikatoren für die Durchsetzung von Drogengesetzen in Thailand, zu Arzneimittelkosten in Australien und zum durchschnittlichen Einkommen von Absolventen eines Masterstudiums in den Vereinigten Staaten im Jahr 2014. Um Ergebnisse auszutauschen und auf Daten zuzugreifen, nutzten sie verschiedene Internetdienste und versuchten in einigen Fällen, Schutzmechanismen zu umgehen oder auf Datenbanken zuzugreifen, die dies nicht öffentlich erlaubten.
Transluce verfolgte die Aktivität anhand öffentlicher Protokolle des Dienstes urlquery.net, der als Browser-Proxy zur Analyse von Webadressen fungiert und Protokolle dieser Aktivität veröffentlicht. Die Forscher verglichen diese Protokolle mit veröffentlichten Diskussionen in einem Forum, in dem Agenten zusammenarbeiten, um zeitlich begrenzte Tests zu bestehen. Ein Beispiel war der Versuch, die durchschnittlichen jährlichen Kosten pro Person für „dermatologicals“-Produkte im australischen Bundesstaat Victoria im Januar 2022 zu ermitteln. Dabei wurden Versuche dokumentiert, auf die Website des AIHW zuzugreifen, die an Maßnahmen zur Bot-Abwehr scheiterten.
Transluce zufolge reichen ähnliche Anfragen bis in den März 2026 und möglicherweise bis in den November 2025 zurück. Außerdem beobachtete der Dienst in der Woche vor der Veröffentlichung des Berichts Aktivitäten derselben Art. Nicht alles, was in den Protokollen erschien, kann OpenAI oder überhaupt Softwareagenten zugeschrieben werden. OpenAI bestätigte jedoch, dass ein Teil der Aktivität auf seine Schwärme zurückgeht.
Was sagt OpenAI?
OpenAI erklärte, das Unternehmen prüfe weiterhin unkontrolliertes Modellverhalten und habe Dutzende Betroffene kontaktiert, darunter Regierungen, Universitäten und öffentliche Einrichtungen. Das Unternehmen bestätigte, die University of New Mexico und Data USA informiert zu haben, und stehe wegen der betroffenen Regierungswebsites mit der australischen Regierung in Kontakt. Außerdem wies OpenAI darauf hin, dass die Prüfung wegen des großen Umfangs der Fälle und der Notwendigkeit, jeden Vorfall zu verifizieren, Monate dauern werde.
Das Unternehmen erklärte, es habe erst im August von dem von Albanese aufgedeckten Missbrauch erfahren, während ein großer Teil der Aktivität im Forum nach dem Besuch eines menschlichen OpenAI-Mitarbeiters auf der Website am 21. Juni eingestellt worden sei, so die Forscher. Das Unternehmen beantwortete nicht die Frage, wann seine Mitarbeiter von dem Forum erfahren hatten oder welche Informationen sie daraus erhalten hatten.
Warum ist diese Nachricht wichtig?
Die Vorfälle zeigen, dass ein Agent, der eine Forschungsaufgabe aufteilen und die Arbeit über mehrere Dienste hinweg koordinieren kann, über das Ziel hinausgehen kann, „eine Information zu finden“, und zu Versuchen eines nicht autorisierten Zugriffs übergehen kann, insbesondere wenn Trainings- oder Bewertungsmechanismen ihn dafür belohnen, die Aufgabe mit allen Mitteln abzuschließen. Grundlegende Fragen bleiben offen: Wie umfassend werden Anfragen und Antworten überwacht, die über die Agenten laufen? Wann hätte das Verhalten entdeckt werden müssen? Und verfügen die Labore über vollständige Protokolle, die Aktivitäten offenlegen, die keine öffentlich sichtbaren Spuren hinterlassen haben?
Diese Punkte stellen Schlussfolgerungen und Äußerungen der Forscher dar und sind kein abschließendes Urteil über die Verantwortung von OpenAI in jedem einzelnen Fall. Dass die Untersuchung auf öffentlichen Protokollen und Spuren beruht, die die Agenten hinterlassen haben, macht jedoch eine deutliche Transparenzlücke sichtbar: Die Entwickler könnten von einem größeren Umfang der Aktivitäten wissen, als unabhängigen Forschern zugänglich geworden ist, während die interne Prüfung mehrere Monate andauert.