OpenAI hat neue Details über das KI-Modell Astra veröffentlicht, das das Unternehmen in Kürze verfügbar machen will. OpenAI erklärte, Astra sei das erste eigene Modell, das im Rahmen des Preparedness Framework das Niveau der „kritischen Cyberfähigkeit“ erreiche. Nach der Beschreibung des Unternehmens bedeutet dies, dass das Modell bei entsprechender Ausstattung mit Werkzeugen und Zugriffsrechten bisher unbekannte Sicherheitslücken erkennen und Methoden zu deren Ausnutzung entwickeln kann.
Die Entwicklung betrifft nicht nur die Fähigkeit des Modells, Code zu analysieren oder Korrekturen vorzuschlagen, sondern auch seine Fähigkeit, fortgeschrittene Phasen der Exploit-Kette auszuführen. Aus diesem Grund verzögerte OpenAI einen Teil der Entwicklung und Veröffentlichung von Astra, während das Unternehmen in den vergangenen Wochen daran arbeitete, die Wahrscheinlichkeit zu verringern, dass das Modell für schädliche Cyberangriffe oder die Ausführung nicht autorisierter Vorgänge eingesetzt wird.
Starke Ergebnisse bei Exploit-Tests
OpenAI erklärte, Astra habe im ExploitBench-Test ein Ergebnis von 100 % erzielt. Dieser Test misst die Fähigkeit, Exploit-Software für bekannte Schwachstellen zu entwickeln. Außerdem führte das Unternehmen eine interne Bewertung von 20 kritischen Schwachstellen durch, die im Zeitraum von Juni bis August 2026 veröffentlicht worden waren.
Den von OpenAI angeführten Ergebnissen zufolge erzielte Astra bei dieser Bewertung höhere Quoten bei der Ausführung von Code aus der Ferne als das Modell GPT-5.6 Sol und verwendete dabei weniger Token-Einheiten. Während des Tests habe das Modell zwei Zero-Day-Schwachstellen innerhalb einer Exploit-Kette entdeckt und genutzt, erklärte das Unternehmen. OpenAI habe begonnen, die betroffenen Softwareentwickler über diese Schwachstellen zu informieren.
Weitere von Experten durchgeführte Tests untersuchten Astras Fähigkeit, unbekannte Schwachstellen in einem gehärteten Browser auszunutzen, anschließend aus der isolierten Umgebung auszubrechen und Befehle auf dem Hostsystem auszuführen. Bei Tests von Betriebssystemen konnte das Modell laut OpenAI mehrere Schwachstellen miteinander verknüpfen, um von einem nicht autorisierten Benutzer zu Root-Rechten zu gelangen.
Eingeschränkte Verfügbarkeit und zusätzliche Sicherheitsvorkehrungen
OpenAI plant, die fortschrittlichsten Cyberfähigkeiten von Astra schrittweise bereitzustellen. Die erste Phase wird auf eine Gruppe von Testteilnehmern beschränkt sein, bevor der Zugang zu defensiven Anwendungen über das Programm Daybreak Blue ausgeweitet wird.
Das Unternehmen erklärt, die Ablehnungsrate von Astra bei schädlichen Cyberanfragen erhöht zu haben, und will strengere Einschränkungen für Konten verhängen, die es als risikoreich einstuft. Außerdem sollen Überwachungsmechanismen zur Erkennung nicht autorisierter Verhaltensweisen sowie zusätzliche Ebenen der Schlussfolgerung und Kontrolle über die vom Modell ausgeführten Aktionen hinzukommen.
Warum ist diese Nachricht wichtig?
Praktisch verändert sich, dass ein allgemeines Modell ein Niveau erreicht, auf dem es laut den Tests des Unternehmens zur Entdeckung und Ausnutzung von Schwachstellen über eine mehrstufige Kette beitragen kann. Dies könnte Verteidigungsteams und Sicherheitsforschern nutzen, sofern die Anwendung auf autorisierte Umgebungen beschränkt bleibt. Zugleich erhöht es die Anforderungen an Zugriffskontrolle und Überwachung, da dieselben Fähigkeiten den für die Entwicklung komplexer Angriffe erforderlichen Aufwand verringern könnten.
Hier werden die Grenzen der verfügbaren Informationen deutlich. Die genannten Zahlen und Ergebnisse stammen von OpenAI; bislang gibt es keine unabhängige Überprüfung des Sicherheitsniveaus von Astra oder der Maßnahmen zur Eindämmung seines Missbrauchs. Außerdem werden das vollständige System und die detaillierten Bewertungsergebnisse laut dem Artikel erst bei der offiziellen Veröffentlichung publiziert. Daher wird die praktische Einschätzung der Fähigkeiten und Risiken des Modells von der veröffentlichten Sicherheitsarchitektur und den unabhängigen Testergebnissen nach der Bereitstellung abhängen, nicht allein von den anfänglichen Leistungsbehauptungen.