Microsoft zufolge hat sich das Frontier Offensive Research & Generative Exploitation Lab, kurz FORGE, von der Prüfung der Fähigkeit künstlicher Intelligenz, schwierige Schwachstellen zu finden, hin zur Untersuchung dessen entwickelt, was erforderlich ist, um diese Entdeckungen in auslieferbare Fehlerbehebungen umzuwandeln. Zwischen Mai und September 2026 half das Labor dabei, Schwachstellen in Windows zu entdecken, denen 140 CVE-IDs zugewiesen wurden; 52 davon wurden in die Sicherheitsupdates vom September 2026 aufgenommen.
Die Arbeit erstreckte sich auch auf Open-Source-Software: FORGE-Teams reichten etwa 155 Berichte ein, die intern über 23 Projekte hinweg validiert wurden, darunter der Linux-Kernel. Laut Microsoft erhielten zum Zeitpunkt der Erstellung des Materials 93 Berichte aus 14 Projekten oder Projektfamilien eine dokumentierte Anerkennung oder Annahme durch die Maintainer. Einer der über die Akrites-Initiative der Linux Foundation eingereichten Linux-Berichte war außerdem der erste Bericht der Initiative, der mit der Aufnahme eines Patches in den Linux-Kernel endete.
Von maximaler Leistungsfähigkeit zum Betrieb in großem Maßstab
Die erste Lehre lautet, dass der Erfolg eines Modells beim Finden eines komplexen Fehlers nicht garantiert, dass es in vergleichbarem Tempo Fehlerbehebungen hervorbringt. Eine größere Zahl von Prüfern kann die Zahl der Kandidaten erhöhen, steigert aber nicht zwangsläufig die Zahl der bestätigten Ergebnisse oder veröffentlichten Korrekturen. Wenn Berichte schneller eingehen, als das Microsoft Security Response Center sie prüfen kann, wächst eine Warteschlange, die Zeit von Experten bindet, insbesondere wenn sich Berichte wiederholen oder reproduzierbare Belege fehlen.
Deshalb konzentriert sich FORGE auf ein reproduzierbares Ergebnis und nicht allein auf die Zahl der Scans oder Berichte. Das Labor nutzt die multimodale Plattform MDASH zur Organisation der Arbeit sowie Exploit- oder Proof-of-Concept-Generatoren, den Aufbau von Testwerkzeugen und die Suche nach Eingaben, die das fehlerhafte Verhalten auslösen. Microsoft zufolge reduzierte ein internes Projekt, das deterministische Algorithmen wie die Analyse abstrakter Syntaxbäume einsetzte, die Zahl doppelter Berichte bei mehreren Scans desselben Codes um etwa 45 %.
Ausgaben zur Beseitigung von Unsicherheit statt zur Erzeugung von mehr Text
Microsoft ist der Ansicht, dass die Effizienz allein anhand der Zahl der vom Modell erzeugten Token zu messen, zu einem irreführenden Maßstab führt. Ein kurzer Bericht kann unklar und in der Untersuchung kostspielig sein, während eine längere Analyse den Ausführungspfad begründet und die Gesamtkosten senkt. Praktisch geht es darum, festzustellen, was dem Ermittler fehlt: der Aufrufer der Funktion, die Build-Konfiguration, der ausführbare Reproduzierer oder die kausale Erklärung. Anschließend wird der nächste Schritt gezielt darauf ausgerichtet, genau diese Lücke zu schließen.
MDASH kombiniert fortgeschrittene und destillierte Modelle mit spezialisierten Prüfern und Werkzeugen zur Codeanalyse. Routineaufgaben können dabei kostengünstigeren Modellen zugewiesen werden, während ungelöste Fragen an leistungsfähigere Modelle eskaliert werden. Microsoft betont jedoch, dass diese Strategie noch eine zu messende Hypothese ist, da eine frühzeitige Filterung echte Schwachstellen ausschließen könnte.
Validierung und Behebung als kontinuierliche Lernschleife
Dieser Darstellung zufolge sollten Validierung und Behebung nicht als nachgelagerte Phase der Schwachstellenentdeckung behandelt werden. Jedes Ergebnis sollte die automatisierte Validierung, die menschliche Prüfung, die Entwicklung einer Korrektur und Regressionstests durchlaufen, wobei die Belege aus jeder Phase wieder in das System einfließen. Selbst ein Fehlschlag bei der Validierung kann nützlich sein, wenn der Grund dafür erfasst wird, etwa dass der Pfad nicht erreichbar ist, eine falsche Build-Konfiguration vorliegt, der Angreifer keine Kontrolle über die Eingaben hat oder der Bericht doppelt vorliegt.
In einem Experiment mit dem Linux-Kernel erzeugten Validierungsagenten unterstützende Belege für 627 Ergebnisse. Die durchschnittlichen Kosten für die Erstellung eines Proof of Concept für 182 bestätigte Abstürze betrugen 3,61 US-Dollar an Modellkosten und 21,5 Minuten pro erfolgreichem Fall. In sechs Fällen, in denen die Möglichkeit einer lokalen Rechteausweitung durch die automatisierte Exploit-Generierung geprüft wurde, lagen die Durchschnittswerte bei 8,56 US-Dollar und 25,4 Minuten. Für die Bewertungen wurde GPT-5.5 verwendet; die Kosten des ersten Scans, fehlgeschlagene Fälle sowie die menschliche Untersuchung und die Erstellung von Korrekturen waren nicht enthalten.
Was bedeutet das für Sicherheitsteams?
Die wichtigste Erkenntnis aus diesen Ergebnissen ist, dass der Erfolgsmaßstab für agentische Systeme zur Schwachstellenentdeckung nicht bei der Zahl der Ergebnisse stehen bleiben sollte. Microsoft schlägt vor, die Zahl der bestätigten Fehler, doppelten und abgelehnten Berichte, das Alter der Warteschlange sowie die Zeit zwischen Entdeckung und Behebung zu verfolgen, zusätzlich zu den Modellkosten und der Zeit für die menschliche Prüfung. Die Arbeit an Open-Source-Projekten erfordert außerdem, die Offenlegungs-, Prüfungs- und Behebungsprozesse jedes Projekts zu respektieren, statt lediglich mehr Berichte zu senden.
Praktisch beschreibt die Quelle eine Verschiebung des Engpasses: Die Fähigkeit, einen Fehler zu finden, ist zu einem Teil des Problems geworden, während die Verknüpfung der Forschung mit Build-Umgebungen, Binärdateien, Konfigurationen, Testwerkzeugen und CI/CD-Systemen immer wichtiger wird. Die Grenzen der Ergebnisse bleiben klar: Die Angaben zu den Validierungskosten schließen wichtige menschliche Phasen aus, und die Umwandlung von Forschungsergebnissen in eine akzeptierte Korrektur hängt von den Maintainer und dem Kontext jedes Projekts ab. Daher belegt das Material nicht, dass Automatisierung die technische Prüfung ersetzt, sondern stellt sie als Mittel zur Verringerung wiederkehrender Arbeit dar, während die Verantwortung für sicherheitsbezogene Entscheidungen und die Behebung beim Menschen bleibt.