Microsoft hat das Modell Microsoft-Decision-1 innerhalb der Foundry-Plattform herausgebracht, nur drei Tage nachdem OpenAI die Decisions API für Entwickler in einer öffentlichen Vorschau verfügbar gemacht hatte. Anders als die Nähe zwischen den beiden Unternehmen vermuten lassen könnte, wurde das Microsoft-Modell zunächst auf Qwen3.5-9B von Alibaba trainiert. Das Unternehmen kündigte an, es später auf eigenen MAI-Modellen sowie auf OpenAI-Modellen neu aufzubauen.
Das Modell soll bestehenden Anwendungen, Agenten und Workflows Entscheidungsfähigkeiten hinzufügen, etwa zur Bewertung von Ausgaben, zur Auswahl des passenden Modells oder zur Bestimmung des nächsten Schritts in einem automatisierten Prozess. Microsoft stellt es innerhalb von Foundry zu einem Preis von 0,042 US-Dollar pro einer Million Eingabetoken bereit, während Ausgabetoken kostenlos sind. Dies entspricht dem Preis, den TypeSafe für das Modell Jev verlangt.
Interne Tests von Microsoft
Microsoft zufolge ist das Unternehmen selbst der erste Nutzer des Modells. Xbox Research testete es, um mehr als 10.000 Elemente aus Spielernotizen zu ordnen. Das Copilot-Team nutzte es zur Bewertung von Gesprächen und Agentenantworten, während Bereitschaftsingenieure damit während laufender Vorfälle Kontext extrahierten. Microsoft Discovery setzte es außerdem ein, um Experimente zu bewerten, bevor ein Agent seine Aufgabe neu plante.
Nach Angaben des Unternehmens war Decision-1 in einem Xbox-bezogenen Test mehr als 14-mal schneller als GPT-6 Sol und erzielte in einem Discovery-Test eine 46-mal höhere Konsistenz. Der Beitrag erläutert die Methodik dieser Vergleiche nicht im Detail. Daher können die Zahlen nicht als allgemeines Urteil über die Leistung des Modells außerhalb dieser Szenarien betrachtet werden.
Warum ist diese Nachricht wichtig?
Entscheidungsmodelle entwickeln sich zu einer kostengünstigen Kontrollschicht zwischen der Anwendung und größeren generativen Modellen. Diese Schicht wird wichtig, wenn ein Agent häufig ein Modell, ein Tool oder einen Ausführungspfad auswählen muss, da sich die Kosten jeder einzelnen Entscheidung zusammen mit den begleitenden generativen Anfragen summieren können.
Microsoft hat einen zusätzlichen Anreiz, diese Art von Modellen intern zu entwickeln, insbesondere angesichts der Pläne von GitHub Copilot, zu entscheiden, ob bestimmte Aufgaben auf dem Gerät ausgeführt oder an Cloud-Modelle gesendet werden sollen. Das Unternehmen hat jedoch nicht bestätigt, ob Decision-1 tatsächlich an Copilot-Entscheidungen beteiligt sein wird, und auch nicht offengelegt, was an die Cloud gesendet wird.
Kompatibilitäts- und Medienbeschränkungen
Die Foundry-Liste zeigt, dass Decision-1 bis zu 32.768 Texttoken entgegennimmt und Ergebnisse im JSON-Format zurückgibt, Bilder jedoch nicht unterstützt. Damit liegt das Modell in einem engeren Bereich als die Decisions API von OpenAI und Clef von Cloudflare, das einen visuellen Tokenizer verwendet.
Microsoft hat außerdem keine Verfügbarkeit der Modellgewichte angekündigt, während Cloudflare das Clef-Modell unter der Apache-2.0-Lizenz veröffentlicht hat. AWS, Upstage und Ollama haben die TypeSafe-Schnittstelle namens System One als gemeinsame Schnittstelle in diesem Bereich übernommen. Microsoft hat jedoch nicht bestätigt, dass Decision-1 vollständig mit ihr kompatibel ist, obwohl das Codebeispiel des Unternehmens in Foundry einen Endpunkt namens /systemone aufruft.
Vertrauen bedeutet keine Widerstandsfähigkeit gegen Täuschung
Microsoft zufolge sind die Wahrscheinlichkeiten des Modells kalibriert. Das bedeutet, dass eine Vorhersage mit einer Wahrscheinlichkeit von 90 % in repräsentativen Fällen in etwa neun von zehn Fällen richtig sein sollte. Das Unternehmen empfiehlt Kunden jedoch, die Kalibrierung anhand eigener Daten zu überprüfen.
Eine Studie von JevOut zeigt, warum dieser Vorbehalt wichtig ist: Kurze und natürlich formulierte Zusätze führten dazu, dass das Jev-Modell 312 von ursprünglich 508 richtigen Entscheidungen umkehrte. In 229 Fällen gab das Modell der falschen Antwort eine Wahrscheinlichkeit von mindestens 70 %. Der Test von Microsoft für sein eigenes Modell umfasste dagegen acht Arten von Änderungen, etwa die Umordnung von Optionen und die Umformulierung der Beschreibung, und veränderte im Durchschnitt 1,3 % der Antworten. Die JevOut-Studie testete Decision-1 jedoch nicht. Daher belegt dieses Ergebnis nicht, wie das Modell mit Eingaben umgehen würde, die gezielt zur Täuschung entwickelt wurden.