OpenAI hat GPT-6.1 Sol angekündigt, eine weiterentwickelte Version von GPT-6 Sol, die auf Aufgaben mit einer Kombination aus hoher Leistung und niedrigen Betriebskosten abzielt. Nach Angaben des Unternehmens nähert sich das Modell GPT-6 Astra bei Programmierung, Computernutzung, Dokumentenanalyse und professionellen mehrstufigen Workflows an, während seine Standardpreise etwa ein Fünftel der Astra-Preise betragen.
Für den großflächigen Einsatz entwickelte Preisgestaltung
Die Nutzung der GPT-6.1-Sol-API kostet 2 US-Dollar pro einer Million Eingabetoken und 10 US-Dollar pro einer Million Ausgabetoken. Zwischengespeicherte Token kosten 0,10 US-Dollar pro einer Million Token, was laut OpenAI einem Rabatt von 95 % gegenüber dem Standardpreis für Eingaben entspricht. Dadurch eignet sich das Modell besonders für agentische Anwendungen, die denselben Kontext über wiederholte Anfragen hinweg erneut verwenden.
Ergebnisse der Praxistests
Im Test DeepSWE v1.1, der umfangreiche Softwareentwicklungsaufgaben anhand echter Codebasen misst, erzielte GPT-6.1 Sol dasselbe Ergebnis wie GPT-6 Astra, jedoch zu Kosten von ungefähr einem Fünftel. Im Test GDP.pdf zur Analyse professioneller Dokumente näherte sich seine Leistung der von Astra bei Aufgaben mit Tabellen, Grafiken und PDF-Dateien aus Bereichen wie Finanzen, Gesundheit und Recht an.
Im Test AutomationBench für mehrstufige Workflows übertraf das Modell auf der mittleren Reasoning-Stufe Opus 5.5 um 2,2 Punkte und GPT-6 Sol um 4,8 Punkte. Im Test OSWorld 2.0 zur Computernutzung lag es 2,1 Punkte hinter Astra, wobei die Kosten pro Aufgabe ungefähr ein Siebtel der Astra-Kosten und weniger als die Hälfte der Kosten von GPT-6 Sol in der genannten Konfiguration betrugen.
Bei Terminal-Bench Science 0.1, das Datenanalyse, Simulationen und das Beweisen von Theoremen misst, beliefen sich die durchschnittlichen Kosten pro Aufgabe auf 5,47 US-Dollar, gegenüber 23,21 US-Dollar für Opus 5.5 und 23,80 US-Dollar für GPT-6 Astra. Dennoch erzielte Astra im Test weiterhin die höchste Leistung mit einem Ergebnis von 68,1 %.
Genauigkeit und Sicherheitsbeschränkungen
GPT-6.1 Sol senkte die Rate faktischer Fehler auf 4,1 %, verglichen mit 4,5 % bei GPT-6 Sol und 4 % bei GPT-6 Astra auf der höchsten Reasoning-Stufe. OpenAI weist darauf hin, dass diese Bewertung auf schwierigen Eingabeaufforderungen beruht, bei denen eine hohe Wahrscheinlichkeit für Fehler besteht, und nicht die gewöhnliche Nutzung von ChatGPT abbildet.
Das Unternehmen erklärt außerdem, dass das Modell besser darin geworden sei, Nutzer über nicht funktionierende Tools zu informieren, unzulässige Ergebnisse zu vermeiden und explizite Einschränkungen einzuhalten. Zudem erklärte OpenAI, dass es wie GPT-6 Astra und GPT-6 Sol nicht versucht habe, die automatisierte Sicherheitskontrolle zu umgehen. Die Quelle liefert jedoch keine unabhängigen Einzelheiten zur Methodik, mit der diese Behauptungen überprüft wurden.
Was ändert sich in der Praxis?
OpenAI positioniert GPT-6.1 Sol als Option für Anwendungen mit hohem Volumen, bei denen die Senkung der Tokenkosten wichtiger sein kann als das Erreichen des bestmöglichen Ergebnisses in jedem einzelnen Test. Das ist für Entwickler von Softwareagenten sowie für Dienste zur Dokumentenanalyse und Automatisierung relevant. Der Leistungsunterschied hängt jedoch weiterhin von der Aufgabenart und der Reasoning-Stufe ab, weshalb die geringeren Kosten keinen umfassenden Ersatz für Astra bedeuten.
Das Modell ist für Abonnenten von Plus, Pro, Business, Enterprise und Edu über ChatGPT Work und Codex verfügbar. Entwickler können es außerdem in der OpenAI API unter dem Namen gpt-6.1-sol verwenden. In der standardmäßigen ChatGPT-Oberfläche wurde es noch nicht veröffentlicht. OpenAI kündigte außerdem GPT-6.1 Sol Ultrafast und GPT-6 Astra Ultrafast an und behauptete eine bis zu achtfache Geschwindigkeit gegenüber Astra. GPT-6.1 Astra, dessen Veröffentlichung in dieser Woche erwartet worden war, wurde dagegen noch nicht herausgebracht, während Berichte über Sicherheitsbedenken in internen Tests kursieren.