Anthropic und OpenAI haben neue Modelle für den professionellen Einsatz auf den Markt gebracht, die eine bessere Leistung mit niedrigeren Betriebskosten verbinden. Dies geschieht zu einer Zeit, in der die wirtschaftliche Effizienz und die Zuverlässigkeit von Modellen bei der Programmierung und bei Unternehmensaufgaben zunehmend an Bedeutung gewinnen, während die Debatte über die Sicherheit fortgeschrittener Modelle anhält.
Opus 5.5 konzentriert sich auf komplexe Aufgaben
Anthropic stellte das Modell Opus 5.5 vor, das nach Angaben des Unternehmens den Umgang mit komplexen Aufgaben, die Erkennung und Behebung von Softwarefehlern, die Analyse von Finanzdaten und die Ausführung geschäftlicher Aufgaben verbessert. Unternehmenstests zufolge übertrifft das Modell GPT-6 Astra bei agentischen Programmieraufgaben in den Tests Terminal-Bench 4.0 und FrontierCode v1.1 (Main).
Anthropic zufolge erzeugt das Modell klarere Texte und versucht 85 % seltener als frühere Modelle, Grenzen und Vorgaben zu umgehen. Außerdem senkte das Unternehmen den Preis für eine Million Eingabetoken auf 4 Dollar und für eine Million Ausgabetoken auf 20 Dollar, verglichen mit 5 Dollar beziehungsweise 25 Dollar beim Modell Opus 5.
Drei unterschiedliche Kostenstufen bei OpenAI
OpenAI brachte die Modelle GPT-6 Sol und GPT-6 Luna auf den Markt, mit Verbesserungen bei professioneller Arbeit, Programmierung und Computernutzung. Nach Angaben des Unternehmens liegen die Kosten der beiden Modelle um bis zu 50 % unter den Aktionspreisen der GPT-5.6-Modelle.
Eine Million Eingabetoken in GPT-6 Sol kostet 2 Dollar, während für die Ausgabe 10 Dollar berechnet werden. Bei GPT-6 Luna kosten eine Million Eingabetoken 10 Cent und eine Million Ausgabetoken 50 Cent. OpenAI zufolge macht GPT-6 Sol etwa halb so viele Fehler wie das Vorgängermodell und erreicht bei der Programmierung ein Leistungsniveau, das Fable 5.1 entspricht, und zwar zu geringeren Kosten.
Zu den Verbesserungen gehören außerdem eine klarere Kommunikation und die Unterstützung der Zwischenspeicherung des Befehls-Kontexts. Dadurch kann mehr Kontext wiederverwendet und die Reaktionsgeschwindigkeit erhöht werden.
Was ändert sich praktisch?
Die neuen Preise geben Entwicklern und Unternehmen mehr Spielraum, Modelle für wiederkehrende oder aufrufintensive Aufgaben einzusetzen, während die leistungsfähigeren Modelle auf Programmier-, Analyse- und agentische Ausführungsaufgaben abzielen. Die Angaben zu Überlegenheit, Genauigkeit und Sicherheit stammen jedoch aus Tests der Unternehmen selbst und belegen daher allein keine allgemeine Überlegenheit bei allen Anwendungen oder in allen Umgebungen.
Verbesserungen bei Sicherheit und Verfügbarkeit
OpenAI zufolge neigen die GPT-6-Modelle weniger dazu, falsche Informationen über die Ergebnisse von Programmieraufgaben bereitzustellen, und lehnen Versuche häufiger ab, Schutzmaßnahmen durch unsichere Befehle zu umgehen. Beide Unternehmen arbeiten an Vorschlägen für Standards, die externe Bewertungsstellen zur Messung der Entwicklung und Sicherheit von Modellen verwenden können. Es ist jedoch noch unklar, ob diese Vorschläge zu einem einheitlichen Standard werden.
Opus 5.5 ist über Claude sowie über Amazon Web Services, Google Cloud und Microsoft Azure verfügbar. GPT-6 Sol und GPT-6 Luna sind über ChatGPT Work und Codex für Kunden der Tarife Plus, Pro, Business und Enterprise verfügbar, während Nutzer des kostenlosen Tarifs und Go-Abonnenten GPT-6 Luna ausschließlich über die Desktop-Anwendung des Unternehmens erhalten.