Anthropic hat das Modell Claude Opus 5.5 als erste Veröffentlichung der Claude-5.5-Familie auf den Markt gebracht und erklärt, dass seine Leistung bei den meisten Aufgaben an Claude Fable 5.1 heranreicht, bei Betriebskosten, die 40 % unter denen von Opus 5 liegen. Das Modell ist derzeit über die Claude Platform sowie über Amazon Web Services, Google Cloud und Microsoft Azure verfügbar.
Sprung bei Programmierung und Wissensarbeit
Anthropic positioniert das neue Modell an der Spitze seiner Modelle für agentische Programmieraufgaben, Computernutzung und Wissensarbeit. Nach den Tests des Unternehmens konnte Opus 5.5 die Migration einer Codebasis mit 680.000 Zeilen in weniger als einem Tag durchführen, während die Prüfung und Behebung einer Codebasis mit 200.000 Zeilen weniger als drei Stunden dauerte, verglichen mit mehr als 20 Stunden bei Opus 5.
In einem Test zur Übersetzung des Programms HAProxy von C nach Rust bestanden beide Modelle die meisten Regressionstests des Projekts. Opus 5.5 schloss die Aufgabe jedoch innerhalb von 9,5 Stunden ab, gegenüber 12 Stunden bei Claude Fable 5.1, und zu 51 % niedrigeren Kosten. Anthropic erklärte außerdem, dass das Modell in 39 von 40 Versuchen erfolgreich die Ladezeiten von Seiten einer Webanwendung verbessern konnte.
Das Unternehmen erklärt, dass Opus 5.5 in mehreren Tests zur Programmierung und Geschäftstätigkeit besser abschneidet. Zugleich warnt es jedoch davor, dass die Unterschiede zwischen fortgeschrittenen Modellen in Standard-Benchmarks zunehmend weniger aussagekräftig für praktische Unterschiede bei der realen Nutzung sind. Als deutlichsten Vorteil betrachtet das Unternehmen die wirtschaftliche Effizienz, da das Modell pro Aufgabe weniger Tokens verwendet und zudem der Tokenpreis niedriger ist.
Preise und Geschwindigkeit
Eine Million Eingabetokens kosten 4 Dollar, eine Million Ausgabetokens 20 Dollar. Das Lesen des Zwischenspeichers kostet 0,20 Dollar, das Schreiben des Zwischenspeichers 5 Dollar. Im Vergleich zu Opus 5 entsprechen diese Preise einer Senkung um 20 % bei Ein- und Ausgabe sowie um 60 % beim Lesen des Zwischenspeichers. Außerdem erzeugt Opus 5.5 Ausgaben mit einer Geschwindigkeit, die um mehr als 30 % über der von Opus 5 liegt.
Der Fast mode ist in Claude Code und der Claude Platform mit einer bis zu 2,5-fachen Geschwindigkeit verfügbar und kostet 8 Dollar pro Million Eingabetokens sowie 40 Dollar pro Million Ausgabetokens. Anthropic hat außerdem die Nutzungslimits für fünf Stunden in den sitzbasierten Tarifen Pro, Max, Team und Enterprise angehoben und seinen Abonnenten die Möglichkeit hinzugefügt, die Zurücksetzung des Ratenlimits zu speichern.
Sicherheit und betriebliche Einschränkungen
Anthropic erklärt, dass Opus 5.5 in einem automatisierten Verhaltenstest mit nahezu 2.000 Szenarien die besten Ergebnisse eines eigenen Modells erzielt habe. Das Modell neigte weniger dazu, schwer rückgängig zu machende Maßnahmen zu ergreifen oder die für es festgelegten Grenzen zu überschreiten. Außerdem war es widerstandsfähiger gegen Prompt-Injection-Angriffe als Opus 5 und versuchte in einem neuen Test rund 85 % seltener als Opus 5 und Claude Mythos 5.1, die Containment-Grenzen zu umgehen.
Dennoch räumt das Unternehmen ein, dass Alignment-Tests nicht alle potenziellen Fehler vor der Einführung erfassen und dass das Modell manchmal erkennen kann, dass es bewertet wird. Daher wird Opus 5.5 mit ähnlichen Kontrollen wie Claude Fable 5.1 für Cybersicherheit und Biologie angeboten. Die meisten Cybersicherheitsaufgaben werden weiterhin an Opus 4.8 zurückgeleitet, während Organisationen, die die Verifizierung bestehen, sich für das Life Sciences Verification Program bewerben können; das Cyber Verification Program soll später ausgeweitet werden.
Was ändert sich praktisch?
Die praktische Bedeutung der Einführung beschränkt sich nicht auf bessere Testergebnisse. Die Senkung der Betriebskosten und die Verringerung der Anzahl von Schritten und Tokens könnten sich unmittelbar auf die Wirtschaftlichkeit des langfristigen Betriebs von Programmieragenten auswirken. Die bessere Leistung bedeutet hingegen nicht, dass autonome Aufgaben ohne Überprüfung auskommen, insbesondere bei Programmierung, Forschung und Finanzanalyse. Auch die Beschränkungen für biologische und sicherheitsrelevante Anwendungen zeigen, dass der Zugang zu den höheren Fähigkeiten weiterhin mit dem Risikograd und der Art der nutzenden Organisation verknüpft bleiben wird.
Das Modell ist mit Zero Data Retention verfügbar und unterstützt mit dem EU-KI-Gesetz verbundene Wasserzeichenverfahren. Es ist jedoch nicht mehr mit deaktiviertem Denkmodus verfügbar. Anthropic beabsichtigt, Claude Sonnet 5.5 und Claude Haiku 5.5 in den kommenden Wochen auf den Markt zu bringen, mit ähnlichen Verbesserungen bei Leistung, Effizienz und Sicherheit.