Anthropic, Claude 5.5 ailesinin ilk sürümü olarak Claude Opus 5.5 modelini piyasaya sürdü ve modelin çoğu görevde Claude Fable 5.1'e yaklaştığını, Opus 5'e kıyasla işletim maliyetinin ise %40 daha düşük olduğunu belirtti. Model şu anda Claude Platform'un yanı sıra Amazon Web Services, Google Cloud ve Microsoft Azure üzerinden de kullanılabiliyor.
Programlama ve bilişsel çalışmada sıçrama
Anthropic, yeni modeli aracı programlama, bilgisayar kullanımı ve bilişsel çalışma görevlerinde modellerinin en üstüne yerleştiriyor. Şirketin testlerine göre Opus 5.5, 680 bin satırlık bir kod tabanının taşınmasını bir günden kısa sürede gerçekleştirdi. Buna karşılık 200 bin satırlık bir kod tabanının denetlenmesi ve düzeltilmesi üç saatten kısa sürdü; Opus 5 modeli için bu süre 20 saatten fazlaydı.
C dilindeki HAProxy programının Rust diline çevrildiği bir testte, iki model de projeye özgü regresyon testlerinin çoğunu geçti. Ancak Opus 5.5 görevi Claude Fable 5.1'in 12 saatine karşılık 9,5 saatte tamamladı ve maliyet %51 daha düşük oldu. Anthropic ayrıca modelin bir web uygulamasının sayfa yükleme sürelerini 40 denemenin 39'unda iyileştirmeyi başardığını söyledi.
Şirket, Opus 5.5'in programlama ve ticari çalışmaya ilişkin çeşitli testlerde üstün geldiğini, ancak standart ölçütlerde gelişmiş modeller arasındaki farkların gerçek kullanımdaki pratik farklılıkları daha az yansıtmaya başladığı konusunda uyarıyor. En belirgin avantajın ekonomik verimlilik olduğu değerlendiriliyor; model, daha düşük token fiyatının yanı sıra her görev için daha az sayıda token kullanıyor.
Fiyatlandırma ve hız
Bir milyon giriş tokenının maliyeti 4 dolar, bir milyon çıkış tokenının maliyeti 20 dolar. Önbellek belleği okumanın maliyeti 0,20 dolar, önbellek belleği yazmanın maliyeti ise 5 dolar. Opus 5 ile karşılaştırıldığında bu fiyatlar, giriş ve çıkış için %20, önbellek belleği okuma için %60 düşüş anlamına geliyor. Opus 5.5 ayrıca çıktıları Opus 5'e kıyasla %30'dan fazla daha yüksek hızla üretiyor.
Fast mode, Claude Code ve Claude Platform'da 2,5 kata varan hızla, bir milyon giriş tokenı başına 8 dolar ve bir milyon çıkış tokenı başına 40 dolar fiyatla sunuluyor. Anthropic ayrıca koltuk tabanlı Pro, Max, Team ve Enterprise planlarında beş saatlik kullanım sınırlarını yükseltti ve aboneleri için hız sınırı sıfırlamasının kaydedilmesi özelliğini ekledi.
Güvenlik ve işletimsel kısıtlamalar
Anthropic, Opus 5.5'in yaklaşık iki bin senaryoyu kapsayan otomatik davranış testinde şirketin bir modeli için elde edilen en iyi sonuçlara ulaştığını ve geri alınması zor eylemlerde bulunmaya ya da kendisi için belirlenen sınırları aşmaya daha az eğilim gösterdiğini belirtiyor. Model ayrıca Opus 5'e kıyasla komut enjeksiyonu saldırılarına daha dirençliydi ve yeni bir testte kapsama sınırlarını aşmaya Opus 5 ve Claude Mythos 5.1'e kıyasla yaklaşık %85 daha düşük oranda çalıştı.
Bununla birlikte şirket, uyum testlerinin lansmandan önceki tüm olası başarısızlıkları yakalayamadığını ve modelin bazen değerlendirmeye tabi tutulduğunu anlayabildiğini kabul ediyor. Bu nedenle Opus 5.5, siber güvenlik ve biyoloji alanlarında Claude Fable 5.1 ile kullanılanlara benzer kontrollerle sunuluyor. Siber güvenlik görevlerinin çoğu Opus 4.8'e yönlendirilecek. Doğrulamayı geçen kuruluşlar ise Life Sciences Verification Program'a başvurabilecek; Cyber Verification Program daha sonra genişletilecek.
Pratikte ne değişiyor?
Lansmanın pratik önemi yalnızca test sonuçlarının yükselmesiyle sınırlı değil; işletim maliyetinin düşmesi ve adım ve token sayısının azalması, yazılım ajanlarının uzun süre çalıştırılmasının uygulanabilirliğini doğrudan etkileyebilir. Öte yandan performanstaki iyileşme, özellikle programlama, araştırma ve finansal analiz alanlarında bağımsız görevlerin artık incelemeye ihtiyaç duymadığı anlamına gelmiyor. Kritik ve güvenlik amaçlı kullanımlara getirilen kısıtlamalar da daha yüksek kapasitelere erişimin risk düzeyi ve kullanıcı kurumun niteliğiyle bağlantılı kalacağını gösteriyor.
Model, sıfır veri saklama özelliğiyle sunuluyor ve Avrupa Yapay Zekâ Yasası'yla bağlantılı filigranlama prosedürlerini destekliyor; buna karşılık düşünme modunun devre dışı bırakıldığı seçenek artık sunulmuyor. Anthropic, önümüzdeki haftalarda Claude Sonnet 5.5 ve Claude Haiku 5.5'i piyasaya sürmeyi planlıyor; bu modellerde de performans, verimlilik ve güvenlik alanlarında benzer iyileştirmeler bulunacak.