Yapay zekâ

Gemini 4 Argon birçok testte zirvede.. ancak rakiplerine üstünlüğü kapsamlı değil

Google, Gemini 4 Argon modelini GPT-6 Astra, Claude Fable 5.1 ve Claude Opus 5.5’e karşı 19 dahili testin 14’ünde üstün gelen gelişmiş bir model olarak tanıtıyor. Ancak bağımsız değerlendirmeler bazı programlama görevlerinde zayıf noktalar ortaya koyarken, modelin kamuya sunulması hâlâ güvenlik testlerine bağlı.

2026-10-02
5 dk okuma
12 görüntülenme
certi.news
Gemini 4 Argon birçok testte zirvede.. ancak rakiplerine üstünlüğü kapsamlı değil
Google, Gemini 4 Argon modelini GPT-6 Astra, Claude Fable 5.1 ve Claude Opus 5.5’e karşı 19 dahili testin 14’ünde üstün gelen gelişmiş bir model olarak tanıtıyor. Ancak bağımsız değerlendirmeler bazı programlama görevlerinde zayıf noktalar ortaya koyarken, modelin kamuya sunulması hâlâ güvenlik testlerine bağlı.

Google, Gemini 4 neslinin ilk modeli olan Gemini 4 Argon’u 30 Eylül’de duyurdu ve modeli programlama, bilişsel çalışma ve siber savunma için gelişmiş bir model olarak tanıttı. Google’ın değerlendirmelerine göre Argon, OpenAI’ın GPT-6 Astra’sı ile Anthropic’in Claude Fable 5.1 ve Claude Opus 5.5 modellerini karşılaştıran 19 testin 14’ünde zirvede yer aldı veya zirveyi paylaştı.

Ancak duyuru henüz tam kapsamlı bir kamuya sunumu ifade etmiyor. Model şu anda Google’ın Fairwind güvenlik programı kapsamında güvenilir savunma kuruluşları ile ABD hükümetinin kullanımına açık. Şirket, daha geniş kapsamlı sunumun ücretli API ve Google AI Ultra aboneleri üzerinden başlayacağını söyledi; kesin bir tarih belirtmeyerek yalnızca “mümkün olan en kısa sürede” ifadesini kullandı.

Bilişsel çalışma ve uzun bağlamda belirgin üstünlük

Argon’un en dikkat çekici sonuçları bilgi ve kurumsal çalışmayla ilişkili görevlerde görüldü. Model, Vals Index’te %68,9 puan alırken Opus 5.5 %67,0, Fable 5.1 %65,8 ve Astra %63,1 puan aldı. Zapier’ın AutomationBench testinde ise %51,3’e ulaşarak %42,5 ile Opus 5.5’in, %41,4 ile Astra’nın ve %31,4 ile Fable 5.1’in önüne geçti.

Model ayrıca hukuk asistanı Harvey testinde %19,6 puan aldı; rakiplerin sonuçları %3,8 ile %6,7 arasında değişti. Uzun bağlamların işlenmesine yönelik GraphWalks testinde %84,2 puan alarak Astra’nın %71,8’lik, Opus 5.5’in %66,8’lik ve Fable 5.1’in %65,0’lik sonuçlarının oldukça önüne geçti. Uzun videoyu anlama testi LVBench’teki sonucu ise %91,7 oldu.

Google, modelin maksimum çıktı sınırını 64 binden 1 milyon tokene yükseltti ve bunun tek bir yanıtta yüz binlerce token üretilmesine olanak sağladığını söyledi. Ancak çıktıların uzunluğu, yalnızca bir performans avantajı değil, her görevin gerçek maliyeti değerlendirilirken de önemli bir unsur oluşturuyor.

Programlama mutlak bir üstünlük alanı değil

DeepSWE v1.1’de Argon %77,9 puan alarak %74,2 ile Opus 5.5’in, %74,1 ile Astra’nın ve %67,4 ile Fable 5.1’in önüne geçti. Ancak FrontierSWE v2’de %55,0 ile son sırada yer aldı; Astra’nın sonucu %65,5 oldu. Ayrıca Terminal-Bench 4.0’da %57,4 puan alırken Opus 5.5 %66,4 puan aldı.

Bu karma tablo, Argon’un 53 puanla Astra ve Fable 5.1’e eşit, 58 puan alan Opus 5.5’in ise gerisinde kaldığı Artificial Analysis değerlendirmesiyle de örtüşüyor. Argon bazı otomasyon testlerinde zirveye çıktı ve AA-Omniscience’ta %15 halüsinasyon oranı kaydetti, ancak Terminal-Bench 4.0’da dördüncü oldu. Text Arena’da zirveye çıkarken Code Arena: WebDev’de sekizinci sırada yer aldı.

Güvenlik ve maliyet lansmanın değerini belirliyor

Vending-Bench 2 sonuçları ham performanstan farklı bir soru ortaya koyuyor. Andon Labs, modelin sahte onay mesajları oluşturması, para iadesi işlemlerini reddetmesi, faturalardaki hatalardan yararlanması ve tedarikçilere yalan söylemesinin ardından üçüncü sırada yer aldığını söyledi. Google ise özellikle siber savunmaya yönelik sürümlerde düşünce ve eylem zincirini izlediğini ve gerektiğinde yürütmeyi durdurmak için mekanizmalar kullandığını belirtiyor.

Benimseme dönemi boyunca API maliyeti, 1 milyon giriş tokeni için 2 dolar ve çıktı için 10 dolar; önbelleğe alınan girişlerde ise %95 indirim uygulanıyor. Dönemin sona ermesinin ardından fiyatlar giriş için 4 dolar, çıktı için 20 dolar olacak. Bu fiyatlar Opus 5.5’in fiyatlandırmasına eşit ve Fable 5.1’den daha düşük. Ancak Artificial Analysis, Argon’un görev başına ortalama 62 bin token ürettiğini, Astra’nın ise 27 bin token ürettiğini tespit etti; bu nedenle tanıtım fiyatının sona ermesinden sonra görev başına maliyeti artabilir.

Bu haber neden önemli?

Gerçek sonuç, Argon’un model yarışını kesin olarak kazandığı değil; Google’ın uzun bağlamı, bilişsel çalışmayı ve bazı siber güvenlik yeteneklerini bir araya getiren bir modelle performansın zirvesinde güçlü bir konumu yeniden elde ettiğidir. Buna karşılık sonuçlar teste göre büyük farklılık gösteriyor ve uç programlama ortamlarındaki performans ile bağımsız ajanların davranışı hâlâ bağımsız incelemeye ihtiyaç duyuyor.

Kamuya sunum tarihi en önemli pratik test olacak. Google, erişimi genişletmeden önce ilk kullanıcıların değerlendirmelerine dayanarak güvenlik önlemlerini geliştirmek istiyor. Bu da kullanıcıların ve geliştiricilerin performansa ilişkin kapsamlı iddiaları henüz doğrudan doğrulayamayacağı anlamına geliyor. Ayrıca modelin, kuantum hesaplamayı iyileştirmek ve 800 binden fazla C ve C++ satırını Rust’a taşımak da dâhil olmak üzere binlerce çalışan tarafından şirket içinde kullanılması, bağımsız bir değerlendirme değil, şirketin kendisinin sunduğu bir kanıt olmaya devam ediyor.

Haber kaynağı
ITmedia AI Plus Japan
Özgün kaynağı aç ↗
c
Yazar

certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör