JetBrains, 30 Ağustos 2026'da Junie programlama ajanı içinde kullanılan büyük dil modellerinin değerlendirme metodolojisine ilişkin bir analiz yayımlayarak, tek bir gösterge olan “çözüm oranına” (resolve rate) bağımlılığın aşılması çağrısında bulundu. Şirket, ajanın görev testlerini geçip geçmediğini bilmenin önemli olduğunu, ancak bunun tek başına ajanın sonuca nasıl ulaştığını, bunun ne kadara mal olduğunu ve yazılım yamasının sınırlı ve bakımı yapılabilir olup olmadığını ortaya koymadığını belirtiyor.
Bu fikir, JetBrains'in kendi ölçütü üzerinde Claude Opus 4.7 ile Gemini 3.5 Flash arasında yaptığı karşılaştırmaya dayanıyor. İki model de aynı sayıda görevi çözdü, ancak Opus ortalama 184 adıma ihtiyaç duydu ve çalıştırma maliyeti 2,79 dolar oldu; Gemini ise 271 adım ve 1,24 dolar kullandı. Aynı nihai sonuç, yürütme süreci veya araç kullanım verimliliği açısından belirgin farkları yansıtmadı.
Çözüm oranı neyi gizliyor?
Junie, bir issue ve yazılım deposu bağlamında çalışır; modelin dosyaları incelemesine, sembolleri aramasına, kodu değiştirmesine, komutları ve testleri çalıştırmasına olanak tanır. Bu eylemler, modelin iç düşüncesini ortaya çıkardığı iddia edilmeksizin izlenebilen bir “yürütme süreci” oluşturur. Bu süreç sayesinde ajanın değişiklikten önce sorunun konumunu belirleyip belirlemediği, arama işlemlerini tekrarlayıp tekrarlamadığı, varsayımlarını test edip etmediği veya son yamayı doğrulamadan görevi tamamlayıp tamamlamadığı anlaşılabilir.
Bu nedenle JetBrains, değerlendirme için dört bakış açısını birleştiren bir işlem hattı öneriyor: işlevsel sonuç, yürütme verimliliği, yama kalitesi ve süreç kalitesi. Belirli ölçümler arasında test sonuçları, çalıştırma süresi, belirteç sayısı ile model ve araç çağrıları, maliyet, değiştirilen dosya ve sembol sayısı, karmaşıklıktaki değişim, tekrarlanan dosya okuma işlemleri, sonuçları değişmeyen komutların yeniden çalıştırılması ve araç başarısızlığı döngüleri yer alıyor.
Sonuçtan ona ulaşma sürecine
JetBrains, Claude Opus 4.7 ile Gemini 3.5 Flash'ı karşılaştırırken 523 görev içeren dört ölçüt üzerinde metodolojiyi test etti. Opus 267 görevi, yani %51,1'ini çözerken Gemini 254 görevi, yani %48,6'sını çözdü. 430 görevde sonuç aynıydı: İki model birlikte 214 görevde başarılı, 216 görevde başarısız oldu. Gerçek fark yalnızca 93 görevde ortaya çıktı; bu da sıralama tablosundaki ham farktan çok davranışsal farklılıkları önemli kılıyor.
İki modelin de başarılı olduğu tek bir görev örneğinde, ikisi de 15. adımda ilgili bir dosyayı açtı, kök nedene ulaştı ve kapsamlı bir doğrulama gerçekleştirdi. Ancak Opus daha hedefli bir arama kullandı, 13 adımdan sonra çalıştırmaya başladı ve görevi keşif, çalıştırma ve doğrulama arasında altı geçişle 53 adımda tamamladı. Gemini ise büyük birimi daha geniş kapsamda inceledi, çalıştırılabilir ilk kontrolü 30. adımda gerçekleştirdi, üretim kodunda ilk değişikliği 88. adıma kadar yapmadı; ardından 192 adıma ve aşamalar arasında 34 geçişe ihtiyaç duydu.
İki model de testleri geçti ve referans yamanın değiştirdiği dosya ile sembollerin aynısını değiştirdi. Ancak Opus başka hiçbir dosyaya dokunmazken Gemini'nin yaması dört ek dosyaya yayıldı; değerlendirme süreci bu yamayı geniş ve belirgin tekrarlar ile bazı halüsinasyonlar içeren bir yama olarak nitelendirdi. JetBrains, bu örneğin açıklayıcı olduğunu ve bağımsız bir istatistiksel sonuç teşkil etmediğini vurguluyor.
Başarısızlık tek bir durum değildir
Her iki modelin de başarısız olduğu 216 görevin analizi, değerlendirmeye göre vakaların %85'inden fazlasında kök nedenin tamamen veya kısmen belirlendiğini gösterdi. Bir vakada iki ajan da metnin belirteç sınırını aşmasının hataya yol açtığını anladı, ancak metni doğru parçalara bölmek yerine kırpmayı önerdi. Başka bir vakada ise bir yol üzerindeki indirme parametresini düzelttiler, fakat aynı sorunu eşlik eden bir yolda gözden kaçırdılar.
Bu vakalar, ajanın sorumlu bileşeni bulamamasından kaynaklanan başarısızlıktan pratikte farklıdır. Neden eksik uygulama, yanlış katmanın değiştirilmesi, görevin kesin sözleşmesine uyulmaması veya doğrulama yapılmadan durulması olabilir. Dolayısıyla yürütme süreci, müdahalenin gerekli olduğu noktayı belirlemeye yardımcı olabilir: depo içinde gezinmeyi iyileştirmek, görev ifadesini ayarlamak, değişikliklerin tamamlanmasını güçlendirmek veya son bir doğrulama adımını zorunlu kılmak.
Tek bir sıralama yerine davranış profilleri
JetBrains, Claude Opus 4.7'nin belirsiz kusurların altında yatan nedeni belirlemeye daha yatkın olduğu ve Gemini'nin başarısız olduğu 53 görevi çözdüğü sonucuna vardı. Ancak çalıştırmalarının 123'ünde, çözüldüğü kabul edilen 68 görev de dahil olmak üzere, çalıştırılabilir herhangi bir doğrulama bulunmuyordu. Şirket, bu davranışın regresyonlar veya uç durumlarla ilgili tespit edilmemiş riskler bırakabileceğini düşünüyor.
Buna karşılık Gemini 3.5 Flash, beklenen davranışın açık ve sorumlu bileşenin nispeten belirli olduğu durumlarda çalıştırılabilir bir kontrol gerçekleştirmeye ve sonucunu çözümü iyileştirmek için kullanmaya daha yatkındı. Bununla birlikte çözüme yakınsama ve depoya dayandırma konusunda sorunlar sergiledi; eşdeğer aramaları veya komutları tekrarladı, derleme yapısı üzerinde çok sayıda adım harcadı ve belgelenmemiş arayüzlere, bağımlılıklara, yollara veya test düzeneklerine daha fazla dayandı. Çalıştırmalarının 195'i, yani %37,3'ü, Opus'taki 130 çalıştırmaya kıyasla orta veya şiddetli halüsinasyon içeriyor olarak sınıflandırıldı. Ayrıca 80 çalıştırmasında, yani %15,3'ünde, Opus'taki %6,5'e kıyasla büyük veya şiddetli tekrar görüldü.
Bu pratikte ne anlama geliyor?
GPT-5.5, Claude Opus 4.7, Gemini 3.5 Flash ve Qwen 3.6 27B FP8'in 522 ortak görev üzerinde yer aldığı daha geniş bir karşılaştırmada GPT-5.5, %51,5 ile en yüksek çözüm oranına ulaştı ve her seferinde çalıştırılabilir bir kontrol gerçekleştiren tek model oldu. Yama kalitesi göstergelerinde Opus öne çıkarken Qwen 3.6 27B FP8, GPT-5.5'in çalıştırma maliyetinin %3'üne denk bir maliyetle görevlerin %38,9'unu çözdü.
Bu rakamlar, model seçiminin maliyet ve riskin nerede bulunduğuna bağlı olduğunu gösteriyor. Teşhiste daha güçlü olan bir model, alışılmadık bir depo veya belirsiz bir kusur için uygun olabilirken, doğrulama konusunda daha disiplinli bir model testler ve geri bildirim mevcut olduğunda daha iyi olabilir. Başarısız bir denemenin maliyeti sınırlı olduğunda, çözüm oranı daha düşük olsa bile düşük maliyetli model pratik bir seçenek hâline gelebilir. Ancak bu yorum, bir modelin her ortamda sabit bir davranışa sahip olduğu anlamına gelmez.
JetBrains, sonuçlar Junie'nin belirli mimarisine dayandığı için davranış profillerinin modellerin kendisine genellenmemesi konusunda uyarıyor. Ayrıca büyük dil modellerine dayanan değerlendiricilerin hükümleri “referans gerçek” değildir ve doğru çözümler farklı dosyalar veya mimari katmanlar kullanabilse de büyük ölçüde tek bir altın yamadan etkilenir. Bu nedenle çözüm oranı gerekli bir temel olmaya devam ediyor, ancak tek bir genel sıralamaya indirgenmek yerine verimlilik, değişiklik kalitesi ve iş akışına ilişkin kanıtlarla birlikte sunulduğunda değeri artıyor.