JetBrains, Junie CLI aracına, kod değişikliklerinin doğrulanmasındaki etkileşimli bölümü otomatikleştirmeyi amaçlayan yeni Junie /demo modunu duyurdu. Geliştirici yalnızca testleri çalıştırmak yerine istenen senaryoyu açıklayabiliyor; Junie de uygulamayı derleyip çalıştırıyor, arayüzüyle etkileşime giriyor ve sonuç, ekran görüntüleri ile yürütme videosunu içeren bir HTML raporu oluşturuyor.
Yeni mod nasıl çalışıyor?
Junie projeyi analiz edip derleme ve çalıştırma planı öneriyor, ardından kullanıcının onayından sonra yapılandırma dosyalarını oluşturuyor. Değişiklikler dal, oturum, çalışma ağacı veya son commit üzerinden seçilebiliyor; daha sonra eylemleri ve beklenen sonuçları belirleyen bir istek giriliyor. JetBrains’in sunduğu örnekte ajan, görev izleme aracında iki sorunu belirliyor, durumlarını Done olarak değiştiriyor, sayaçların değiştiğini doğruluyor ve sonucun korunup korunmadığını kontrol etmek için sayfayı yeniden yüklüyor.
Kullanıcı, ajan arayüzde gezinirken yürütmeyi doğrudan izleyebiliyor. Videoda her senaryo için giriş slaytları ve sonuçlar için bir kapanış slaytı bulunuyor; ayrıca etkinleştirilip devre dışı bırakılabilen açıklayıcı altyazılar yer alıyor. JetBrains, bir modelin kayıttan sonra ekran görüntülerini analiz ederek bu slaytları hazırladığını, sesli anlatımın ise sonraki bir güncellemede eklenebileceğini belirtiyor.
Elle yapılan demodan denetlenebilir incelemeye
HTML raporu, özgün isteği, sonucu, videoyu, ekran görüntülerini ve gerçekleştirilen adımları bir araya getiriyor; başarıyla geçen, başarısız olan veya tamamlanmamış kalan testleri açıklıyor. Böylece çıktılar, yalnızca kod değişikliğini okumak yerine özelliğin davranışını görmek isteyen bir geliştirici, kalite güvence mühendisi veya ekip üyesi tarafından incelenebilir hale geliyor.
certi.news’e göre buradaki pratik değer, otomatik testlerin yerine geçmekte değil, arayüz davranışına ilişkin görsel kanıt eklemekte yatıyor. Değişikliğin hazır olup olmadığına karar verme sorumluluğu inceleyende kalıyor; ajanın çalışmasını tamamlaması, incelemenin otomatik olarak başarılı olduğu anlamına gelmiyor. Bu nedenle JetBrains’in örnekleri, Junie’den açık bir verdict vermesini istiyor ve sonucu yalnızca PASS yazıldığında geçiriyor; FAIL ve PARTIAL gibi değerler veya eksik sonuç ise sonuç kontrolünün başarısız olmasına yol açıyor.
GitHub Actions entegrasyonu ve maliyet
JetBrains, modu GitHub Actions ile dahili olarak 1.500’den fazla benzersiz birleştirme isteğinde kullandı ve 2.100’den fazla demo videosu oluşturdu. Ayrıca sürüm dallarında smoke testleri için 22 senaryoda kullandı; toplamda 1.300’den fazla dahili test gerçekleştirildi. Şirket, uyarlanabilecek iki YAML dosyası örneği sunuyor: bunlardan biri demoya değer taşıyan değişiklikleri kontrol edip kanıt bağlantılarını birleştirme isteğine ekliyor, diğeri ise push ile veya manuel olarak çalıştırılan sürüm testleri için kullanılıyor.
Örnekler GitHub Artifacts’e dayanıyor; bu nedenle videoyu barındırmak için ayrı bir hizmet gerekmiyor. JetBrains, dahili bir ölçümde 22 durumun çalıştırılmasının, kendi kullandığı abonelik dönüşümüne göre GPT-5.6 SOL kullanıldığında 19,94 dolara mal olduğunu ve CI çalışma ortamının maliyetinin ayrıca hesaplandığını belirtiyor. Bunlar uygulamadan, derleme adımlarından ve isteklerin ifade ediliş biçiminden etkilenen dahili rakamlardır; her proje için genel bir tahmin değildir.
Ortam ve operasyonel sınırlamalar
Mod, Debian Bookworm tabanlı bir Docker konteyneri içinde çalışıyor; bu ortamda Chromium, Node.js, Xvfb, bir pencere yöneticisi ve xdotool ile ffmpeg gibi araçlar bulunuyor. Tıklamaları, klavyeyi ve ekran görüntülerini kontrol etmek için Computer Use destekleyen bir model kullanıyor. Karmaşık depolar, sanal makineler için hizmetlere ve arayüzlere yönelik ayrı ayarlarla birden fazla şablon tanımlayabiliyor.
Desteklenen bir model olmadan çalıştırma başlamıyor. Junie, mevcutsa ve Computer Use’ı destekliyorsa etkin modeli kullanıyor; aksi halde GPT-5.6 SOL, GPT-6 Astra ve ardından GPT-5.5 ile GPT-5.4’ü içeren bir listeden seçim yapıyor ve /demo modunda High reasoning effort ayarını kullanıyor. Çalıştırmanın dakikalar sürdüğü de belirtiliyor; en büyük faydası, etkileşimli ve tekrarlanan doğrulamayı incelenebilir bir sürece taşımak, insan incelemesi olmadan sonucun doğruluğunu garanti etmek değil.