Yapay zekâ

JetBrains, Junie İçinde Qwen3.6’yı Yerel Olarak Çalıştırmayı Nasıl İyileştirdi?

JetBrains, Qwen3.6-27B’yi M5 çipli MacBook’larda yerel olarak çalıştırmak için Junie ve çıkarım motorunda yaptığı değişiklikleri açıklıyor. Deney, yerel kodlama ajanlarının performansının sembol üretim hızının yanı sıra bağlam yönetimine ve prefill aşamasına da bağlı olduğunu gösteriyor.

2026-08-24
6 dk okuma
10 görüntülenme
فريق تحرير certi.news
JetBrains, Junie İçinde Qwen3.6’yı Yerel Olarak Çalıştırmayı Nasıl İyileştirdi?

JetBrains, Junie Local’ın ilk sürümünü Qwen3.6-27B modeliyle bir M5 MacBook üzerinde tamamen yerel olarak çalıştırmaya ilişkin mühendislik ayrıntılarını açıkladı. Şirket, pratik performansa ulaşmanın yalnızca sıkıştırılmış bir model seçmekle mümkün olmadığını; kodlama ajanının kendisinde, çıkarım motorunda, model ayarlarında ve bağlam yönetimi yönteminde değişiklikler gerektirdiğini belirtiyor.

Şirket, Junie’yi bulut çıkarımı olmadan tamamen cihaz üzerinde çalıştırma projesinin, çok çeşitli donanım yapılandırmalarını hedefleyen uzun vadeli bir proje olduğunu söylüyor. Şu anda mevcut olan ilk sürüm ise M5 MacBook’lara odaklanıyor; bu da duyurulan iyileştirmelerin neden bu çiplerin özelliklerine odaklandığını açıklıyor.

Görev bağlamını oturum içinde tutmak

Junie, diğer kodlama ajanları gibi, kullanıcının modele bir görev gönderdiği ve modelin daha sonra Bash komutları ile dosya okuma ve yazma gibi araç çağrıları gerçekleştirdiği bir yürütme döngüsü üzerinden çalışır. Bu işlemlerin sonuçları daha sonra modele geri gönderilir. Her yeni istekle bağlam genişler ve modelin önceki istekte işlediği KV-cache verileri yeniden kullanılabilir.

Bulut modellerinde ajan, gerektiğinde bir dosyayı yeniden isteyebilir; çünkü yanıt üretilmeden önce başlangıç bağlamının işlenmesi olan prefill aşaması görece hızlıdır. Ancak JetBrains, yerel modellerde dosya okumanın zaman açısından maliyetli olduğunu gördü. Bu nedenle yerel çıkarım mantığını, her yeni isteği yalnızca yeni görevle ilgili olduğu düşünülen bölümlerle yetinmek yerine doğrudan kayan bağlama ekleyecek şekilde değiştirdi. Böylece modelin okuduğu dosya bağlam içinde kalıyor ve KV-cache belleği dosyanın yeniden işlenmesi gerekmeden kullanılabiliyor.

Şirket ayrıca Junie’nin yeni bir kodlama oturumunun başlangıcında gönderdiği verilerin sırasını değiştirdi ve çıkarım motoruna, kullanıcı isteğine kadar olan öneki depolayacak bir mantık ekledi. Bunun sonucunda aynı proje içindeki sonraki görevlerde bu önek yeniden kullanılabiliyor. Kullanıcı isteğinden sonra gelen proje bağlamı ise aynı şekilde depolanmadı; çünkü bu bağlam görece küçük ve çoğunlukla sık değişebilen üst düzey dosyalardan oluşuyor.

Model davranışıyla bağlantılı değişiklikler

Qwen3.6, ilerleme güncellemelerini Junie’nin bulut modellerinden beklediği şekilde ele almadı. Model, XML benzeri biçimdeki durum güncellemelerine ayrılmış bloğu çoğunlukla yok sayıyor, ancak araç çağrılarının yanında eylemlerinin metinsel bir açıklamasını yazıyordu. JetBrains bu davranıştan yararlanarak üretilen metni kullanıcıya bir güncelleme olarak gösterdi. Şirket, bu uyarlamanın modele özgü olduğunu ve diğer modellerin hiç metin yazmayabileceğini ya da aşırı miktarda metin üretebileceğini belirtiyor.

JetBrains ayrıca modelden istenen bazı isteğe bağlı işlemleri devre dışı bıraktı; bunlar arasında görev için kısa bir açıklama oluşturan mantık da bulunuyor. Şirket, istek sayısını azaltma karşılığında kullanıcı deneyimindeki sınırlı tavizin kabul edilebilir olduğunu düşünüyor. Ayrıca çoklu ajan modunu da devre dışı bıraktı; çünkü testlerine göre M5 cihazında sıralı işleme daha verimliydi. Buna karşılık paralel istekler çıkarım hızıyla sınırlı kalmaya devam edecekti.

Qwen3.6-27B neden seçildi?

JetBrains, yerel sürümde reasoning’i tamamen devre dışı bırakmaya karar verdi. Şirketin Qwen3.6-27B’nin bulut sürümüyle yaptığı dahili testlere göre reasoning’i etkinleştirmek kalitede büyük bir artış sağlamadı. Reasoning sembolleri, çıkarım motoru tarafından üretilen semboller arasında sayıldığından, bunların devre dışı bırakılması gereken sembol sayısını yaklaşık iki ila üç kat azalttı. Şirket bunu, kalite üzerindeki etkisini “önemsiz” olarak nitelendirdiği hâlde görev yürütmede yaklaşık iki kat hızlanmaya dönüştürdü.

Şirket 4-bit kuantizasyonlu sürümü kullandı; çünkü kıyaslama testlerinde 8-bit sürümden yalnızca biraz daha kötüydü ve bellekle ilişkili sembol üretimi 8-bit sürüme kıyasla yaklaşık iki kat daha hızlıydı. Ancak ilk testlerde 4-bit, 8-bit ve 16-bit sürümleri arasında prefill hızı farklılık göstermedi. Bu durum ekibi motor içindeki hesaplama işlemlerini incelemeye yöneltti.

Görünmeyen darboğaz: prefill aşaması

JetBrains’in verilerine göre prefill hızı, varsayılan ayarlar altında RTX 5090 ekran kartında saniyede yaklaşık 3.700 sembole ulaşabilirken, iyileştirmelerden önce M5 üzerinde saniyede yaklaşık 650 semboldü. Dosya içi inceleme görevlerinde zamanın büyük kısmı yanıtın üretilmesine değil, bağlamın işlenmesine gidiyordu.

Ekip, prefill sırasında matris işlemlerinin önemli bir bölümünün, ağırlıklar 4-bit’e sıkıştırılmış olsa bile 16-bit hassasiyetle gerçekleştirildiğini buldu; çünkü ağırlıklar işlemler yürütülmeden önce 16-bit’e dönüştürülüyordu. M5’in 8-bit hassasiyetli hesaplama için özel talimatlara sahip olması nedeniyle JetBrains, MLX-VLM paketine self-attention katmanlarındaki bazı matris işlemlerini 8-bit’e taşımak üzere bir düzeltme uyguladı ve prefill hızında yaklaşık %40 artış elde etti. Değişiklik, kuantizasyonla birlikte bile ağırlıkları 16-bit hassasiyetinde kalan full-attention katmanlarını kapsamadı.

Şirket, mevcut odağını özellikle bu hesaplama talimatlarıyla bağlantılı olarak M5’e yöneltiyor. M4 çiplerinde bu talimatlar bulunmuyor ve JetBrains, M4 üzerinde 16-bit hesaplamaların prefill aşamasında M5’e kıyasla %20 ila %30 daha yavaş olduğunu söylüyor.

Üretimi hızlandırma ve model seçimi

JetBrains, speculative decoding’in iki yöntemini birlikte etkinleştirdi: ayrı bir taslak model kullanan çok sembollü tahmin MTP ve sonraki sembolleri tahmin etmek için bağlamdaki tekrar eden dizileri arayan n-gram eşleştirme. Bazı durumlarda MTP aracılığıyla önerilen yaklaşık üç sembol ve n-gram eşleştirme aracılığıyla sekiz sembole kadar ek sembol kabul edilebiliyor. Bu da üretime iki kata kadar hız kazandırdı.

Şirket, Qwen3.8-27B’nin Mac cihazlarda en iyi seçenek olmadığını açıklıyor; çünkü modelin iyi çalışması için reasoning’e ihtiyaç duyuyor. Reasoning devre dışı bırakıldığında kalite ciddi biçimde düşüyor ve model aynı araç çağrısını tekrarladığı bir döngüde takılabiliyor. Öte yandan reasoning’in orta düzeyde etkinleştirilmesi üretilen sembol sayısını yaklaşık beş kat artırıyor. Prefill süresi fazla değişmediği için bu, pratikte yaklaşık dört kat yavaşlamaya yol açıyor. Bu nedenle JetBrains’in değerlendirmesine göre Qwen3.6-27B, şu anda Junie’yi Mac donanımı üzerinde yerel olarak çalıştırmak için en uygun seçenek olmaya devam ediyor.

certi.news’in değerlendirmesi: Gerçekte ne değişiyor?

Bu deney, yerel bir kodlama ajanını yalnızca saniyede üretilen sembol sayısıyla ölçmenin eksik bir tablo sunabileceğini gösteriyor. Kullanıcı ayrıca dosyaların yüklenmesini, bağlamın yeniden kullanılmasını ve araç çağrılarının yürütülmesini bekliyor; bunlar üretim başlamadan önce darboğaza dönüşebilecek aşamalar. Pratikte Junie’deki değişiklikler dosyaların yeniden okunması ihtiyacını azaltırken, MLX-VLM düzeltmesi M5 üzerinde bağlam işleme hızını artırıyor ve reasoning’in devre dışı bırakılması gereken sembol sayısını azaltıyor.

Ancak sınırlamalar da açık: İlk sürüm M5’e odaklanıyor; reasoning’in devre dışı bırakılması, kaliteyi korumak için buna dayanan modeller için uygun olmayabilir. Ayrıca ilerleme güncellemelerinden yararlanma, Qwen3.6’nın davranışıyla bağlantılı. JetBrains, DGX Spark ve RTX 5090 desteği için prototiplere sahip olduğunu ve 24 GB kapasiteli kartları da değerlendirdiğini söylüyor; ancak yazı bu sürümlerin kullanıma sunulması için bir tarih veya teknik özellik vermiyor. Bu nedenle Junie Local, daha kullanılabilir yerel kodlama ajanlarına doğru önemli bir teknik adımı temsil ediyor; deneyimin tüm bulut modelleriyle eşdeğer hâle geldiğinin veya her tür donanımda kullanılabildiğinin kanıtı değil.

Haber kaynağı
JetBrains Blog
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör