GitHub, bir programlama görevinin yerel bir model üzerinde mi yürütüleceğini yoksa bulut modeline mi gönderileceğini belirleyecek otomatik yönlendirmeyi GitHub Copilot’a eklemeye hazırlanıyor. Özelliğin Ekim 2026 sonuna kadar kullanıma sunulması bekleniyor. Plan, temel bir soruyu yanıtsız bırakıyor: Bulut yolu seçildiğinde konuşma geçmişinin ve depo bağlamının ne kadarı buluta aktarılabilir?
Microsoft planı, GitHub’da ürün yöneticisi olan Patrick Nikoletich ile Windows platformu için iş ortaklıkları mühendisi Stuart Schaefer’in ortak kaleme aldığı bir gönderide açıkladı. Duyuru, GitHub Copilot’taki yeni sandboxing denetimlerinin genel kullanıma sunulmasıyla aynı zamana denk geldi; ancak koruma düzeyi kullanılan araçlara göre değişiyor.
Göreve ve bağlamına dayalı yönlendirme
GitHub, programlama görevleri için uygun modelleri seçen HydraFusion projesini, çıkarımın nerede çalıştırılacağını da belirleyecek şekilde genişletiyor. Şirkete göre Copilot, yerel ve bulut çıkarımı arasında geçiş yaparken, çok turlu oturumlar sırasında da görevin bağlamını ve önbellekleme durumunu dikkate alacak.
Copilot CLI, Copilot uygulaması ve Visual Studio Code’daki geliştiriciler Auto modunu kullanabilecek veya yerel bir modeli manuel olarak seçebilecek. Seçenekler arasında Windows ML üzerinden MAI Code 1.1 Flash modeli ve OpenAI ile uyumlu yerel uç noktalar bulunuyor.
Hâlâ ne belirsiz?
Microsoft, “yerel çıkarımın oturumu çevrimdışı hâle getirmediğini” kabul ediyor. Şirket, Auto modunun bulut modellerine gönderdiği depo bağlamının veya konuşma geçmişinin miktarını ya da geliştiricilerin yönlendirme kararlarını inceleyip inceleyemeyeceğini ve bulut kullanımını tamamen engelleyip engelleyemeyeceğini açıklamadı.
Bu belirsizlik, kod ve verilerin işlenmesi konusunda katı politikalar uygulayan ekipler için önem taşıyor. Yerel model seçimi çıkarım sürecini cihazda tutuyor; ancak aracının harici hizmetlere erişmesini veya araçları üzerinden ağ istekleri gerçekleştirmesini engellemiyor. Tamamen yerel bir oturum elde etmek için geliştiricilerin bu araçların izinlerini de kısıtlaması gerekecek.
Büyük bir yerel model ve yüksek donanım gereksinimleri
Yerel yol, toplam 137 milyar parametre içeren ve 6,8 milyar parametresi etkinleştirilen bir mixture-of-experts modeli olan MAI Code 1.1 Flash’a dayanıyor. Microsoft, modelin boyutunu 53 gigabayta düşürmek için ağırlık başına yaklaşık 3,3 bitlik karma hassasiyet nicelemesi kullandı; bu, bfloat16 biçimindeki bulut sürümünden %80 daha az. Şirket ayrıca yerel çıkarımı hızlandırmak için speculative decoding kullandı.
İlk sürüm, 128 gigabayta kadar birleşik bellek sunan Surface Laptop Ultra gibi NVIDIA RTX Spark işlemcilerle donatılmış Windows cihazlarını hedefliyor. 256 bin tokenlık bağlamla bellek tüketiminin zirvesi 75,5 gigabayt olarak ölçüldü. Bu değer yalnızca modeli kapsamıyor; sistem, uygulamalar, çalışma ortamı ve KV cache belleği için de ek alan gerekiyor. Dosyaların okunması ve araç sonuçlarının alınmasıyla önbellek büyüyor.
Performans ve güvenlik yalıtımı
Niceleştirilmiş model SWE-Bench Verified’da %70,8 puan alırken tam hassasiyetli sürüm %72,6 puan aldı. Terminal-Bench 2.1’de ise 89 görevden oluşan bir kümede %66,29 puan alarak orijinal modelin %62,9’luk sonucunu geçti; bu küçük testteki fark yaklaşık üç göreve denk geliyor.
Copilot, yalıtım politikalarını uygulamak için açık kaynaklı Execution Containers (MXC) kütüphanesini kullanıyor: Windows’ta ProcessContainer’dan BaseContainer katmanı, macOS’ta Seatbelt ve Linux’ta bubblewrap. Shell komutları ile bazı yerel MCP sunucuları ve dil sunucuları, destek bulunduğu durumlarda, yerel veya bulut modeli kullanılsa da işletim sisteminin uyguladığı kısıtlamalara tabi.
Yerleşik dosya araçları ise aracı sürecinin içinde çalışıyor ve çalışma ortamı kontrollerine dayanıyor; uzak MCP sunucuları yerel yalıtımın dışında kalıyor. Microsoft’un çevrimdışı bir iş akışı olarak nitelendirdiği gösterim bile, burada kullanılan GitHub verilerinin ağ üzerinden mi getirildiğini yoksa yerel olarak mı depolandığını netleştirmedi.
Bu haber neden önemli?
Değişiklik, geliştiricinin cihazında daha küçük bir model çalıştırmakla sınırlı değil; kodun nerede işleneceğine ilişkin hassas bir kararı otomatik bir yönlendirme mekanizmasına aktarıyor. Uygulamada geliştiriciler, bulut modellerinin hızı ile yerel çalıştırmanın gizliliği arasında daha fazla esnekliğe sahip olacak. Ancak GitHub, Auto modunun hangi verileri gönderdiğini, kararlarının denetlenip denetlenemeyeceğini ve yerel çalıştırmanın zorunlu kılınıp kılınamayacağını açıklayana kadar ekipler riskleri tam olarak değerlendiremeyecek. Bu nedenle duyuru, Copilot’un gerçekten çevrimdışı bir yerel oturum sunduğunu veya mevcut bellek gereksinimlerinin çoğu geliştirme cihazı için uygun olduğunu henüz kanıtlamıyor.