Microsoft, Frontier Offensive Research & Generative Exploitation’ın kısaltması olan FORGE Laboratuvarının, yapay zekânın zor güvenlik açıklarını bulma becerisini test etmekten, bu keşifleri dağıtıma hazır düzeltmelere dönüştürmek için gerekenleri incelemeye geçtiğini söylüyor. Mayıs ve Eylül 2026 arasında laboratuvar, Windows’ta 140 CVE kimliği atanan güvenlik açıklarının keşfedilmesine yardımcı oldu; bunların 52’si Eylül 2026 güvenlik güncellemeleri kapsamında ele alındı.
Çalışma açık kaynak yazılımlara da uzandı; FORGE ekipleri, Linux çekirdeği de dahil olmak üzere 23 proje üzerinden kurum içinde doğrulanan yaklaşık 155 rapor sundu. Microsoft’a göre, 14 proje veya proje ailesi kapsamındaki 93 rapor, materyalin hazırlandığı sırada yöneticilerden teyit veya belgelenmiş kabul aldı. Linux Vakfının Akrites girişimi aracılığıyla sunulan Linux raporlarından biri de girişimin Linux çekirdeğine bir düzeltmenin dahil edilmesiyle sonuçlanan ilk raporu oldu.
Maksimum kapasiteden geniş ölçekte çalışmaya
İlk ders, karmaşık bir kusur bulmada başarılı olan bir modelin aynı hızda düzeltmeler üreteceğini garanti etmemesidir. Doğrulayıcıların sayısını artırmak adayların sayısını yükseltebilir, ancak teyit edilmiş sonuçların veya yayımlanan düzeltmelerin sayısını zorunlu olarak artırmaz. Raporlar Microsoft Security Response Center’ın bunları inceleme kapasitesinden daha hızlı ulaştığında bekleme listesi birikir ve özellikle raporlar tekrarlandığında veya yeniden üretilebilir kanıtlardan yoksun olduğunda uzmanların zamanını tüketir.
Bu nedenle FORGE yalnızca tarama veya rapor sayısına değil, yeniden üretilebilir bir sonuca odaklanıyor. Laboratuvar, çalışmayı düzenlemek için çok modelli MDASH platformunu; istismar edilebilirlik kanıtı veya kavram kanıtı oluşturucularını, test araçlarının oluşturulmasını ve kusurlu davranışa yol açan girdilerin bulunmasını kullanıyor. Microsoft, soyut sözdizimi analizi gibi deterministik algoritmalara dayanan kurum içi bir projenin, aynı kod üzerinde gerçekleştirilen birden fazla taramada yinelenen raporları yaklaşık %45 azalttığını belirtiyor.
Harcama, daha fazla metne değil belirsizliği ortadan kaldırmaya
Microsoft, verimliliği yalnızca modelin ürettiği belirteçlerin sayısıyla ölçmenin yanıltıcı bir ölçüt olduğunu düşünüyor. Kısa bir rapor belirsiz olabilir ve soruşturma açısından maliyet yaratabilirken, daha uzun bir analiz yürütme yolunu gerekçelendirebilir ve toplam maliyeti azaltabilir. Pratik karar, araştırmacının neyi eksik gördüğünü belirlemektir: işlev çağrı zinciri, derleme yapılandırması, çalıştırılabilir yeniden üretici, nedensel açıklama veya ardından gelen adımı özellikle bu boşluğu kapatmaya yönlendirmek.
MDASH; gelişmiş modelleri, damıtılmış modelleri, uzman doğrulayıcıları ve kod analiz araçlarını bir araya getiriyor. Rutin görevler daha düşük maliyetli modellere yönlendirilebilirken çözümlenmemiş sorular daha güçlü modellere aktarılabiliyor. Ancak Microsoft, erken filtrelemenin gerçek güvenlik açıklarını dışlayabilmesi nedeniyle bu politikanın hâlâ ölçülmesi gereken bir hipotez olduğunu vurguluyor.
Doğrulama ve düzeltme, sürekli bir öğrenme döngüsü olarak
Yaklaşıma göre doğrulama ve düzeltme, güvenlik açığının keşfinden sonraki bir aşama olarak ele alınmamalı. Her sonuç otomatik doğrulamadan, insan incelemesinden, düzeltme geliştirmeden ve gerileme testinden geçmeli; her aşamanın kanıtları sisteme geri aktarılmalı. Doğrulamanın başarısız olması bile başarısızlığın nedeni kaydedildiğinde yararlı olabilir; örneğin yola erişilememesi, yanlış derleme yapılandırması, saldırganın girdiler üzerinde kontrol sahibi olmaması veya raporun tekrarlanması gibi.
Linux çekirdeği üzerinde yapılan bir deneyde doğrulama vekilleri 627 sonuç için destekleyici kanıtlar üretti. Kesinleşmiş 182 çökme sonucu için kavram kanıtı oluşturmanın ortalama maliyeti 3,61 dolar model maliyeti ve başarılı vaka başına 21,5 dakika oldu. Otomatik istismar üretimi yoluyla yerel ayrıcalık yükseltme olasılığının test edildiği altı vakada ortalama 8,56 dolar ve 25,4 dakika ölçüldü. Değerlendirmelerde GPT-5.5 kullanıldı; ilk tarama maliyetleri, başarısız vakalar, insan soruşturması ve düzeltmelerin hazırlanması dahil edilmedi.
Bu, güvenlik ekipleri için ne anlama geliyor?
Bu sonuçlardan çıkarılacak en önemli değerlendirme, vekil güvenlik açığı keşif sistemlerinin başarısının yalnızca sonuç sayısıyla ölçülmemesi gerektiğidir. Microsoft; teyit edilen kusurların, yinelenen ve reddedilen raporların, bekleme listesinin yaşının, keşif ile düzeltme arasındaki geçiş süresinin yanı sıra model maliyetlerinin ve insan inceleme süresinin izlenmesini öneriyor. Açık kaynak projeleri üzerinde çalışmak, daha fazla rapor göndermekten ibaret değildir; her projenin bildirim, inceleme ve düzeltme süreçlerine saygı gösterilmesini gerektirir.
Pratikte kaynak, darboğazın merkezinde bir değişim olduğunu belirliyor: Kusuru bulma kapasitesi sorunun yalnızca bir parçası hâline gelirken araştırmayı derleme ortamları, ikili dosyalar, yapılandırmalar, test araçları ve CI/CD sistemleriyle ilişkilendirmenin önemi artıyor. Sonuçların sınırları da açık; doğrulama maliyetlerine ilişkin rakamlar önemli insan aşamalarını kapsamıyor ve araştırma sonuçlarının kabul edilen bir düzeltmeye dönüştürülmesi, yöneticilere ve her projenin bağlamına bağlı. Bu nedenle materyal, otomasyonun mühendislik incelemesinin yerini aldığını kanıtlamıyor; onu, güvenlik değerlendirmesi ve düzeltme sorumluluğunu insanlarda tutarak tekrarlanan çalışmayı azaltma aracı olarak sunuyor.