Google, dolaylı komut enjeksiyonunu (IPI), bir kez çözülüp geride bırakılabilecek bir tehdit değil, gelişen bir tehdit olarak ele alıyor. Bu saldırı türü, Workspace with Gemini gibi birden çok veri kaynağı ve araçla çalışan yapay zekâ uygulamalarını hedef alıyor. Saldırgan, kullanıcıdan doğrudan girdi almadan bile, modelin kullanıcı isteğini yerine getirirken kullandığı verilere veya araçlara kötü amaçlı talimatlar yerleştirebiliyor.
Google'ın üretken yapay zekâ güvenliği ekibinden Adam Gavish tarafından yayımlanan bir blog yazısında Google, büyük dil modellerinin aracı otomasyonunda kullanımının yaygınlaşmasının ve işledikleri içeriğin çeşitlenmesinin, düşmanca saldırılar için sürekli değişen bir ortam oluşturduğunu belirtiyor. Bu nedenle şirket; güvenlik araştırmalarını, saldırı testlerini, sentetik verileri, uygulama kontrollerini ve makine öğrenimi modelleriyle dil modellerinin güncellenmesini bir araya getiren sürekli bir yaklaşım geliştiriyor.
Birden çok kaynaktan gelen saldırıları keşfetme
Süreç, yeni saldırı yollarının saldırganlar bunları daha geniş ölçekte kullanmadan önce keşfedilmesi ve kataloglanmasıyla başlıyor. Google bu amaçla, gerçekçi kullanıcı profillerine dayalı saldırılar gerçekleştirerek güvenlik ve emniyet açıklarını ortaya çıkarmak için uzman ekiplerin çalıştırdığı insan destekli saldırı simülasyonu testleri de dâhil olmak üzere, iç ve dış programlar kullanıyor. Ardından ekipler, tespit edilen sorunları gidermek için ürün ekipleriyle koordinasyon sağlıyor.
Şirket ayrıca makine öğrenimiyle desteklenen dinamik çerçeveler aracılığıyla otomatik saldırı testlerinden yararlanıyor. Bu çerçeveler, saldırı yükleri oluşturuyor ve gelişmiş tehditleri geniş ölçekte taklit etmek için bunları algoritmik olarak tekrar tekrar değiştiriyor. Böylece karmaşık saldırı yollarının haritası çıkarılabiliyor ve güvenlik kontrollerinin, yalnızca manuel testlerle kapsanabilecek olandan daha fazla uç durumda ne kadar etkili olduğu sınanabiliyor.
Google Yapay Zekâ Güvenlik Açığı Ödül Programı (Google AI Vulnerability Rewards Program) da IPI'dan yararlanan yeni saldırıları keşfeden dış güvenlik araştırmacılarıyla iş birliği yapılmasını sağlıyor. Google ayrıca davetli araştırmacılara yeni açıkları keşfetmeleri amacıyla sürüm öncesi özelliklere erişim sunan düzenli canlı hack etkinlikleri düzenliyor. Daha sonra ekipler sorunları doğruluyor, yeniden üretiyor ve gideriyor.
Güvenlik açıklarını kataloglama ve saldırı verilerini genişletme
Google ayrıca sosyal medya, basın açıklamaları, bloglar ve diğer kaynakları içeren açık istihbarat kaynakları üzerinden kamuoyuna açıklanan saldırıları izliyor. Yeni güvenlik açıkları bu kaynaklardan çıkarılıyor, ardından ürünlerin bunlardan etkilenmediğini doğrulamak için kurum içinde yeniden simüle edilip kataloglanıyor.
Her yeni güvenlik açığı, Google Trust, Security, & Safety ekipleri tarafından analiz ediliyor. Süreç; açığın yeniden üretilmesini, tekrarlanmadığının doğrulanmasını, saldırı tekniği ve etki kategorisiyle ilişkilendirilmesini ve ilgili sorumlulara atanmasını kapsıyor. Böylece test sonuçları ve dış kaynaklar, işlenebilir ve takip edilebilir bir listeye dönüştürülüyor.
Saldırılar keşfedilip arındırıldıktan ve kataloglandıktan sonra Google, yeni saldırıların kapsamını genişleten sentetik veriler oluşturmak için Simula aracını kullanıyor. Bu adım, eksiksizliği ve kapsamı geliştirmek, eğitim ve doğrulama için yeni veri kümeleri hazırlamak amacıyla bir saldırının birden çok varyantının oluşturulmasını sağlıyor. Blog yazısına göre bu süreç, sentetik veri üretimini %75 artırdı; böylece savunma modellerinin değerlendirilmesi ve yeniden eğitilmesi ile savunmaların etkinliğinin hesaplanıp raporlanmasında kullanılan veri kümesinin güncellenmesi desteklendi.
Savunmaları birden çok düzeyde güncelleme
Google tek bir koruma katmanına güvenmiyor. Kullanıcı onayı, URL temizleme ve araç zincirleme politikaları gibi deterministik savunmalar, yeni saldırılara basit yapılandırma güncellemeleriyle yanıt veriyor. Bu kontroller; temel araç çağrıları, URL temizleme ve araç zincirleme için ayarlar içeren merkezi bir politika motoru üzerinden yönetiliyor. Bu yapı, düzenli ifadeler kullanarak kötü amaçlı kalıpların kaldırılması gibi düzeltmelerin, makine öğrenimi modellerinin veya dil modellerinin güncelleme döngülerinden daha hızlı yapılmasına olanak tanıyor.
Makine öğrenimine dayalı savunmalar ise tespit edilen saldırıların varyantlarını içeren sentetik veriler kullanılarak yeniden eğitiliyor. Google bu verileri eğitim ve doğrulama kümelerine ayırıyor; böylece etkinlik, eğitimde kullanılmamış örnekler üzerinden ölçülüyor. Bu yaklaşım, eğitim ve test verilerinde tekrarlanabilirlik ve tutarlılık sağlamayı, aynı zamanda gelecekte tamamen otomatik model güncellemelerine ölçeklenebilecek bir yapı oluşturmayı amaçlıyor.
Dil modeli tabanlı savunmalar da sentetik veri örneklerine ve savunma etkinliği için üzerinde uzlaşılmış ölçümlere dayanarak sistem talimatlarının iyileştirilmesi yoluyla istem mühendisliğine tabi tutuluyor. Buna paralel olarak Google, Gemini modelini güçlendirmek için çalışıyor. Amaç, modelin verilerin içinde bulunan kötü amaçlı talimatları tanıma ve göz ardı etme, buna karşılık kullanıcı tarafından amaçlanan isteği yerine getirmeye devam etme becerisini geliştirmek. Şirket, bu sürecin Gemini'nin enjekte edilmiş talimatları tespit edip göz ardı etme becerisini geliştirdiğini ve olağan işlemler sırasında modelin verimliliğini etkilemeden saldırıların başarı oranını düşürdüğünü belirtiyor.
İyileştirmeleri uygulamadan önce etkinliği ölçme
Google yalnızca yeni kontroller eklemekle yetinmiyor; değerlendirmede tutarlılığı sağlamak için standartlaştırılmış bir varlık kümesi kullanarak Gmail ve Docs gibi Workspace özellikleri ile uygulamalarının bir bölümünde saldırıları simüle ediyor. Makine öğrenimi modelinin güncellenmesi veya bir dil modeli için istemin değiştirilmesi gibi belirli bir iyileştirmenin gerçek etkisini belirlemek için şirket, kapsamlı değerlendirmeyi savunma etkin durumdayken ve devre dışıyken çalıştırıyor.
Bu karşılaştırma, değişikliğin etkinliğini doğrulamak ve sürekli iyileştirme döngüsünü desteklemek için «önce ve sonra» ölçümleri sağlıyor. Google, IPI'ın doğasının; aracı uygulamalar ve veri kaynakları geliştikçe biçimi değişen bir soruna yönelik sabit bir çözüme güvenmek yerine, güvenlik araştırmalarını, otomatik işlem hatlarını ve gelişmiş modelleri bir araya getiren çok katmanlı bir savunma ve yinelenen bir süreç gerektirdiğini düşünüyor.