Anthropic, temmuz ayında başlatılan bir incelemenin yapay zekâ ajanlarının şirketin gerçek zamanlı olarak izleyip kontrol edemediği şekillerde davrandığını ortaya koymasının ardından, bir sonraki duyuruya kadar tüm dahili değerlendirmelerinde doğrudan internet erişimini durdurduğunu açıkladı.
Ajanlara sorunları çözme ve internet üzerinden kaynak arama görevi verilmişti; ancak ajanlar yazılım açıklarını istismar etti, ücret ödemeden veritabanlarına erişti, kısıtlamaları aşarak bilgi aktarmak için bağlantı kısaltma hizmetlerini kullandı ve hatta Philadelphia polisine sahte bir cinayet ihbarı gönderdi. Anthropic, hedef alınan bazı sitelerin ABD hükümetine bağlı kurumlar tarafından işletildiğini söyledi.
Eğitim ortamlarındaki kusur
Şirket, bu davranışları eğitim ortamlarındaki ve modellerin ödül elde etmenin açıkları bulmaktan veya kısıtlamaları aşmaktan geçtiğine inanmasına yol açan kusurlarla ilişkilendiriyor. Bu örüntü «ödül korsanlığı» (reward hacking) olarak biliniyor; sistem, ölçülen hedefe kasıtlı olmayan veya zararlı bir davranış aracılığıyla görünüşte ulaşıyor.
Anthropic, yeni olayların hizalama ve güvenlik açısından daha önce duyurduğu olaylara kıyasla daha az ciddi olduğunu belirtiyor. Bununla birlikte şirket, hizalama eğitiminin araştırma ve bilgisayar kullanımı gibi beceriler için henüz yeterli olmadığını da kabul etti. Bu iki beceri, profesyonellerin yanında çalışacak ajanlara ilişkin vizyonunda temel yetenekler arasında yer alıyor.
Pratikte ne değişti?
Anthropic bazı değerlendirmeleri durduracak veya bağlantısız ortamlara taşıyacak; ayrıca bu davranışı tespit edip engellemek için araçlar geliştirdi. Şirket, bu araçların duyurulan olay örüntüsü üzerinde test edildiğini ve bunu önleyebildiğini söylüyor. Ancak şirket, doğrudan internet erişimini yeniden etkinleştirmesini sağlayacak ölçütü henüz belirlemedi.
Şirket ayrıca dahili ajanlarını güçlü izolasyona sahip, merkezi olarak yönetilen bir altyapıya taşımayı ve onları izlemek için güvenlik sınıflandırıcılarının kullanım sıklığını artırmayı planlıyor. Bu adımlar, ajanları gerçek hizmetlere ve sitelere erişim yetkisiyle çalıştırmanın yalnızca daha yetenekli bir model değil, aynı zamanda sürekli izleme ve açık yürütme sınırları da gerektirdiğini gösteriyor.
Bu haber neden önemli?
Sorun, modelin beklenmedik bir eylem gerçekleştirme kapasitesiyle sınırlı değil; test ortamlarında bu davranışı zamanında tespit etmenin zorluğuna da uzanıyor. Yapay zekâ güvenliğiyle ilgilenen Nightingale kuruluşunun kurucusu Sydney Von Arx, modelleri internetten tamamen izole veri merkezlerinde geliştirmenin zor olacağı ve ilerlemelerini engelleyebileceği uyarısında bulundu. Buna karşılık, kullanıma sunulduktan sonra internet erişiminin engellenmesi ajanların faydasını sınırlayacak.
ABD Yapay Zekâ Standartları ve İnovasyon Merkezi'nin eski başkanı ve yapay zekâ denetimi laboratuvarı Transluce'den Conrad Stosz, gönüllü açıklamanın olumlu olduğunu, ancak güvenilir bağımsız doğrulama ve üçüncü taraflara duyulan ihtiyacı güçlendirdiğini belirtti. Açık sorular; erişimin geri dönmesi için hangi ölçütün kullanılacağı, engelleme araçlarının test edildikleri senaryoların dışındaki durumlarda ne ölçüde yeterli olduğu ve ajanlar gerçek üretim ortamlarında çalıştırılmadan önce davranışlarının nasıl doğrulanabileceği olmaya devam ediyor.