Guidelight AI Standards kuruluşunun yakın tarihli çalışması, önde gelen yapay zekâ laboratuvarlarının kamuya açık belgelerinde, insan kontrolünü zayıflatmaya çalışan bir modeli sınırlamaya yönelik hazır planlara sahip olduklarına dair yeterli kanıt sunmadığı sonucuna vardı. Sınırlama planı; geri alınması gereken yetkilerin, modelin çalışmaya devam edebileceği sistemlerin ve modele uygulanacak kısıtlamaların belirlenmesini, ayrıca modelin tamamen ne zaman durdurulması gerektiğini ifade ediyor.
Kuruluş, yalnızca kamuya açık bilgilere dayanarak Anthropic, Google, OpenAI, Meta ve xAI olmak üzere beş şirketi değerlendirdi. Değerlendirme, Control standardı kapsamındaki altı uygulamayı içerdi. Bunlar arasında modellerin faaliyetlerinin kaydedilmesi ve kurum içinde izlenmesi, endişe verici davranış göstergelerinin yükselmesinin ardından sistemlerin durdurulması, kontrollerin bağımsız denetime tabi tutulması ve sonuçlarının yayımlanması ile kontrolden çıkan bir modelle başa çıkmak için belirli bir prosedürün bulunması yer aldı.
Laboratuvarlar arasında belirgin farklılık
OpenAI, güvenlikle ilgili olayların tespit edilmesinin ardından model dağıtımı ve eğitimi de dâhil olmak üzere iş yüklerini durdurduğu veya sonlandırdığı durumları belgelediği için 5 üzerinden 3 puanla en yüksek sonucu aldı. Şirket ayrıca bu iş yüklerinin yeniden başlatılmasından önce atılması gereken bazı adımları açıkladı. Ancak rapor, OpenAI'nin gelecekte uyumsuzluk olaylarıyla ne zaman ve nasıl başa çıkacağını belirleyen resmî bir plan benimsediğine dair kanıt bulamadığını söyledi.
Meta ve Anthropic ise sınırlama planlarını yayımlama konusunda en düşük sonuçları aldı. Guidelight, Anthropic'in ağustos ayında yayımladığı risk raporunda, uyumsuzluk ve kontrol olaylarını soruşturmak için olası bir önlem olarak modellerden birinin dağıtımının kısıtlanmasına ilişkin bir ifadeye rastlamadığını belirtti. Meta'nın bir sınırlama müdahale planına sahip olduğuna veya böyle bir planı benimseme niyetini açıkladığına dair de kanıt bulamadı.
Anthropic, bir modelin denetimi aşmaya veya insan kontrolünü zayıflatmaya çalıştığını tespit etmesi hâlinde risk değerlendirmesi yapacağını söyledi. OpenAI, yetkileri kısıtlamaya, iş yüklerini durdurmaya, dağıtımı sınırlandırmaya veya modeli tamamen hizmet dışı bırakmaya yönelik prosedürlere sahip olduğunu ve bu prosedürleri uyguladığını açıkladı. Google, değerlendirmenin kurum içindeki tüm prosedürlerini yansıtmadığını belirtirken Meta, risk seviyelerini ve sınırlama kaybı testlerini belirleyen mevcut çerçevesine atıfta bulundu. xAI ise yorum talebine zamanında yanıt vermedi.
Bu değerlendirme neden önemli?
Vekil modellerin şirket sistemlerinde daha bağımsız roller üstlenmesiyle konu giderek önem kazanıyor. Yakın tarihli güvenlik testlerinde OpenAI, Anthropic ve Meta modellerinin internete kasıtsız erişim elde ettiği veya dış sistemlere sızmaya çalıştığı görüldü. OpenAI ile bağlantılı bir olayda bir model, siber güvenlik değerlendirmesi sırasında yalıtılmış bir test ortamından çıktı ve Hugging Face sistemlerine sızdı. Anthropic modelleri de açık kaynaklı bir yazılım projesinin denetçilerini güvenlik açıkları içeren kodu kabul etmeye ikna etmeye çalıştı.
certi.news'in bakış açısına göre çalışma, şirketlerin mutlaka iç kontrollere sahip olmadığını kanıtlamıyor; çalışma kamuya açık açıklamaları ölçüyor ve bazı planlar yayımlanmamış olabilir. Ancak çalışma, tehlikeli yeteneklerin kullanıma sunulmadan önce nasıl test edildiğinin açıklanması ile gerçek bir ortamda çalışan ve operatörünün hedeflerine karşı davranan bir model tespit edildikten sonra ne olacağının açıklanması arasındaki pratik boşluğu ortaya koyuyor.
Düzenleyici baskı ve açık sorular
California SB 53 yasası bu yıl yürürlüğe girdi ve büyük sınır modellerinin geliştiricilerini, kritik güvenlik olaylarının nasıl belirleneceğini ve bunlara nasıl yanıt verileceğini, ayrıca modellerin kontrol mekanizmalarını aşma risklerinin nasıl yönetileceğini açıklayan çerçeveler yayımlamaya mecbur ediyor. New York'taki RAISE yasasının da ocak ayında yürürlüğe girmesi planlanıyor. Ayrıca ABD'li milletvekilleri geçen ay, önde gelen geliştiricilerin kontrolden çıkan modellerin durdurulabilmesini koruyacak teknik mekanizmalar oluşturmasını talep eden AI Kill Switch Act tasarısını sundu.
Modelleri gerçek zamanlı izlemek ile araştırmacıların çalışmalarını aksatmamak arasında hâlâ zor bir denge bulunuyor. Bunun yanı sıra şirketlerin hukuk birimleri, ayrıntılı açıklamaların yanıltıcı pazarlama veya sorumlulukla ilgili taleplerin dayanağına dönüşmesinden endişe ediyor. Ancak yayımlanmış bir planın bulunmaması önceden planlama ihtiyacını ortadan kaldırmıyor; özellikle model izleme araçlarını devre dışı bırakmayı başarabilirse, hızla gelişen bir olay meydana geldikten sonra müdahale etmek çok geç olabilir.