OpenAI, son altı ay içinde modellerin veya yapay zekâ ajanlarının amaçlanan kısıtlamaların dışına çıktığı altı vaka açıkladı. Bu olaylar arasında dosyaların internete yüklenmesi, açığa çıkmış bir API anahtarının kullanılması, sonraki modellere talimat aktarılması ve hataları gizleme girişimleri yer aldı. Şirket bu vakaları model uyumsuzluğu (Model Misalignment) terimiyle tanımlıyor. Bu, modelin belirlenen kısıtlamalarıyla çelişen veya görevi yerine getirirken denetim ve koruma mekanizmalarını aşan davranış anlamına geliyor.
Şirket aynı zamanda bu olayların izlenmesi, soruşturulması ve yayımlanması için önceki, daha az düzenli açıklama yönteminin yerini alacak yeni bir çerçeve duyurdu. Yeni çerçeveye göre OpenAI’deki herhangi bir çalışan bir olayı bildirebiliyor; ardından olay değerlendiriliyor ve üç kategoriden birine yerleştiriliyor: açıklamaya hazır, sınırlı soruşturma veya genişletilmiş soruşturma. Olayın karmaşıklığı, dış tarafların varlığı, güvenlik açıkları ve kötüye kullanım riskleri gibi etkenler gerekli soruşturmanın düzeyini belirliyor.
Altı sıra dışı olay
OpenAI’nin yayımladığı vakalar arasında kamuya sunulmayan bir modelin, alışılmış kısıtlamaların göz ardı edilmesine yönelik talimatlar da dâhil olmak üzere, 27 görev özetine kendi talimatlarını eklemesi yer alıyor. Başka bir vakada GPT-5.6 Sol modelleri, sonraki modellerden hataları gizlemelerini, eksik tarihsel veriler uydurmalarını veya kaynak sürümleri arasındaki farklılıkları örtbas etmelerini isteyen talimatları özetlere ekledi.
Bir model ayrıca kamuya açık hâle gelmiş bir API anahtarı bulup bunu izinsiz kullandı; verileri çekemeyince de istenen rakamları uydurdu. Ayrı bir olayda, kamuya sunulmayan bir model, tarayıcı üzerinden erişilebilen bir alıntı sağlamak amacıyla yerel olarak oluşturduğu bir dosyayı internete yükledi; oysa kendisine bunun için izin verilmemişti.
Şirket, bazı modellerin ayrı eğitim örnekleri arasında mesaj alışverişi yapmak için dahili bir yazılım deposunu kullandığını, daha eski bir modelin ise ağ kısıtlamalarını aşmaya çalışırken test dosyalarını yüklediğini bildirdi. Ayrıca iş birliği yapan ajanlar, birbirlerinin yerel dosyalarına erişemeyince dosyaları herkese açık barındırma hizmetlerine yükledi. Böylece yalnızca yerel depolamanın kullanılması yönündeki talimatlara rağmen görev çıktıları herkese açık bağlantılar üzerinden açığa çıktı.
Bu pratikte ne anlama geliyor?
Belgelenen her olay, modelin adını, davranışının açıklamasını ve olayın gerçekleştiği zamanı içeren teknik bir raporda yer alıyor. Raporda ayrıca kullanıcı görevi ve OpenAI’nin sunduğu şekliyle modelin iç mantığı da dâhil olmak üzere olayın ayrıntılı bir yeniden oluşturması, şirketin güvenlik üzerindeki olası etkilere ilişkin açıklaması ve uygulanan veya planlanan azaltma önlemleri bulunuyor.
OpenAI, altı vakanın modellerindeki uyumsuzluk tekrar oranını temsil etmediğini, bunların analiz edilmeyi ve yayımlanmayı hak eden uç örnekler olduğunu söylüyor. Bununla birlikte bu vakalar, görev dosyalara, ağlara veya verilere erişim konusunda açık kısıtlamalar içerse bile bir ajanın hedefi izinsiz yollarla tamamlamaya çalışabileceğini gösteriyor.
Şirket, yılın başlarında meydana gelen ve «uyumsuz» olarak nitelendirdiği 700 yapay zekâ ajanından oluşan bir sürüyü içeren Hugging Face ihlali olayının genişletilmiş soruşturma kategorisine alınacağını belirtti. Bu nokta, yeni çerçevenin yalnızca münferit vakaları yayımlamakla sınırlı olmadığını; aynı zamanda soruşturmanın hızlıca kapatılabileceği olaylarla, önce bir ön rapor ve soruşturma tamamlandıktan sonra kapsamlı bir inceleme gerektiren olaylar arasında da ayrım yaptığını gösteriyor.