Anthropic, 25 Ağustos 2026'da yapay zekânın kullanıcıların refahı üzerindeki etkisine ilişkin bağımsız araştırmaları finanse etmek için 5 milyon dolar değerinde bir hibe programı başlattığını duyurdu. Program, herkesin kullanabileceği açık kaynaklı değerlendirme araçları geliştiren araştırmacılara doğrudan finansman, şirketin modellerine erişim ve teknik destek sağlayacak.
Şirket, akıllı sistemlerin iş, öğrenme ve problem çözmenin bir parçası hâline geldiğini, bazı insanların ise bunları zor zamanlarda sohbet arkadaşı veya duygusal destek kaynağı olarak kullandığını söylüyor. Ancak sektör, kullanıcı arkadaşlık aradığında veya bir ruh sağlığı kriziyle başa çıkmaya çalıştığında modellerin nasıl davranması gerektiğini belirleyen net standartlardan hâlâ yoksun.
Kullanıcı refahını ölçmek neden zor?
Anthropic, bu boyutun tek bir yanıtı incelemeye indirgenemeyeceğini düşünüyor. Kullanıcı, konuşmanın başında kendine zarar verme düşüncelerini açıklamayabilir; daha temkinli bir yanıt ihtiyacı ise birkaç mesaj sonra ortaya çıkabilir. Benzer şekilde, bir bağlamda uygun olan tavsiye başka bir bağlamda zararlı olabilir.
Şirket, kilo verme hakkında soru soran bir kullanıcıya dengeli beslenme veya egzersizle ilgili verilen tavsiyeyi örnek gösteriyor; kullanıcıda yeme bozuklukları geçmişi olduğu anlaşılırsa bu tavsiye uygunsuz veya fiilen zararlı hâle gelebilir. Anthropic, bu kalıpları tespit etmek için güvenlik önlemleri geliştirmeye çalıştığını ve bu önlemleri ve değerlendirme yöntemlerini iyileştirmek amacıyla kullanıcıların Claude ile yaptığı konuşma türleri hakkında araştırmalar yayımladığını söylüyor.
Hibeler neleri araştıracak?
Anthropic'teki Safeguards yönetimi, üzerine inşa edilebileceğini düşündüğü değerlendirmeler ve referans ölçütler için yönergeler yayımladı. Temel ölçütler şunları içeriyor:
- Neyin ölçüldüğünü, başarının veya başarısızlığın neyi ifade ettiğini ve bunun neden önemli olduğunu açıkça belirlemek.
- Değerlendirmenin tasarımına ve geçerliliğinin doğrulanmasına klinik uzmanları ve uzmanlık alanı profesyonellerini dâhil etmek.
- Aşırı uyum ve aşırı reddetme riskleri de dâhil olmak üzere, önlemleri ve zararları birlikte test etmek.
- İnsanların yapay zekâyı kullanma biçimini, özellikle bağlamın değiştiği ve riskin tırmanabildiği çok turlu konuşmalar üzerinden simüle etmek.
- Otomatik değerlendirme araçlarının doğruluğunu gerçek uzmanların kararlarıyla karşılaştırarak doğrulamak.
Pratikte ne değişiyor?
Anthropic, hazır ve tek tip bir standart açıklamıyor; bunun yerine sektörün böyle bir temel geliştirmesine yardımcı olabilecek bağımsız ve açık değerlendirmelerin oluşturulmasını finanse ediyor. Adımın önemi, tartışmayı tek tek yanıtların güvenliğini test etmekten, bağlam farklılıklarını ve dolaylı zarar ihtimalini dikkate alarak modelin tam bir konuşma boyunca sergilediği davranışı incelemeye taşımakta yatıyor.
Faydalanıcılar tamamen bağımsız çalışacak ve çalışmalarını açık kaynaklı projeler olarak yayımlayacak. Çağrı; doktorlar, psikiyatri uzmanları, metodoloji uzmanları ve diğerleri arasından uzmanları hedefliyor. Başvuru için son tarih 21 Eylül; tam teklif sunmaya davet edilen kuruluşlara ise 5 Ekim'e kadar bildirim yapılacak.
Programın etkililiği, araştırmacıların refah ve psikolojik zarar gibi karmaşık kavramları ölçülebilir ve doğrulanabilir ölçütlere dönüştürme becerisine bağlı olmaya devam ediyor. Ayrıca değerlendirmelerin finanse edilmesi, sonuçların koruyucu bariyerlerin tasarımında veya hassas durumlarla başa çıkmada nasıl kullanılacağı konusunu tek başına çözmüyor.