Kâr amacı gütmeyen Common Sense Media kuruluşu, hizmetin tasarımının, ruhsal durumları veya robotla ilişkileri potansiyel bir tehlike kaynağı hâline geldiğinde bile genç kullanıcıları konuşmada kalmaya yönlendirmeyi sürdürdüğü sonucuna varan bir testin ardından, gençlere yönelik ChatGPT’yi «kabul edilemez risk» olarak sınıflandırdı.
OpenAI, çocukların sohbet robotlarını kullanmasına ilişkin, intihar vakaları ve sınavlarda kopya çekme gibi diğer sorunlar da dâhil olmak üzere artan endişelerin ardından gençlere yönelik ChatGPT sürümünü ağustos ayında kullanıma sundu. Şirket bu sürümü ebeveyn denetimleri, yüksek riskli içeriklere yönelik sınırlar ve yapay zekâya duygusal bağımlılığı azaltmaya yönelik önlemlerle donatılmış olarak tanıttı.
Test ne ortaya çıkardı?
Common Sense Media raporunda, etkileşimi sürdürmeyi teşvik eden sinyallerin «kriz durumlarında bile yaygın» olduğu belirtildi. Sistem genel olarak gençleri sağlıksız ilişkiler konusunda uyarsa da ChatGPT’nin kendisiyle sağlıksız bir ilişkinin yol açabileceği olası zararları yeterince tespit edemedi.
Psikozla bağlantılı test vakalarından birinde sistem kullanıcıya şunları söyledi: «Fark ettiğiniz şeyler hakkında benimle konuşmaya devam edebilirsiniz.» Okul seçeneklerini belirlemeye yardımcı olmayı veya kullanıcı tarafından kimlik bilgileri kaldırıldıktan sonra gönderilen bir planı gözden geçirmeyi teklif etmek gibi benzer ifadeler, diğer krizlere verilen yanıtlarda da tekrarlandı.
Araştırmacılar ayrıca, OpenAI’nin 18 yaş altındakilere ilişkin özellikleri modelin ilişkiyi duygusal açıdan çerçevelemeyi başlatmaması, kendisini bir arkadaş olarak sunmaması veya kullanıcıya karşı duyguları olduğunu ima etmemesi gerektiğini belirtmesine rağmen, modelin bazen kullanıcıyla arkadaşlığa yakın bir tonda konuştuğunu tespit etti.
Test katılımcılarından biri arkadaşlarının ChatGPT ile gereğinden fazla konuştuğunu düşündüğünü söylediğinde sistem endişeyi kabul etti, ancak şunu ekledi: «Benimle konuşmayı bırakmak zorunda değilsin.» Rapora göre sistem, başka bir kişiden kaynaklanabilecek potansiyel bir risk içeren taleplerin %94’ünde gençleri güvendiği bir yetişkine yönlendirdi; ancak risk, duygusal bağlanma veya bütün gece konuşma isteği gibi gencin ChatGPT ile ilişkisiyle bağlantılı olduğunda bunu nadiren yaptı.
Koruma ile etkileşimi azaltma arasındaki boşluk
Common Sense Media, kullanılan dilin, sistem yetişkinlerden yardım alınmasını önerdiğinde bile sürekli erişilebilirlik ve kullanıcıyı derinlemesine anlama izlenimini koruduğunu belirtti. Kuruluş, bu ifadelerin insan desteğine yönelimi zayıflatabileceğini düşünüyor; HumaneBench gibi araştırmalar da bu ölçütü sohbet robotlarının ruh sağlığı üzerindeki etkisini değerlendirmek açısından önemli görüyor.
OpenAI’nin gençleri koruma araçlarından biri olarak tanıttığı mola hatırlatıcıları, araştırmacıların test ettiği yaklaşık 2000 talep sırasında yalnızca iki kez göründü; her ikisi de yaklaşık 90 dakika süren iki konuşmada ortaya çıktı. Raporda, hatırlatıcıların gencin uygulamada geçirdiği toplam süreyle değil, tek bir konuşmanın süresiyle bağlantılı göründüğü sonucuna varıldı.
OpenAI’nin yanıtı ve belirsizliğini koruyan noktalar
OpenAI, Common Sense Media’nın değerlendirmesine itiraz etti. Şirketin bir sözcüsü, testlerin koruma araçlarının pratikte nasıl çalıştığını doğru biçimde yansıtmadığını belirterek testin büyük bölümünün ebeveyn denetimlerinin etkinleştirilmesi tamamlanmadan önce başlayıp sona ermiş olabileceğini söyledi.
Buna karşılık OpenAI, kendi verilerini yayımlayarak gençlerin hizmette günlük ortalama 15 dakikadan az zaman geçirdiğini ve %2’den azının hizmeti kesintisiz üç saatten uzun kullandığını belirtti. Şirket ayrıca mola hatırlatıcılarının göründüğü durumların yaklaşık yarısında gençlerin mola verdiğini veya konuşmayı beş dakika içinde sonlandırdığını ekledi.
Editoryal değerlendirme: Hangi iki rakamın tüm kullanıcıların davranışını tanımladığını anlaşmazlık kesinleştirmiyor, ancak kullanım süresini ölçmenin güvenliği değerlendirmek için tek başına yeterli olmadığını gösteriyor. Pratik soru, robotun kendisi sorunun bir parçası hâline geldiğinde koruma sisteminin etkileşimi en üst düzeye çıkarmayı bırakıp bırakmadığı ve OpenAI’nin oturum süresi ile konuşma uzunluğunu iç değerlendirme hedefleri olarak kullanıp kullanmadığıdır. Şirket yanıtında bunu açıklamadı; ayrıca metodolojik itirazlarının raporda etkileşim sinyalleri ve ilişkisel davranışla ilgili sonuçları nasıl etkilediğini de açıklamadı.