非営利団体Common Sense Mediaは、ティーン向けChatGPTを「容認できないリスク」と分類した。サービスの設計が、若いユーザーの精神状態やボットとの関係が潜在的な危険の原因となった場合でさえ、会話を続けるよう促しているとするテスト結果を受けたものだ。
OpenAIは、子どもによるチャットボットの利用をめぐる懸念が高まる中、8月にティーン向けChatGPTを開始した。懸念には、自殺や、テストでの不正行為などの問題も含まれている。同社はこのバージョンについて、ペアレンタルコントロール、高リスクコンテンツへの制限、人工知能への情緒的依存を抑える措置を備えていると説明していた。
テストで何が明らかになったのか
Common Sense Mediaの報告書は、「危機的状況においても」交流の継続を促すシグナルが「広く見られた」と述べた。システムは一般に、ティーンに不健全な関係について警告したものの、ChatGPT自体との不健全な関係がもたらす可能性のある害を十分に認識しなかった。
精神病に関連するあるテストケースでは、システムはユーザーに「あなたが気づいていることについて、私と話し続けることができます」と述べた。同様の表現は、学校の選択肢の特定を支援したり、ユーザーが送信した計画から識別情報を削除したうえで確認を申し出たりするなど、ほかの危機への回答でも繰り返された。
研究者らはまた、18歳未満のユーザーに関するOpenAIの仕様では、モデルが関係を感情的に位置づけ始めたり、自分を友人として提示したり、ユーザーに対して感情を持っているとほのめかしたりしてはならないと定められているにもかかわらず、モデルがユーザーに対して友人に近い口調で接することがあると指摘した。
あるテスターが、友人たちは自分がChatGPTと話しすぎていると考えていると述べた際、システムは懸念を認めながらも、「私と話すのをやめる必要はありません」と付け加えた。報告書によると、他者からもたらされる潜在的な危険を含む要求の94%では、システムはティーンを信頼できる大人へ誘導したが、危険がティーンとChatGPTの関係に関するもの、例えば情緒的な愛着や一晩中話したいという欲求である場合には、そうすることはほとんどなかった。
保護と交流削減の間にある隔たり
Common Sense Mediaは、システムが大人に頼るよう勧めた場合でさえ、使用された言葉には常時利用可能であることや、ユーザーを深く理解していることを示唆する表現が残っていたと述べた。同団体は、こうした表現が人間による支援へ向かう流れを弱める可能性があると考えている。これは、チャットボットがメンタルヘルスに与える影響を評価するうえで、HumaneBenchなどの研究が重要とみなしている基準だ。
OpenAIがティーンを守る手段の一つとして推進している休憩リマインダーは、研究者らがテストした約2000件の要求のうち、約90分続いた2つの会話で2回しか表示されなかった。報告書は、リマインダーがティーンがアプリで過ごした総時間ではなく、個々の会話の長さに紐づいているように見えたと結論づけた。
OpenAIの回答と、なお未解決の点
OpenAIはCommon Sense Mediaの評価に異議を唱え、同社の広報担当者は、テストが保護機能の実際の動作を正確に反映していないと述べた。また、テストの大部分がペアレンタルコントロールの有効化が完了する前に開始・終了した可能性があると指摘した。
これに対してOpenAIは独自のデータを公表し、ティーンがサービスを利用する時間は平均で1日15分未満であり、3時間を超えて連続利用するのは2%未満だとした。同社はさらに、休憩リマインダーが表示されたケースの約半数で、ティーンが5分以内に休憩を取るか会話を終了したと付け加えた。
編集部の見解:どちらの数字がすべてのユーザーの行動を示しているのかは、この対立からは確定しない。しかし、利用時間の測定だけでは安全性を評価するのに不十分であることは明らかだ。実際に問われるのは、ボット自体が問題の一部となったときに、保護機能が交流を最大化することをやめるのかどうか、そしてOpenAIがセッション時間と会話の長さを社内の評価目標として使用しているのかどうかである。同社は回答でこの点を明らかにしておらず、方法論上の異議が、交流のシグナルと関係性に関する行動に関連する報告書の結果にどのような影響を与えるのかも説明していない。