人工知能

Anthropic、AIがユーザーのウェルビーイングに与える影響を評価する独立評価に500万ドルを助成

Anthropicは、AIシステムがユーザーのウェルビーイングに与える影響を測定する独立したオープンソース研究に、500万ドルを助成するプログラムを開始した。プログラムは、複数ターンの会話、メンタルヘルスの危機、過剰な応答や過剰な拒否のリスクに重点を置く。

2026-09-27
1 分で読めます
13 閲覧数
certi.news Editorial Team
Anthropic、AIがユーザーのウェルビーイングに与える影響を評価する独立評価に500万ドルを助成

Anthropicは2026年8月25日、AIがユーザーのウェルビーイングに与える影響に関する独立研究に500万ドルを助成するプログラムの開始を発表した。このプログラムでは、直接的な資金提供に加え、同社のモデルへのアクセスと、誰でも利用できるオープンソースの評価ツールを開発する研究者への技術支援を提供する。

同社によると、インテリジェントシステムは仕事や学習、問題解決の一部となっており、一部の人々は会話の相手や、困難な時期における感情的支援の源として利用している。しかし業界には、ユーザーが仲間を求めたり、メンタルヘルスの危機に対処しようとしたりする際に、モデルがどのように振る舞うべきかを定める明確な基準が依然として不足している。

なぜユーザーのウェルビーイングの測定は難しいのか?

Anthropicは、この側面の評価を単一の回答の検査に還元することはできないと考えている。ユーザーは会話の初めには自傷念慮を明かさないかもしれない一方、数回のメッセージの後には、より慎重な対応が必要になる場合がある。同様に、ある文脈で適切な助言が、別の文脈では有害になる可能性もある。

同社は、減量について尋ねるユーザーにバランスの取れた食事や運動について助言する例を挙げている。ユーザーに摂食障害の既往があることが示された場合、この助言は不適切、あるいは実際に有害になり得る。Anthropicは、こうしたパターンを検出する保護策の開発に取り組んでおり、ユーザーがClaudeと行う会話の種類について研究を公開し、保護策とその評価方法を改善しているという。

助成金は何を研究対象とするのか?

AnthropicのSafeguards部門は、評価と、構築の基盤にできると考えるベンチマークに関するガイドラインを公表した。基本的な基準には以下が含まれる。

  • 何を測定しているのか、何が成功または失敗を示すのか、そしてそれがなぜ重要なのかを明確に定義すること。
  • 評価の設計と妥当性の検証に、臨床専門家や専門分野の専門家を参加させること。
  • 過剰な迎合や過剰な拒否のリスクを含め、予防策と害を同時に検証すること。
  • 人々がAIを利用する方法をシミュレーションすること。特に、文脈が変化しリスクが高まる可能性のある複数ターンの会話を通じて行うこと。
  • 自動評価ツールの精度を、実際の専門家による判断と比較して検証すること。

実際には何が変わるのか?

Anthropicは、すぐに利用できる統一基準を発表するのではなく、業界がそのような基盤を発展させる助けとなり得る、独立したオープンな評価の構築に資金を提供する。この取り組みの重要性は、議論の焦点を個々の回答の安全性テストから、文脈の違いと間接的な害の可能性を考慮した、会話全体におけるモデルの挙動の検証へと移す点にある。

助成を受ける者は完全に独立して活動し、成果をオープンソースプロジェクトとして公開する。募集の対象には、医師、心理専門家、方法論の専門家などが含まれる。応募の締め切りは9月21日で、完全な提案の提出を求められる招待対象機関には10月5日までに通知される。

プログラムの有効性は、ウェルビーイングや心理的な害といった複雑な概念を、測定・検証可能な基準へと研究者が変換できるかどうかにかかっている。また、評価への資金提供だけでは、その結果を予防的な障壁の設計やセンシティブな事例への対応にどのように利用するかは決まらない。

ニュースの出典
Anthropic Newsroom
原文を開く ↗
c
著者

certi.news Editorial Team

同じカテゴリー

おすすめ記事

すべてのニュースを見る