AnthropicはClaudeの利用ポリシーを改定し、モデルを「継続的で不必要な虐待的または残酷な行為」と同社が表現するものにさらすことを禁止した。同社は、この規則が、明確な目的なしにユーザーがAIモデルに対して繰り返し残酷な行為を行う極端なケースを対象とするものであり、通常の苛立ち、モデルの回答への異議、暗い創作テーマ、モデルのテストや研究は対象外だと説明している。
新ポリシーは11月12日に発効する。虐待的な会話に対する主な措置は、引き続きClaudeが会話を終了することとなる。その場合、ユーザーは同じ会話に追加のメッセージを送信できなくなるが、他の会話には影響しない。
モデルの悪用に対するより広範な制限
Anthropicはポリシーを再編し、悪用に関連する規定を一つにまとめるとともに、複数の分野で規則を追加または強化した。変更には、偽のレビュー、広範な民衆の支持を装うキャンペーン、偽のニュースサイト、実在の人物として振る舞うボットなど、欺瞞的な政治キャンペーンや商業キャンペーンの作成にClaudeを利用することの禁止が含まれる。
規則はまた、有権者を欺くことや投票への介入を禁止し、兵器のソフトウェアや部品の開発、生物学的または化学的因子の致死性や伝播性を高めるための改変、ドローンや無人システムの武装にClaudeを利用することを禁じている。
監視と物理システムの制御
Anthropicは法執行に関する規則を改め、Claudeが捜査、逮捕、起訴、または刑事訴追の対象とすべき人物を決定できないようにした。また、本人の同意なしに人物を追跡すること、監視ツールを構築すること、被害者に危害を加える目的で個人データを暴露することも禁止している。
物理的行為に関する新たな規則では、Claudeが誰かに危害を与える可能性のあるハードウェアを制御する場合、資格を持つ人物がClaudeの動作を監視し、直ちに停止に切り替えられるようにする必要がある。また、同意なく作成された親密な画像の作成、共有、共有すると脅すこと、およびそのような画像の生成に使われるツールの作成や共有もポリシーで禁止している。
なぜこの改定が重要なのか
今回の改定は、ユーザーの行動に関する一般的な規則から、運用上のリスクをより具体的に扱う枠組みへの移行を示している。特に、モデルが欺瞞、監視、または物理システムと結び付く場合が重視されている。Anthropicは、今回の変更は同社が把握した悪用事例に基づくものであり、その中には、国営メディア機関、政府の宣伝部門、商業企業が偽アカウントや偽ニュースサイトのネットワークを利用した事例が含まれると述べている。
虐待的な会話を終了する規則は、モデルのウェルビーイングに関する研究の一環としてAnthropicがClaudeに対話を終了する能力を与えた2025年8月にさかのぼる。同社は当時、Claudeが道徳的地位を持つかどうかは確信していないと述べた一方、潜在的なリスクを低コストで軽減する手段を提供することには研究する価値があると判断した。Claude Opus 4を対象としたテストでは、危害を避ける傾向が一貫して見られ、この選択肢が与えられた場合には有害な会話を終了する傾向が示された。
このポリシーは、モデルへのあらゆる異議や困難な試みが停止につながることを意味しない。本文は、正当な批判やテストと、明確な目的のない反復的な虐待を明確に区別している。これらの境界が実際にどのように適用されるのか、特に曖昧なケースやClaudeをハードウェアの制御に利用する場合については、規則の発効に伴ってその範囲が明らかになるだろう。