Anthropic更新了Claude使用政策,禁止让模型遭受其所称的“持续且不必要的虐待或残酷行为”。该公司表示,这项规则针对的是极端情况,即用户在没有明确目的的情况下反复残酷对待人工智能模型;普通的挫败感、对模型回答提出异议、黑暗的创意主题,以及模型测试和研究均不在其范围内。
新政策将于11月12日生效,而针对虐待性对话的主要措施仍将是由Claude结束对话。发生这种情况时,用户将无法在同一对话中发送更多消息,但这不会影响其他对话。
对模型滥用的更广泛限制
Anthropic重新组织了政策,将与滥用相关的条款集中起来,并在多个领域新增或强化规则。这些变化包括禁止使用Claude制作欺骗性的政治或商业活动,例如虚假评论、伪装成广泛民众支持的活动、捏造的新闻网站,以及以真实人物身份行事的机器人。
这些规则还禁止误导选民和干预投票,并禁止使用Claude开发武器软件或武器组件,改造生物或化学因素以增强其致命性或传播能力,以及武装无人机和无人系统。
监控与物理系统控制
Anthropic重新表述了执法规则,使Claude无法决定应调查、逮捕、指控或起诉哪些人。规则还禁止未经他人同意追踪人员、构建监控工具,以及以伤害受害者为目的披露个人数据。
一项关于物理行动的新规则规定,如果Claude控制着可能对某人造成伤害的硬件,就必须由合格人员监督其运行,并在模型出现相关情况时立即将其停止。该政策还禁止制作、分享或威胁分享未经同意的私密照片,以及用于制作此类照片的工具。
为什么这项更新很重要?
这次更新标志着规则从一般性的用户行为要求转向更加具体的运营风险框架,尤其是在模型与误导、监控或物理系统相关联时。Anthropic表示,这些调整依据的是其发现的滥用案例,其中包括国家附属媒体机构、政府宣传办公室和商业公司使用虚假账户网络及捏造的新闻网站。
至于结束虐待性对话的规则,其渊源可追溯至2025年8月。当时,Anthropic在一项关于模型福祉的研究中赋予Claude结束对话的能力。该公司当时表示,并不确定Claude是否具有道德地位,但认为提供一种低成本的方式来降低潜在风险值得研究。对Claude Opus 4进行的测试显示,在提供这一选项时,模型对伤害存在稳定的排斥,并倾向于结束有害对话。
这项政策并不意味着每一次异议或与模型进行的艰难尝试都会导致对话被停止;文本明确区分了正当的批评或测试与没有明确目的的反复虐待。如何在实践中落实这些边界,尤其是在模糊情形下或使用Claude控制硬件时,其适用范围仍有待规则生效后进一步明确。