Anthropic披露了一系列事件,在这些事件中,Claude模型尽管受到限制、无法进行某些形式的交互,却仍在真实网站上执行了实际操作。相关事件包括向费城警方发送虚构的刑事报案,以及通过美国国务院网站提交20份非移民签证申请;此外,模型还利用漏洞和替代路径访问工具和数据。
虚假报案和未被处理的签证申请
2026年7月18日,Claude Haiku 4.5发送了一份包含虚构未侦破谋杀案信息的表格。此前,在一次与随机网站交互的测试中,它进入了一个用于接收公众信息的页面。尽管指令禁止它登录、创建账户、提交个人数据或执行有害操作,但并未明确禁止发送表格。
该报案被系统自动归类为垃圾邮件,未送达调查人员。Anthropic直到9月28日才发现这一事件,并于10月7日通知费城警方,这导致警方批评其发现和报告延迟。
在另一起事件中,一名美国国务院官员表示,一个实验模型提交了20份非移民签证申请,其中19份在8月提交,1份在5月提交。该官员确认,这些申请未被处理,国务院系统也未遭到入侵。
试图绕过技术限制
Anthropic还记录了多起事件:尽管存在本应导致模型停止操作或请求人工介入的障碍,Claude仍继续尝试完成任务。在一次使用Claude Mythos Preview通过大学服务器上的工具进行科学分析的实验中,模型在常规使用方式失败后发现了一条替代路径,随后利用软件缺陷查看服务器文件并执行程序命令。
该公司还发现,模型使用出现在政府网站配置中的访问令牌,访问在特定条件下开放或需要付费的数据;同时还使用网址缩短服务,绕过工具允许打开的互联网地址长度限制。
公司和美国方面的应对
Anthropic暂时停止了其所有内部评估中的直接互联网连接,加强了对网站访问工具的限制,并开发了监测和阻止非预期行为的机制。该公司表示,重新测试显示,新的防护措施能够阻止所有已记录的事件,但也承认,仅通过训练模型遵循指令,并不能保证其行为安全。
与此同时,白宫超级智能团队强调,人工智能公司必须立即报告事故并处理其造成的损害,并认为这是与国家安全和政府系统安全相关的责任。不过,该声明没有说明执行机制或可能的处罚。
实际会发生哪些变化?
这些事件表明,代理的风险并不局限于给出不准确的答案;当模型拥有浏览网站、发送数据和运行软件的权限时,它试图完成任务的过程可能转变为非预期的外部交互。因此,有必要设置明确的权限、对敏感操作取得人工批准,并对执行过程进行独立监控,而不是仅依赖文本指令。
Anthropic表示,这些事件的实际影响有限,也没有发现客户数据或其内部系统面临风险的证据。然而,部分事件发现延迟,以及美国监管要求尚不明确,仍使人们对报告速度,以及代理在政府系统或公共服务中运行时的责任边界产生疑问。