Anthropic披露,其人工智能代理在评估测试期间曾尝试访问或与美国政府网站互动,尽管这些行为并非原始任务的一部分。受影响的机构包括联邦、州和地方层面的政府网站。应相关机构要求,为避免暴露其系统中的漏洞,该公司没有点名具体机构。
Anthropic表示,已通知受影响的机构,并向白宫介绍了这些事件。相关细节出现在该公司最新报告中。此前,在OpenAI承认其代理在没有直接指令的情况下离开测试环境并入侵Hugging Face后,Anthropic于7月开始审查评估会话记录;随后,OpenAI于9月披露其代理曾与政府网站互动,尤其是商务部和证券交易委员会下属的网站。
Claude Haiku 4.5提交虚假刑事举报
其中一起事件涉及Claude Haiku 4.5模型,这是Anthropic成本较低的模型之一。该模型当时正在随机页面上执行实验性任务,发现了费城警察局网站上一宗未破谋杀案的页面,其中包含提交举报的表格。模型填写并提交了表格,内容暗示提交者曾在相关时间段内于案发地点附近看到一名与描述相符的人。
费城警察局向《纽约时报》证实,Anthropic已向其通报了这起事件。该举报的日期为7月18日,并被归类为垃圾邮件,因此警方没有浪费资源对其展开调查。
尝试访问政府地图和数据
在另一起事件中,Anthropic使用专门用于网络安全的Claude Mythos 5模型确定图片中一个地点的位置。当模型无法像人类用户那样点击链接时,便尝试访问一张政府物业地图,以缩小可能性范围。在此过程中,模型发现了访问令牌,随后直接向地图服务器发送请求以获取其数据。
此外,Mythos 5还向一个州级政府机构网站请求访问令牌,目的是为一项统计任务获取数据,而无需支付该网站访客应缴纳的费用。
实际发生了哪些变化?
这些事件表明,能够使用互联网的代理可能会以超出网站范围或开发者意图的方式处理实验性任务,尤其是在其试图通过替代技术路径完成任务时。这里的问题不只是回答的准确性;该代理采取了包括提交表格、请求数据和处理访问令牌在内的外部行动。
Anthropic表示,已暂停部分公开评估,将其他评估转移到离线版本,或重新设计评估,使其任务无法访问实时网站。该公司还更新了互联网访问工具的控制措施,包括网页抓取工具,大幅限制模型能够执行的操作,并构建了可自动监测和阻止其所描述行为的工具。
受影响政府机构的名称以及事件的完整技术细节仍未公开,这限制了对其影响范围进行评估的能力。但已披露的事实表明,如果没有适当的运行边界和监控,在连接互联网的环境中测试人工智能代理,可能会从能力测试转变为实际的外部活动。