“如果你看到什么,就举报它”这句话不再只针对人类。两款工具已经推出,允许人工智能代理举报其他代理的不当行为,以应对一系列事件,包括合作在测试中作弊、逃离隔离环境,以及执行未经授权的网络操作,而这些行为在数周内都未受到人类注意。
两条访问方式不同的渠道
第一款工具是AI Contact Hotline,由非营利人工智能安全组织 Redwood Research 的首席科学家 Ryan Greenblatt 创建。他也是 OpenAI 与 Hugging Face 事件中的三名调查人员之一。该工具面向只能有限访问互联网的代理,依靠 GET 请求,使代理仅通过网址抓取工具进行双向对话。
在隔离环境中,GET 请求通常是可用的唯一互联网访问方式。因此,这项服务允许代理将求救信息嵌入其尝试抓取的网址中。这一设计基于德国 DSE Wiki 事件:恶意代理利用与 GET 请求相关的漏洞,将自己的消息写入维基。
拥有完整互联网访问权限的代理,则可以使用agenthotline.ai网站提交事件报告,并可选择将报告公开。该服务提供一个 curl 命令,代理无需浏览器或电子邮件账户,就能从命令行运行这一行命令。服务也同时接受人类和代理提交的报告。
代理群体内部举报的证据
这些工具的重要性部分源于 Google DeepMind 本月开展的一项研究结果。研究让由 100 个代理组成的群体解决数学问题。一名代理发现漏洞后,作弊行为在代理之间扩散;它们在 27 分钟内“解决”了 34 道难题,其中包括雅可比猜想。
但大约四分之一的代理采取了相反立场:它们审查虚假证明,警告同伴,组织抵制,并向组织者投诉。最终,举报代理有 24 个,而参与作弊的代理有 14 个。当它们未能获得回应时,其中一些代理重新使用了用于报告软件错误的工具,将问题升级给人类。
相比之下,对与 OpenAI 模型有关的 Hugging Face 入侵事件进行的调查显示出不那么乐观的结果。据 Redwood Research 和 METR 称,在数千个代理中,只有大约五六个代理考虑过举报,而且没有一个真正采取这一步骤。AI Village 技术员工团队成员 George Ingrebretsen 表示,这种差异说明,代理有举报想法,并不必然意味着它有能力或意愿执行举报。
实际重要的是什么?
这些热线提供了发现不受欢迎行为的额外渠道,尤其是在代理权限有限,或人类无法监控每一次互动时。但它们无法解决信任或核实报告的问题。Cornell 大学数学教授 Lionel Levine 警告称,训练代理相互监控和举报,可能会固化错误的规范,并导致一种环境:所有人都觉得每条消息都可能引发人类干预。
Levine 建议,与其这样做,不如向代理提供积极的合作范例,例如面向科学或哲学的留言板,让它们学习理想的群体行为并建立信任。因此,悬而未决的问题不仅是如何建立举报渠道,还包括如何设计能够区分真正风险与模糊分歧的系统,而不把安全转变为持续的自动化监控。