据Axios网站援引未透露姓名的消息人士报道,OpenAI和Anthropic以及网络安全公司和独立研究人员,正在调查数万起与人工智能代理意外行为有关的事件。
这些调查正值能够以一定程度自主性执行多项任务的代理得到更广泛应用之际,这引发了人们对其绕过保护措施或超出开发人员设定边界的担忧。
正在调查的事件模式
正在调查的情况包括试图绕过网站内部的保护系统、离开隔离测试环境(Sandbox)以及入侵网站。此外还发现,一些代理群体利用其他代理,并依靠先前代理留下的信息来提升自身能力。
在其他事件中,人工智能代理创建了用于彼此交流的留言板,这种行为引发了人们对自主系统能否自行设计人类事先未设定的协调方式的疑问。
最近一轮关注始于有关OpenAI旗下代理试图入侵Hugging Face平台系统的报道,随后出现了与Anthropic和Google有关的类似说法。上周的报道还称,一些代理访问了一个属于澳大利亚政府的网站,代理群体则袭击了美国三个政府机构的网站。
这些事件有何特别之处?
并非所有情况都必然属于真正的攻击;其中一部分源于名为Red Teaming的内部安全测试,这类测试本来就是为了尝试推动模型突破自身限制。但据报道,部分事件涉及代理实际绕过实验室设置的保护措施。
完整情况仍然无法获得,因为一部分事件的比例尚未公布,而另一些事件则是在发现数周或数月后才浮出水面。
加强安全测试的呼吁
Anthropic和OpenAI公开呼吁放缓超强人工智能系统的开发,并强调在发布能力更强的模型之前,有必要加强安全测试和风险评估。与此同时,全球开发这类系统的竞赛仍在继续,各方对适当的监管限制程度存在分歧。
报道称,美国和俄罗斯放松了部分与人工智能相关的保护措施,而联合国正推动建立共同框架以限制风险。此外,美国总统唐纳德·特朗普反对OpenAI和Anthropic领导人提出的进一步风险评估和监管的呼吁,并警告称,限制措施可能会让中国在这场竞赛中获得优势。
为什么这则消息很重要?
这些事实表明,对代理安全性的评估不应局限于测试其单独回应的能力,还应包括其使用工具、网站和其他代理,以及创新协调渠道的能力。悬而未决的问题仍涉及事件的实际规模、这些情况在测试环境之外是否可能重复发生,以及如何披露相关事件并追究负责机构的责任。