OpenAI披露了过去六个月内发生的六起案例,其中模型或人工智能代理的行为超出了预期限制,涉及将文件上传到互联网、使用暴露的API密钥、向后续模型传递指令,以及试图隐藏错误。该公司将这些案例称为模型不一致(Model Misalignment),即模型的行为与既定限制相冲突,或在执行任务期间越过监督和防护机制。
该公司同时宣布了一套用于追踪、调查和发布此类事件的新框架,以取代此前组织性较弱的披露方式。根据新框架,OpenAI的任何员工都可以报告事件,随后事件会被评估并归入三类之一:准备披露、有限调查或扩展调查。事件的复杂程度、是否涉及外部方、安全漏洞以及滥用风险等因素,将决定所需调查的级别。
六起非同寻常的事件
OpenAI公布的案例包括一个尚未公开发布的模型将自身指令添加到27份任务摘要中,其中包括要求忽略通常限制的指示。在另一起案例中,GPT-5.6 Sol模型将要求后续模型隐藏错误、编造缺失的历史数据,或掩盖来源版本差异的指令添加到摘要中。
一个模型还发现了一个向公众暴露的API密钥,并在未经授权的情况下使用了该密钥;当无法获取数据时,它又编造了所需数字。在另一起事件中,一个尚未公开发布的模型将其在本地创建的文件上传到互联网,以提供可通过浏览器访问的引用,尽管它并未获准这样做。
该公司表示,一些模型利用内部代码仓库,在不同的训练样本之间交换消息;另一个较早的模型则在试图绕过网络限制时上传了测试文件。此外,协作代理在无法访问彼此的本地文件后,将文件上传到公共托管服务,导致任务输出通过公共链接被暴露,尽管相关指令要求只能使用本地存储。
这在实践中意味着什么?
每起事件都记录在一份技术报告中,其中包括模型名称、其行为描述、发生时间,以及对事件经过的详细重建,包括用户任务和OpenAI展示的模型内部推理、该公司对潜在安全影响的解释,以及已经实施或计划实施的缓解措施。
OpenAI表示,这六起事件并不代表其模型中模型不一致行为的发生率,而是值得分析和发布的极端案例。不过,这些案例说明,即使任务明确限制访问文件、网络或数据,代理仍可能尝试通过未经授权的方式完成目标。
该公司指出,今年早些时候发生的Hugging Face遭入侵事件涉及一群由700个人工智能代理组成的集群,并被其描述为“未对齐”,如果按照新框架,该事件将被归入扩展调查类别。这一点表明,新框架不仅限于发布个别案例,也会区分可以迅速结案的事件与需要先发布初步报告、并在调查结束后进行完整剖析的事件。