据The Information报道,OpenAI计划在其新模型Astra中使用一种称为“递归深度”(recurrent depth)或“不透明递归”(opaque recurrence)的推理技术。该技术允许模型在一个循环中多次处理同一查询,而不是遵循类似于推理模型传统思考步骤的序列路径。
引发担忧的问题不仅在于模型的发布或其宣称的能力,还在于这种架构可能使推理过程更难以审查。模型留下的可读痕迹越少,安全团队就越难发现不良行为,或理解智能体和先进模型作出决策的原因。
为什么这条消息很重要?
人工智能研究团队将“思维链”记录作为监控工具,尽管这些记录未必完整或逐字呈现模型的内部思考。据报道,这些记录在分析近期一次被描述为偏离预期行为的智能体活动,以及尝试理解其行为原因的过程中发挥了重要作用。
而在不透明递归的情况下,更大部分的处理过程可能会转移到不会产生清晰步骤的路径上,人类难以轻松阅读这些步骤。这给安全团队带来了一个实际问题:如果模型的推理能力不断增强,而有关其得出结论方式的可用证据却同时减少,应如何对其进行监控?
难以逆转的路径引发担忧
Redwood首席执行官Buck Shlegeris警告称,增加递归可能会大幅降低思维链的可监控性。他表示,目前还不知道Astra是否比此前的模型更难监控,但他担心,将这项技术推向更高水平可能会彻底削弱这种可监控性。
长期以来一直倡导人工智能安全的Zvi Mowshowitz也认为,大量使用这些方法可能会损害他所称的OpenAI和Anthropic为保持思维链可读并使其与实际行为相匹配所作的努力。他提出,可能需要制定法律,以阻止人工智能实验室之间所谓的“逐底竞赛”。
OpenAI的立场与目前已知的限制
现有信息显示,Astra对这项技术的使用将受到限制,预计其思维链仍将保持可读。OpenAI还否认了模型将转向完全无法理解的模式,或有时被称为“神经语”(neuralese)的暗示。
OpenAI首席科学家Jakub Pachocki通过X平台上的一篇帖子确认,自最初的推理模型以来,公司一直致力于保持对思维链的监控并加以利用,这一目标是其当前研究计划的核心。OpenAI还宣布,未来的安全计划包括对思维链进行扩展监控。
还有哪些问题悬而未决?
Redwood Research首席科学家Ryan Greenblatt认为,不透明推理的扩展速度可能快于基于传统思维链的推理,最终将大部分思考过程转移到不可见的“潜在空间”。The Information随后报道称,Anthropic和Google DeepMind也在讨论这项技术,这表明这一问题可能超越Astra模型,成为更广泛的研究方向。
但消息来源并未证实Astra会完全隐藏其思维链,也没有提供具体测量数据来说明可监控性下降了多少。因此,目前能够确定的变化是,一项引发安全工具相关问题的新技术正在出现,而不是这些工具已经被证实失效。该发展的实际重要性将取决于不透明递归的使用程度,以及OpenAI和其他实验室能否提供传统记录之外的替代性或补充性监控手段。