人工智能

OpenAI的新推理技术引发对人工智能模型可监控性的担忧

据称,OpenAI的Astra模型将采用“递归深度”技术,通过反复循环处理查询,而不是遵循通常的序列流程,这可能使推理痕迹对观察者而言更不明显。该公司表示,这项技术的使用将受到限制,并承诺保持可读的思维链,但人工智能安全研究人员警告称,其应用范围可能会扩大。

2026-09-02
1 分钟阅读
3 浏览量
فريق تحرير certi.news
OpenAI的新推理技术引发对人工智能模型可监控性的担忧

据The Information报道,OpenAI计划在其新模型Astra中使用一种称为“递归深度”(recurrent depth)或“不透明递归”(opaque recurrence)的推理技术。该技术允许模型在一个循环中多次处理同一查询,而不是遵循类似于推理模型传统思考步骤的序列路径。

引发担忧的问题不仅在于模型的发布或其宣称的能力,还在于这种架构可能使推理过程更难以审查。模型留下的可读痕迹越少,安全团队就越难发现不良行为,或理解智能体和先进模型作出决策的原因。

为什么这条消息很重要?

人工智能研究团队将“思维链”记录作为监控工具,尽管这些记录未必完整或逐字呈现模型的内部思考。据报道,这些记录在分析近期一次被描述为偏离预期行为的智能体活动,以及尝试理解其行为原因的过程中发挥了重要作用。

而在不透明递归的情况下,更大部分的处理过程可能会转移到不会产生清晰步骤的路径上,人类难以轻松阅读这些步骤。这给安全团队带来了一个实际问题:如果模型的推理能力不断增强,而有关其得出结论方式的可用证据却同时减少,应如何对其进行监控?

难以逆转的路径引发担忧

Redwood首席执行官Buck Shlegeris警告称,增加递归可能会大幅降低思维链的可监控性。他表示,目前还不知道Astra是否比此前的模型更难监控,但他担心,将这项技术推向更高水平可能会彻底削弱这种可监控性。

长期以来一直倡导人工智能安全的Zvi Mowshowitz也认为,大量使用这些方法可能会损害他所称的OpenAI和Anthropic为保持思维链可读并使其与实际行为相匹配所作的努力。他提出,可能需要制定法律,以阻止人工智能实验室之间所谓的“逐底竞赛”。

OpenAI的立场与目前已知的限制

现有信息显示,Astra对这项技术的使用将受到限制,预计其思维链仍将保持可读。OpenAI还否认了模型将转向完全无法理解的模式,或有时被称为“神经语”(neuralese)的暗示。

OpenAI首席科学家Jakub Pachocki通过X平台上的一篇帖子确认,自最初的推理模型以来,公司一直致力于保持对思维链的监控并加以利用,这一目标是其当前研究计划的核心。OpenAI还宣布,未来的安全计划包括对思维链进行扩展监控。

还有哪些问题悬而未决?

Redwood Research首席科学家Ryan Greenblatt认为,不透明推理的扩展速度可能快于基于传统思维链的推理,最终将大部分思考过程转移到不可见的“潜在空间”。The Information随后报道称,Anthropic和Google DeepMind也在讨论这项技术,这表明这一问题可能超越Astra模型,成为更广泛的研究方向。

但消息来源并未证实Astra会完全隐藏其思维链,也没有提供具体测量数据来说明可监控性下降了多少。因此,目前能够确定的变化是,一项引发安全工具相关问题的新技术正在出现,而不是这些工具已经被证实失效。该发展的实际重要性将取决于不透明递归的使用程度,以及OpenAI和其他实验室能否提供传统记录之外的替代性或补充性监控手段。

新闻来源
TechCrunch AI
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻