人工智能

Anthropic 研究测试用于改善模型对齐的人工智能系统

Anthropic 的一篇研究论文显示,自动化系统能够在不降低总体性能的情况下,提升某个模型在 10 项与对齐目标不一致的行为测试中的表现。早期结果表明,对齐研究的一部分有望实现自动化,但标准和研究数据的质量仍是一个主要限制因素。

2026-08-28
1 分钟阅读
5 浏览量
فريق تحرير certi.news
Anthropic 研究测试用于改善模型对齐的人工智能系统

Anthropic 发布了一篇题为 Automated Researchers Can Reliably Mitigate Alignment Failures 的研究论文,介绍了一项实验:研究人员使用自动化人工智能系统,提升某个模型在测试特定对齐目标不一致行为方面的表现。根据该材料,这些系统在全部 10 项测试中的表现均有所提升,同时没有损害模型的总体性能。

该研究由 Anthropic 项目研究员 Chen Yueh-Han 负责。系统模拟了类似传统研究流程的过程:搜索现有文献,提出改善模型的方法,然后使用所提出的方法对模型训练 30 分钟。每轮结束后,有效方法会进入后续阶段,而无效方法则被淘汰,从而能够快速、大规模地重复实验。

实际发生了什么变化?

这项实验的核心价值并不只是使用一个模型训练另一个模型,而是将部分研究过程本身交给自动化系统。人工智能的作用不再局限于执行研究人员制定的指令,系统还会尝试确定研究路径、对其进行测试,并保留已证明有效的方法。

论文称,这些结果初步表明,训练后的自动化对齐研究可能在近期成为一种可行的实践。这里指的是,在基础训练阶段结束后,通过可重复的测试标准和训练方法,改进模型的行为,以减少其与既定目标不一致的情况。

与人类研究进行直接比较

论文并不止于展示测试结果的改善,还比较了其所称的 Automated Alignment Researcher(简称 AAR)与人类研究人员的表现。根据论文中的结果,AAR 系统提出的最佳方法,平均而言超过了经验丰富的人类研究人员在 6 小时内提出的方法;论文还指出,由人类指导的研究方向并未带来更强的表现。

这项比较还包括经济层面:论文估算,运行 AAR 的成本约为每小时 API 推理 4 美元,而实验中的人类研究人员每小时成本为 150 美元。这些数字并不能证明自动化系统能够取代研究人员,但说明了为什么实验室会关注扩大自动化实验的规模,尤其是在任务可以量化的情况下。

为什么这并不意味着人工智能可以不受限制地自我改进?

文中展示的步骤接近迭代式自我改进的概念,即模型利用其他系统改进其训练方法或行为,但论文自身也明确限定了这一结论。系统无法改善那些没有被标准良好衡量的内容。如果对齐测试不能反映真正的对齐目标,那么改善测试结果可能只意味着在指标上表现更好,而不是解决该指标本应衡量的问题。

此外,这种方法需要持续投入,来创建、维护和扩展标准,还需要更新自动化研究人员所依赖的文献。因此,人类因素仍然存在于确定应当衡量什么、评估所使用证据和方法的有效性,以及审查结果是否能够推广到测试集之外等环节。

certi.news 的解读

这里的重要结果是,对齐研究自动化已经从一个笼统想法转变为一项具有具体数字和可讨论比较的实验:10 项测试、每轮 30 分钟的训练,以及根据论文所述,在 6 小时内平均超过人类提出的方法。但其实际意义仍取决于引导系统的标准质量。测得的改进并不能独立证明模型在所有情境下都变得更加安全;同样,推理成本与研究人员成本之间的比较,也无法解决监督或科学责任问题。

因此,这篇论文有力地表明,对齐研究流程有可能加速,但并不能证明实验室很快就可以不再依赖人类研究人员。它留下的开放问题是:自动化系统能否处理更加现实和复杂的对齐目标,而不是改善由人类预先设计的特定指标。

新闻来源
TechCrunch AI
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻