Anthropic 于2026年9月17日发布了一项提议,用于衡量先进实验室内部人工智能开发的速度。该提议出发于公司所称的一个缺口:公众和政府目前无法观察这些实验室内部究竟发生了什么,以及模型在多大程度上已经开始帮助构建后续几代模型。报告没有宣布新模型或新产品,而是提出三组实验性指标,并展示了 Anthropic 在2026年的一组内部运营数据。
这些指标关注研发对人工智能的依赖程度、公司监督执行半自主任务的代理的能力,以及计算资源如何在能力开发与安全研究之间分配。Anthropic 认为,这些指标可以补充 Responsible Scaling Policy 中发布的能力测试和风险报告,并可能帮助今后建立可在不同实验室之间进行比较的透明度承诺。
人工智能开发在多大程度上依赖 Claude?
Anthropic 创建了一个名为 Anthropic R&D Automation Index 的初步指标。其方法是列出与模型有关的研发工作,评估每项任务的自动化程度,并根据分配给该任务的人力时间为其计算权重。这项评估采用了 Epoch AI 开发的量表,范围从 AL0(人工智能不参与)到 AL5(系统完全自主运行且无需人工干预)。
截至2026年8月,在已测量的任何研发工作类别中,Claude 都没有实现完全自主运行。但按照 AL4 的定义,Claude 主导了约26%的此类工作;也就是说,在获得一般性指令并接受人工监督的情况下,它能够端到端完成大部分任务。此外,在 AL3 或更高水平上有人工智能参与的工作占比超过了90%;在这一水平上,系统会在密切的人工指导下承担任务的大部分环节。
为生成这一指标,公司根据2026年7月的工作记录和内部文件,建立了一张包含约1.5万项详细任务的地图,随后将其整理成一棵包含542个节点的树,其中378个是叶节点。根据方法论附录,评估模型的判断与人工判断完全一致的比例为59%,而人工与人工之间的完全一致率为35%;在97%的案例中,各判断之间的差异不超过一个等级。不过,Anthropic 承认,“协作”和“主导”之间的界限仍可能存在不同判断。
监控约3万个代理
公司称,在2026年8月,其使用最广泛的内部平台上,任何时候约有3万个代理在执行研究和工程工作。该系统包括在行动执行前进行实时监控,以及在行动发生后分析行为的事后监控。这些代理100%的行动都在执行前经过实时监控,通常耗时数秒;100%的行动也都被纳入事后监控。
Anthropic 分析了这些研究和工程代理在8月作出的超过10亿个决策,发现实时监控拦截了0.002%的决策,即约每4.7万个决策中拦截一个。事后监控则会对每千次对话或活动中的约一至两次标记出来,以便进行额外审查。一个由多个分类器组成的系统会处理大多数标记;每周约有50起案例被升级给人工审查员。公司表示,被拦截行动的人工审查会在一周内完成。
这些数字并不意味着风险已经消失;它们衡量的是一个特定的内部平台和有限的监控时期,而且随着代理数量增加,发现罕见行为的重要性也会提高。Anthropic 承认,这项监控实验持续了数月而非数年,并不能保证获得关于未知行为的完整图景。
用于安全的计算资源
Anthropic 检查了2026年7月13日至20日期间的计算资源使用情况,将工作负载划分为不同类别,然后估算安全研究在研发计算资源中的占比。在此期间,约6%的研发计算资源用于安全工作;如果只考察由人工智能主导的研发所使用的计算资源,这一比例则上升至约12%。
公司将这些估算描述为保守估计,因为没有计入同等服务于能力和安全的工作,也没有包括保障措施分类器所使用的计算资源。公司强调,这一占比并不是衡量安全工作投入的完整指标,因为该领域的研究可能更多依赖研究人员的时间,而不是运行计算密集型实验。此外,这项测量反映的只是一个星期,不能证明存在时间趋势。
为什么这一框架重要?
这项提议的核心价值并不只在于当前数字,而在于试图把人工智能的发展从只有实验室才能看见的主题,转变为可以通过可比较指标追踪的过程。如果各实验室公布研究自动化比例、监控覆盖率、审查时间、升级率以及用于安全的计算资源占比,就有可能比较这些指标随时间发生的变化,甚至比较不同公司之间的差异。
但 Anthropic 自身也指出了几个根本性限制:目前还不存在共同的方法论;一些评估依赖公司自身的模型;而“裁判”可能会重复其所审查系统的错误。此外,安全工作分类依赖于定义,不同实验室或监管机构可能以不同方式划定边界;与此同时,一些计算资源标签来自自动化数据或未经完全核实的用户输入。
公司表示,计划向多个独立评估机构提供可进行比较的访问权限,以便核实安全实践并监测事故和相关指标。因此,真正发生变化的是出现了一个透明度原型和一组可供讨论的内部数据,而不是已经建立了具有约束力的全球标准。这一想法能否成功,将取决于定义的统一、外部验证的开放,以及在不披露敏感竞争数据的情况下明确哪些内容可以公开。