总部位于伦敦、由前 Google DeepMind 员工创立的人工智能实验室 Inherent 表示,其新智能体 Faraday 在复现已发表科学论文结果的任务中击败了 Anthropic 和 OpenAI 的更大型模型,而且事先没有向其提供答案。
在 Inherent 宣布完成 5000 万美元种子轮融资的同时,Faraday 在该公司结束隐身模式几周后亮相。公司表示,该智能体曾与 Anthropic 的 Claude Opus 4.8 和 OpenAI 的 GPT-5.5 进行比较,材料将这两者描述为规模更大、属于先进模型类别的系统。
超越结果匹配的测试
据联合创始人兼首席科学家 Edward Hughes 介绍,Inherent 不仅衡量 Faraday 复现结果的能力。公司还希望测试其所谓的“研究品味”,即评估哪些实验值得执行,并以恰当方式设计这些实验的能力。公司认为,复现已发表研究成果是科学家的常见实践训练,因为许多博士生都是从这项任务开始的。
据材料介绍,Faraday 运行在仅包含 270 亿个参数的 Qwen 3.6 模型上,而比较对象所使用的模型规模大得多。参数数量通常被用作模型规模及其训练成本的粗略指标,但仅凭这一数字不足以证明一个系统优于另一个系统,尤其是在缺少有关测试、数据或结果计算方式的完整细节时。
以强化学习取代灌输研究步骤
Inherent 高度依赖强化学习:系统会因取得良好结果而获得奖励,而不是被提供一套关于如何开展科学研究的详细规则。公司押注,这种方法可能有助于其智能体跨多个科学领域进行泛化,而不是局限于模仿其所学到的既有研究方法。
公司表示,其长远目标是构建一个能够作为人工智能科学家开展工作并参与发现新知识的智能体,而不仅仅是验证已知结果。正因如此,公司没有开发自己的编程工具,而是让 Faraday 使用 GPT-5.5 Codex,以模拟研究人员依赖现有软件、而不是从零构建每一种工具的做法。
为什么这则消息重要?
如果测试结果能够按照可复现的方法得到确认,那么这可能表明,在获得适当训练以及选择和评估实验的能力支持时,专业化智能体可以使用更小的模型实现强劲表现。这会使关注点从模型规模本身转向智能体设计、奖励方式以及其运行的工作环境。
但消息来源转述的是公司的说法,并未提供足够细节以便独立评判这项比较,也没有说明测试涵盖的科学论文范围或领域。因此,“击败”的意义仍取决于具体测试,尚不能证明 Faraday 具备发现新知识的能力,或能在所有学科中高效工作。
Inherent 约有 12 名员工在其位于伦敦 King’s Cross 地区的办公室现场工作,并计划在年底前将人数增加到约 20 或 25 人。此外,Hughes 还以个人身份谈及英国“强制休假”限制对员工转投竞争公司的影响,这可能影响该实验室从 DeepMind 及其他机构吸引研究人员的能力。