Reflection AI 宣布推出 Beam,这是该公司首款开放权重人工智能模型,明确专注于编程、推理以及由人工智能代理执行的任务。该模型采用稀疏混合专家架构(Sparse Mixture-of-Experts),总计包含5010亿个参数,但在处理每个令牌时只有230亿个参数处于激活状态。
公司表示,Beam 预训练使用了从网络内容和获得授权的专有数据集中提取的23.8万亿个令牌。该模型还提供100万个令牌的上下文窗口,旨在处理长篇文档和长期任务。除预训练外,Reflection AI 还大规模采用了强化学习,以提升模型性能。
密集训练与对推理成本的关注
在强化学习阶段,公司运行了10,500个 Nvidia GB300 图形处理单元,持续四周,并生成了超过1亿次 rollout。训练和评估中使用的 sandbox 操作次数约为13亿次。
Reflection AI 将推理效率置于其对 Beam 的宣传核心。根据公司的测试,该模型在高级推理测试中的表现接近 Z.ai 的 GLM-5.2,同时在推理过程中使用的计算能力减少了三至四倍。不过,这些结果尚未经过独立验证,公司也承认,更大的开放模型(例如 Kimi K3)在某些情况下的原始性能优于 Beam。
编程结果与推理工作量控制
Reflection AI 表示,Beam 在 SWE Bench Pro v2-Hard 中获得77.2分,在 Terminal Bench v2.1 中获得80.1分,在 SWE Bench Verified 中获得80.9分。公司称,该模型可与 GLM-5.2 竞争,并且在某些任务中接近更大的 Qwen 模型,但并未声称在所有测试中都超过竞争对手。
Beam 包含一个推理工作量(reasoning effort)参数,允许用户设定分配给推理的计算时间。较低级别会生成更短、成本更低的回答,而较高级别则允许模型使用更多令牌来处理复杂任务。
实际会发生什么变化?
这意味着,Beam 的价值不仅取决于模型规模或最高基准成绩,还取决于回答质量与生成回答所需资源之间的平衡。这可能有利于运行编程任务或依赖频繁调用模型的代理的开发者和机构。不过,实际收益仍将取决于独立测试结果、基础设施成本以及权重和工具的提供条件。
Beam 是纯文本模型,并非多模态模型。在获得工具使用能力和网络访问权限后,它可以搜索不同来源,并利用外部工具提供的信息。Reflection AI 表示,在训练期间,该模型学会了使用其他语言模型,并在能够访问网络时调用 OCR 接口来读取文档。
可用性与更广泛的战略
该公司面向企业、开发者和政府机构,并将 Beam 描述为一种可用于日常工作负载的实用模型。这一计划属于 Reflection AI 构建其所谓“人工智能工厂”的方向,使机构能够针对自身数据定制系统并在本地运行这些系统。
Reflection AI 于2024年由 Google DeepMind 的前研究人员创立,并筹集了约47亿美元投资,参与方包括 Nvidia、Sequoia Capital 和 Lightspeed Venture Partners。其上一轮融资前估值约为250亿美元。公司计划在完成安全测试和最终评估后,于10月发布 Beam 的权重、技术报告、模型卡和开发者工具。