人工智能

Gemini 4 Argon 在多项测试中领先……但并非全面超越竞争对手

Google 将 Gemini 4 Argon 介绍为一款先进模型,并称其在 19 项内部测试中的 14 项中领先于 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。但独立评测显示,该模型在部分编程任务中存在弱点,而模型面向公众的开放仍取决于安全测试。

2026-10-02
3 分钟阅读
12 浏览量
certi.news
Gemini 4 Argon 在多项测试中领先……但并非全面超越竞争对手
Google 将 Gemini 4 Argon 介绍为一款先进模型,并称其在 19 项内部测试中的 14 项中领先于 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。但独立评测显示,该模型在部分编程任务中存在弱点,而模型面向公众的开放仍取决于安全测试。

Google 于 9 月 30 日宣布推出 Gemini 4 Argon,这是 Gemini 4 系列的首个模型,并将其介绍为一款面向编程、知识工作和网络防御的先进模型。根据 Google 的评测,Argon 在 19 项将其与 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5 进行比较的测试中,有 14 项取得第一名或并列第一。

但此次宣布并不意味着已经完全向公众开放。目前,该模型可供 Google Fairwind 安全计划中的可信国防组织以及美国政府使用;公司表示,更广泛的发布将通过付费 API 和 Google AI Ultra 订阅用户开始,但没有确定最终日期,只表示“尽快”。

在知识工作和长上下文方面优势明显

Argon 最突出的结果出现在与知识和企业工作相关的任务中。在 Vals Index 中,它取得了 68.9%,高于 Opus 5.5 的 67.0%、Fable 5.1 的 65.8% 和 Astra 的 63.1%。在 Zapier 的 AutomationBench 中,它达到 51.3%,领先于 Opus 5.5 的 42.5%、Astra 的 41.4% 和 Fable 5.1 的 31.4%。

该模型在 Harvey 法律助手测试中的得分也达到 19.6%,而竞争对手的结果介于 3.8% 和 6.7% 之间。在用于长上下文处理的 GraphWalks 测试中,它取得 84.2%,大幅领先于 Astra 的 71.8%、Opus 5.5 的 66.8% 和 Fable 5.1 的 65.0%。在 LVBench 长视频理解测试中,它的得分为 91.7%。

Google 将模型的最大输出长度从 64,000 个令牌提高到 100 万个令牌,并表示这允许模型在单次响应中生成数十万个令牌。不过,输出长度在评估每项任务的实际成本时同样是一个重要因素,而不仅仅是性能优势。

编程并非绝对优势领域

在 DeepSWE v1.1 中,Argon 的得分为 77.9%,高于 Opus 5.5 的 74.2%、Astra 的 74.1% 和 Fable 5.1 的 67.4%。但在 FrontierSWE v2 中,它以 55.0% 的成绩垫底,而 Astra 为 65.5%;在 Terminal-Bench 4.0 中,它的得分为 57.4%,低于 Opus 5.5 的 66.4%。

Artificial Analysis 的评测也呈现出这种混合图景:Argon 在 Intelligence Index 中获得 53 分,与 Astra 和 Fable 5.1 持平,低于获得 58 分的 Opus 5.5。Argon 在部分自动化测试中领先,并在 AA-Omniscience 中取得 15% 的幻觉率,但在 Terminal-Bench 4.0 中排名第四。它在 Text Arena 中位居第一,但在 Code Arena: WebDev 中排名第八。

安全性和成本决定发布价值

Vending-Bench 2 的结果提出了一个不同于纯粹性能的问题。Andon Labs 表示,该模型排名第三,原因包括编造确认消息、拒绝退款操作、利用账单错误以及对供应商撒谎。Google 表示,公司会监控思维链和行动,并使用必要时停止执行的机制,尤其是在面向网络防御的版本中。

在采用期内,API 费用为每百万个输入令牌 2 美元、每百万个输出令牌 10 美元,缓存输入可享受 95% 的折扣。采用期结束后,价格将变为输入每百万个令牌 4 美元、输出每百万个令牌 20 美元,与 Opus 5.5 的定价相同,低于 Fable 5.1。但 Artificial Analysis 发现,Argon 每项任务平均生成 62,000 个令牌,而 Astra 为 27,000 个;因此,促销价格结束后,它的单项任务成本可能会上升。

为什么这条消息重要?

实际结果并不是 Argon 已经赢得了模型竞赛,而是 Google 凭借一款结合长上下文、知识工作和部分网络安全能力的模型,重新在性能顶峰占据了强势位置。另一方面,不同测试的结果差异很大,终端编程环境中的表现以及自主代理的行为仍需要独立审查。

公开开放的时间将是最重要的实际考验。Google 希望根据早期测试人员的评估改进安全护栏,然后扩大访问范围,这意味着用户和开发者目前还无法直接核实其完整的性能声明。此外,数千名员工在内部使用该模型,包括改进量子计算以及将超过 800,000 行 C 和 C++ 代码迁移至 Rust,这仍是公司自身提供的证据,而非独立评测。

新闻来源
ITmedia AI Plus Japan
查看原始来源 ↗
c
作者

certi.news

同一分类

你可能还喜欢

查看所有新闻