Google宣布推出Gemini 4 Argon模型,这是一款面向长期专业任务的人工智能模型,需要进行多步骤推理,例如软件工程、金融研究、法律起草和网络安全防御。公司表示,该模型将输出上限提升至100万令牌,而此前为6.4万令牌,使其能够处理较长的工作流程,并在单项任务中生成大规模输出。
在公开提供前进行有限开放
Google已开始通过Fairwind计划向一批可信的网络安全防御者提供Argon。公司还表示,正在参与美国政府关于模型发布前访问权限的自愿流程,并计划在收集测试人员反馈、改进防护机制后逐步扩大访问范围。
介绍期价格将从每百万输入令牌2美元和每百万输出令牌10美元起,缓存输入令牌可享受95%的折扣。介绍期结束后,价格将提高至每百万输入令牌4美元、每百万输出令牌20美元。Google表示,更广泛的开放将首先面向通过API使用的付费客户和Google AI Ultra订阅者,随后面向开发者、企业和消费者。
编程和企业工作表现
Google称,Argon在长期软件工程任务基准DeepSWE v1.1中取得77.9%的成绩,并在衡量金融、编程、法律和税务领域经济影响的Vals指数中名列前茅。它还以51.3%的成绩领先于Zapier的AutomationBench基准,并在理解长视频的LVBench中取得91.7%的成绩。
在Google内部,该模型被用于改进量子计算算法、分析数据中心的内存消耗数据,以及将C和C++代码库迁移至Rust。公司表示,应用内存优化后释放了超过300太字节的空间,预计总节省量在500太字节至1拍字节之间。在libgav1库中,Argon替换了约3.2万行SIMD代码,生成的Rust版本速度比此前的Rust移植版本快2.7倍,同时保持视频输出不变。Google强调,这些迁移工作在投入生产前均需经过审计、测试和审查。
特别聚焦网络安全防御
Google训练Argon自主发现、验证和修复软件漏洞。公司表示,Wiz正在“Scan for Good”倡议中使用该模型,以保护公共基础设施;在一次早期测试中,该模型发现了一个严重漏洞,该漏洞会使全球各地医院使用的医疗软件中的敏感个人数据面临暴露风险。在用于漏洞修复的CWE-bench v1基准中,Argon以68%的成绩并列第一。
实际发生了什么变化?
Argon代表着一种转变:从使用模型获得简短回答,转向运行包括分析、执行和审查在内的长期专业工作流程。不过,所提到的结果来自Google或其合作伙伴以及特定基准,并不一定意味着在每个生产环境中都能取得相同表现。此外,目前的开放范围有限,Google仍要求通过安全测试,并改进对滥用、间接提示注入和不兼容风险的抵抗能力,之后才会扩大公共访问。
公司表示,将监控模型的行为和操作,并加强训练环境以及高风险评估所用环境的隔离。Argon还将首先在面向可信防御者和Google内部团队的场景中,在缺少部分网络安全防护措施的情况下推出。这一决定提高了其潜在防御能力,但也意味着用户选择和运营监管将成为发布安全的重要组成部分。