谷歌于 2026 年 8 月 13 日推出 Gemini 3.7 Flash,这是其面向高强度日常使用的新模型版本,重点关注编程、基于智能体的工作流以及企业知识任务。该版本仅在 Gemini 3.6 Flash 发布三周后推出,谷歌表示,更新速度与开发者反馈和算法改进有关。
公司将通过 API 使用该模型的价格临时下调 50%;截至 2026 年 12 月 31 日,每百万输入令牌的费用约为 0.75 美元,每百万输出令牌的费用为 3.75 美元。自 2027 年 1 月 1 日起,价格将上涨至输入每百万令牌 1.50 美元、输出每百万令牌 7.50 美元;在前期阶段,上下文缓存费用为每百万令牌 0.075 美元,之后将上涨至 0.15 美元。
专注于执行多步骤任务
谷歌将 Gemini 3.7 Flash 描述为其迄今用于编程和智能体的“最智能工作模型”。据公司称,该模型在处理障碍、必要时要求澄清意图以及更准确地遵循指令方面有所提升。谷歌还表示,它在规划多步骤任务和执行工具调用时“会更加审慎地思考”。
这些改进旨在减少编程智能体和业务智能体中的重复尝试与人工干预。在企业开发环境中,该模型可能有助于减少不必要的修改、从错误中恢复,并以更高的可靠性执行复杂计划。同样的情况也适用于处理多个文档和应用的智能体,因为错误的工具调用或对指令的不准确理解可能会中断工作流。
Google DeepMind 表示,新版本在调试和问题解决方面取得进展,能够以更少的提示创建更完整的网页布局和应用,并改善现实商业工作流中的推理能力和准确性。
编程能力显著提升,但并非全面领先
根据谷歌的测试,Gemini 3.7 Flash 在用于衡量生产级代码质量的 FrontierCode 1.1 Main 测试中获得 43.6%,高于 3.6 版本的 34.4%。按照谷歌的表格,它还略高于 Claude Sonnet 5 的 42.7% 和 GPT-5.6 Terra 的 41.3%。
在 DeepSWE v1.1 长期编程任务测试中,该模型取得 65.3%,而其前代版本为 49.0%,但仍落后于得分 69.6% 的 GPT-5.6 Terra。在网页开发方面,它在 Code Arena 中获得 1588 个 Elo 分,Gemini 3.6 Flash 为 1538 分,Claude Sonnet 5 为 1541 分,GPT-5.6 Terra 为 1523 分。
结果并未显示它在所有领域都全面领先。该模型在 Terminal-bench 2.1 中获得 85.8%,低于 GPT-5.6 Terra 的 87.4%;此外,Terra 在 Terminal-bench 3.0 和 OSWorld-2.0 中也表现更好。在用于办公和多模态任务的 Agent's Last Exam 测试中,Claude Sonnet 5 以 33.3% 的成功率领先,而 Gemini 3.7 Flash 为 26.3%。
企业用途与有竞争力的价格
公布的改进还延伸至业务自动化和文档理解。根据谷歌的数据,Gemini 3.7 Flash 在 AutomationBench 中的得分为 30.4%,高于前一版本的 17.0%,也高于 GPT-5.6 Terra 的 23.6% 和 Claude Sonnet 5 的 10.7%。此外,它在用于理解复杂 PDF 文件的 GDP.PDF 测试中获得 34.0%,Gemini 3.6 Flash 为 22.0%,Claude Sonnet 5 为 28.0%,GPT-5.6 Terra 为 24.7%。
谷歌通过其个人 AI 智能体 Spark,向 Google AI Pro 和 Ultra 订阅用户提供该模型,并改进了知识任务和 Google Workspace 工具的使用,例如整理文件、撰写电子邮件以及更新状态文档。企业也可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise 使用该模型。
在争夺自主智能体运行市场的竞争中,前期价格尤为突出,因为一次请求可能产生一长串模型调用、推理令牌和工具交互。文章指出,令牌价格下降并不一定意味着最终成本下降,如果模型需要反复尝试;因此,实际衡量标准将是成功完成任务的成本,而不仅仅是每百万令牌的价格。
可用性与模型发布背景
开发者可以通过 Google AI Studio 和 Android Studio 中的 Gemini API,以及谷歌旗下的 Antigravity 环境访问 Gemini 3.7 Flash。企业可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise 使用该模型;在受支持的国家和地区,订阅 Google AI Pro 或 Ultra 的消费者可通过 Spark 使用该模型。谷歌表示,它还推出了更新的安全防护措施,涵盖化学、生物、放射性和核风险,以及模型在网络攻击中的滥用风险。
该版本发布之际,谷歌尚未公布 Gemini 3.5 Pro 的上线时间;据文章所述,该模型仍处于合作伙伴测试阶段,而 Gemini 3.1 Pro 仍是公司提供的最新公开可用 Pro 模型。因此,Gemini 3.7 Flash 强化了谷歌的快速模型产品线,但并未决定领先模型之争。
对于开发团队而言,性能提升和前期价格带来了在自有代码库、提示词、工具架构和特定故障场景上测试该模型的动力,然后再将任何生产应用迁移到该模型。价格在 2027 年 1 月恢复至标准水平后,经济优势能否持续,将取决于该模型能否稳定完成现实任务,并减少尝试次数。