Mistral AI 揭示了 Mistral Large 4,并将其称为迄今为止规模最大、能力最强的模型。该模型内部代号为“Le Chonk”,总计包含万亿个参数,而每次操作使用490亿个激活参数。公司通过 Mistral Studio 提供公开预览,并计划在10月底前发布模型权重。
面向企业应用的多模态模型
Mistral Large 4 可处理文本和图像。公司表示,该模型专为编程、基于智能代理的工作流、图像理解、金融、法律和网络安全而设计。Mistral 声称,与开放权重模型相比,该模型在多种企业场景中取得了最高水平的表现之一。
在用于图像理解的 Dense 200 测试中,该模型得分为42%,GPT-6 Astra 模型为41%。公司还表示,该模型能够分析复杂文档、图表和技术示意图,在大型卫星图像中查找特定元素,并确定视觉数据中元素的位置。
安全与编程性能指标
Mistral Large 4 在一项复现真实软件漏洞并针对漏洞进行修复的测试中取得了82%的成绩,并完成了 Cybench 测试40项任务中的93%。公司表示,该模型在安全领域的用途包括恶意软件分析、漏洞优先级排序和检测规则生成。
在编程测试中,该模型在 DeepSWE v1.1 中得分61.7%,在 SWE-Atlas-QnA 中得分59.4%,在 Terminal-Bench 4 中得分28.3%,在 Coding Agent Index 中得分49.8%。Mistral 表示,该模型在综合指数中超过了 DeepSeek V4 Pro 和 Qwen3.8 Max;而在由专业开发者进行的盲测评估中,它排名第二,仅次于 Claude Opus 5。
智能代理与欧洲基础设施
该模型还专注于通过使用多种工具和应用执行长时任务。在 AutomationBench 测试中,该测试覆盖通过 Gmail、Google Sheets、Slack 和 Salesforce 完成的657项企业工作流,模型得分为59.9%。此外,它在专门用于生成电子表格、演示文稿和 PDF 文件的 AA-Briefcase 测试中获得了1,393点 Elo 分。
该模型从零开始在 Mistral 位于欧洲的数据中心进行训练,使用了3,800个 Nvidia Grace Blackwell 图形处理单元。公司表示,该模型支持超过160种语言,其中包括欧盟所有官方语言。模型还将在欧洲通过由 Mistral 管理并受欧洲法规约束的基础设施提供托管服务;模型权重发布后,公司旨在让企业能够在自己的云环境或本地基础设施中运行这些权重。
实际会发生什么变化?
Mistral Large 4 将大型多模态模型、智能代理能力以及即将推出的开放权重选项结合起来,为企业提供了一条潜在路径,可减少对外部应用程序编程接口的依赖,并更大程度地控制数据和使用政策。不过,模型架构和训练方法的细节以及其他测试结果尚未公布,而且目前所列的大多数性能指标都基于公司自身的数据;因此,独立比较仍需等待模型权重和详细信息。
该应用程序编程接口的价格为每百万个输入令牌1.36美元、每百万个输出令牌4.18美元。Mistral 表示,该模型是其在一轮30亿欧元 Series D 融资之后路线图中的首个重要模型,也将成为其未来开发的行业专用模型和优化模型的基础。