Meta宣布推出人工智能模型Muse Spark 1.3,其主要改进集中于编程、长期代理任务以及复杂的多步骤工作流。该模型自2026年9月3日起通过编程工具Muse Code和Meta Model API提供,距离Muse Spark 1.2发布约一个月。
Meta将这一新版本描述为其迄今能力最强的模型,但这一表述仍是公司方面的描述,并不意味着它在所有测试或使用场景中都表现更优。
更强的长期任务管理能力
Muse Spark 1.3旨在处理单次长对话中的多项任务。当被赋予开放式目标时,它可以使用工具构建所需上下文,发现并修正工作计划中的缺失之处,然后将执行过程中学到的信息传递到最终结果中。
Meta还表示,该模型在处理模糊指令方面的能力有所提升,不会直接诉诸假设;它可以提出澄清问题,在无法执行任务时请求用户帮助,并在执行不可逆操作或可能产生重大后果的操作前获得事先批准。公司还强调,模型在长指令中保持约束条件,以及在同一对话中将旧请求与新请求联系起来方面也有所改进。
Meta指出,该模型在评估自身能力方面更加准确,旨在减少它暗示自己已经完成实际上无法执行的任务的情况。
编程和资源使用方面的提升
根据Meta工程师进行的比较,Muse Spark 1.3完成类似任务时,相比Muse Spark 1.2可减少约20%的工具调用和25%的令牌使用量。这些提升还与减少不必要的对话轮次以及生成更少但据公司描述更加整洁的代码有关。
在用于长期软件开发任务的DeepSWE v1.1测试中,该模型获得了75.4分。该测试涵盖91个软件代码库中的113项任务,代码库使用TypeScript、Go、Python、JavaScript和Rust编写。根据Meta的表格,这一成绩超过了GPT-5.6 Sol和Claude Opus 5,但在其他评估中仍有先进的竞争模型领先于它。
这些数字实际上证明了什么?
DeepSWE的结果显示,该模型在上述测试中取得了可量化的改进,但仅凭这些结果不足以证明Meta在所有使用场景中都已缩小与OpenAI和Anthropic之间的差距。公司自身也提醒称,针对其他公司模型进行的测试可能并未针对每个模型进行优化,因此不一定反映其可能达到的最高性能。
此外,Artificial Analysis平台为该模型的max版本在Intelligence Index中评定了62分,并指出Muse Spark 1.3拥有100万令牌的上下文窗口,支持文本、图像和视频输入。实际比较仍取决于所使用的测试、评估方式以及围绕模型构建的代理架构。
可用性、定价和未决限制
尽管宣布了性能改进,Meta并未调整API的价格。标准价格为每百万令牌输入1.25美元、缓存输入0.15美元、输出4.25美元。
公司表示,已增强模型抵御指令注入攻击和恶意输入的能力,并训练它在执行不可逆操作前更加谨慎。目前提供已有的reasoning模式,而在完成额外安全测试后,计划推出max reasoning选项。
路线图包括更大的Muse Spark模型以及开放权重版本,但Meta尚未说明是否会发布Muse Spark 1.3本身的权重。因此,该版本的实际价值将取决于独立使用结果、额外reasoning能力的推出时间,以及开放计划是否会具体涵盖这一模型。