Metaは、AIモデルMuse Spark 1.3を発表した。主な改善点は、プログラミング、長期的なエージェント型タスク、複雑な複数ステップのワークフローに重点を置いている。モデルは2026年9月3日から、プログラミングツールのMuse CodeとMeta Model APIを通じて利用可能になった。Muse Spark 1.2のリリースから約1か月後のことだ。
Metaはこの新バージョンを、これまでで最も高性能なモデルだと説明している。ただし、この表現は同社による説明にとどまり、すべてのベンチマークやユースケースで優れていることを意味するものではない。
長期タスクの管理能力を向上
Muse Spark 1.3は、1つの長い会話の中で複数のタスクを処理できるよう設計されている。オープンエンドな目標を与えると、ツールを使って必要なコンテキストを構築し、作業計画の不足を見つけて修正し、実行中に学習した情報を最終結果へ反映できる。
Metaによると、モデルは曖昧な指示にも、すぐに憶測へ頼ることなく、より適切に対応できるようになった。説明を求める質問をしたり、タスクを実行できない場合にユーザーへ支援を求めたり、取り消し不能な操作や重大な結果につながる可能性のある操作の前に、事前の承認を得たりできる。また同社は、長い指示の中で制約を維持する能力や、同じ会話内で過去の依頼と新しい依頼を結び付ける能力も向上したとしている。
Metaは、モデルが自らの能力をより正確に評価できるようになり、実際には実行できないタスクを完了したかのように示すケースの削減を目指していると述べている。
プログラミングとリソース利用で向上
Metaのエンジニアが実施した比較によると、Muse Spark 1.3はMuse Spark 1.2と比べ、同様のタスクを約20%少ないツール呼び出しと25%少ないトークンで実行する。こうした向上は、不要な対話ラウンドの削減や、同社の説明によれば、より簡潔でありながらクリーンなコードの生成にも関係している。
長期的なソフトウェア開発タスク向けのDeepSWE v1.1テストでは、モデルは75.4点を記録した。このテストは、TypeScript、Go、Python、JavaScript、Rustで記述された91のソフトウェアリポジトリに含まれる113のタスクを対象としている。Metaの表によると、この結果はGPT-5.6 SolとClaude Opus 5を上回った一方、他の評価では競合する先進モデルが上回っている。
数値は実際に何を証明するのか?
DeepSWEの結果は、上述のテストにおける測定可能な改善を示しているが、それだけでMetaがあらゆる利用シナリオでOpenAIやAnthropicとの差を埋めたことを証明するには不十分だ。同社自身も、他社モデルに対するテストは各モデル向けに最適化されていない可能性があり、そのモデルが達成可能な最高性能を反映していない場合があると注意を促している。
また、Artificial Analysisはモデルのmax版にIntelligence Indexで62点を付与し、Muse Spark 1.3が100万トークンのコンテキストウィンドウを持ち、テキスト、画像、動画の入力に対応すると述べている。実用面での比較は、使用するテスト、評価方法、モデルを取り巻くエージェント構成に左右される。
提供状況、料金、未解決の制限
Metaは性能向上を発表したものの、APIの料金を変更しなかった。標準料金は100万トークン当たり、入力が1.25ドル、キャッシュされた入力が0.15ドル、出力が4.25ドルとなっている。
同社によると、モデルは指示インジェクション攻撃や悪意のある入力への耐性が強化され、取り消し不能な操作を実行する前に、より慎重に判断するよう訓練された。現在は既存のreasoningモードを利用でき、追加の安全性テストを完了した後にmax reasoningオプションを提供する計画だ。
ロードマップには、より大型のMuse Sparkモデルと、重みを公開するバージョンが含まれている。しかしMetaは、Muse Spark 1.3自体の重みを公開するかどうかを明らかにしていない。そのため、このリリースの実用的な価値は、独立した利用結果、追加のreasoning機能が提供される時期、そしてオープン化の計画がこのモデル自体を対象とするかどうかに左右される。