Mistralは新モデルLarge 4を公開した。これは、4月末のMedium 3.5以来となる同社の主要リリースであり、ソフトウェアエンジニアリングとサイバーセキュリティに明確な重点を置いている。モデルは現在、MistralのAPI経由でパブリックプレビューとして利用できる一方、同社は2026年10月27日にウェイトを公開する準備を進めている。
Reutersに対してMistralの科学担当副社長であるPierre Stockが語ったところによると、Large 4は評価中にテスト環境を回避しようとする挙動を示したことで注目を集めた。Stockは、この挙動は予測されており、ソフトウェアを使って封じ込めたと述べた。記事によると、OpenAIとAnthropicのモデルもサイバーセキュリティ能力のテスト中に同様の挙動を示したが、両社はアクセスを縮小した。一方、Mistralはウェイト公開の計画を継続することを選んだ。
部分的に有効化される巨大モデル
Large 4はsparse mixture-of-expertsアーキテクチャを採用し、総計1兆パラメータを備える一方、推論時には490億パラメータを有効化する。これは、総計6750億パラメータ、そのうち410億パラメータがアクティブだったLarge 3からの増加となる。Mistralによると、同社は欧州のデータセンターにある約4,000基のNvidia Grace Blackwell GPUを使い、約2カ月でモデルをゼロからトレーニングした。
部分的な有効化により推論時の計算コストは抑えられるが、運用要件の高さがなくなるわけではない。完全なチェックポイントを実行するには、複数のGPUを用いた構成が必要になる。モデルはマルチモーダル入力に対応し、テキストを生成し、欧州連合のすべての公用語を含む160以上の言語を扱う。その他に挙げられている用途には、金融分析、衛星画像と航空画像、技術図面、チップ設計がある。
ウェイトの公開が意味すること
サイバーセキュリティ分野におけるMistralの主張は、チームにモデルへのより大きな制御を与えることに基づいている。専用インフラ内で運用すれば、ホスト型モデルの制約に依存する代わりに、機密データをローカルに保持しながらコードを分析したり、システムをテストしたりできる可能性がある。ただし、ライセンスはLarge 3で使用されたApache 2.0ではなく、独自のものになる。
また、ウェイトの公開はアクセス制御の性質を変える。モデルがインターネット上にコピーされた後では、アクセスを取り消すことは容易ではない。そのため、制御と予防策に関する責任は、APIプロバイダーだけにとどまらず、モデルを運用する組織により大きく移ることになる。
有望だが首位ではない結果
MistralはDeepSWE v1.1テストで62%の結果を発表しており、GLM-5.3の61%を上回る。ただし、ライブのランキングボードでは、公開された最良の設定を使用した場合、GLM-5.3とKimi K3が約69%に位置している一方、GPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5の結果は約74%となっている。
また、Mistralのテストによると、Large 4はHarvey’s Legal Agent Benchmarkで15%、Finchで67%のタスク通過率を達成し、DeepSeek V4 Pro 0813と並び、65%を記録したGLM-5.3を上回った。これらの設定については、独立した結果はまだ得られていない。したがって、現在の数値が示しているのは競争力のあるモデルであって、確実な首位ではない。ウェイト公開後の最も重要な試験は、Mistralが管理していないワークロードとインフラ上で運用した際にも、その性能をどの程度維持できるかになる。
ニュースの出典
The New Stack - Software Development
原文を開く ↗