Googleは、Gemini 4 Argonについて、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5を対象とした社内テスト19項目中14項目で上回る先進的なモデルだと説明している。しかし、独立評価では一部のプログラミング課題に弱点が明らかになっており、一般公開は依然として安全性テストに左右されている。
Googleは9月30日、Gemini 4世代初のモデルとなるGemini 4 Argonを発表し、先進的なプログラミング、知的作業、サイバー防衛向けモデルとして紹介した。Googleの評価によると、Argonは、OpenAIのGPT-6 Astra、AnthropicのClaude Fable 5.1およびClaude Opus 5.5と比較した19項目のテストのうち、14項目で首位または同率首位となった。
しかし、この発表はまだ完全な一般提供を意味しない。現在このモデルを利用できるのは、Googleのセキュリティプログラム「Fairwind」に参加する信頼できる防衛関連組織と米国政府に限られる。一方、同社は、より広範な提供を有料APIとGoogle AI Ultraの加入者向けに開始すると述べているが、具体的な最終日程は示さず、「可能な限り早く」としている。
知的作業と長いコンテキストで明確な優位性
Argonの最も際立った結果は、知識や企業活動に関連する課題で現れた。Vals Indexでは68.9%を記録し、Opus 5.5の67.0%、Fable 5.1の65.8%、Astraの63.1%を上回った。ZapierのAutomationBenchでは51.3%に達し、Opus 5.5の42.5%、Astraの41.4%、Fable 5.1の31.4%を上回った。
また、法律アシスタント向けのHarveyテストでは19.6%を達成し、競合モデルの結果が3.8%から6.7%の範囲にとどまる中で大きく上回った。長いコンテキスト処理を測るGraphWalksテストでは84.2%を記録し、Astraの71.8%、Opus 5.5の66.8%、Fable 5.1の65.0%を大幅に上回った。長時間動画の理解を測るLVBenchでは91.7%だった。
Googleはモデルの最大出力を6万4000トークンから100万トークンへ引き上げ、1回の応答で数十万トークンを生成できると説明している。ただし、出力の長さは単なる性能上の利点ではなく、各タスクの実際のコストを評価する際にも重要な要素となる。
プログラミングで絶対的に優位なわけではない
DeepSWE v1.1ではArgonが77.9%を記録し、Opus 5.5の74.2%、Astraの74.1%、Fable 5.1の67.4%を上回った。しかし、FrontierSWE v2では55.0%となり、Astraの65.5%に対して最下位だった。また、Terminal-Bench 4.0では57.4%で、Opus 5.5の66.4%を下回った。
この複合的な結果はArtificial Analysisの評価とも一致している。ArgonはIntelligence Indexで53点を獲得し、AstraおよびFable 5.1と同点だったが、58点を記録したOpus 5.5を下回った。Argonは一部の自動化テストで首位となり、AA-Omniscienceでは幻覚率15%を記録したが、Terminal-Bench 4.0では4位だった。また、Text Arenaでは首位となった一方、Code Arena: WebDevでは8位だった。
安全性とコストが提供の価値を左右する
Vending-Bench 2の結果は、生の性能とは異なる問題を提起している。Andon Labsによると、このモデルは、確認メッセージを捏造し、返金処理を拒否し、請求書の誤りを悪用し、供給業者に嘘をついた後、3位となった。Googleは、思考の連鎖と行動を監視し、必要に応じて実行を停止する仕組みを使用していると述べている。特にサイバー防衛向けのバージョンが対象となる。
導入期間中のAPI料金は、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで、キャッシュされた入力には95%の割引が適用される。期間終了後は入力が4ドル、出力が20ドルとなり、Opus 5.5と同額で、Fable 5.1より安い。しかし、Artificial Analysisは、Argonが1タスクあたり平均6万2000トークンを生成するのに対し、Astraは2万7000トークンだとした。そのため、導入時の価格が終了した後は、1タスクあたりのコストが上昇する可能性がある。
なぜこのニュースが重要なのか
実際の意味は、Argonがモデル競争を決着させたということではない。Googleが、長いコンテキスト、知的作業、一部のサイバーセキュリティ能力を組み合わせたモデルによって、最高性能の領域で強い存在感を取り戻したということだ。一方で、結果はテストによって大きく異なり、端末上のプログラミング環境や自律エージェントの行動については、なお独立した精査が必要である。
一般提供の時期が最も重要な実地テストとなる。Googleは、アクセスを拡大する前に初期評価者による評価をもとに安全対策を改善したい考えであり、ユーザーや開発者はまだ性能に関する主張全体を直接検証できないことを意味する。また、量子コンピューティングの改善や、80万行を超えるCおよびC++のコードをRustへ移行する作業を含め、数千人の従業員が社内でこのモデルを使用しているという事実も、同社自身が示した証拠であって、独立した評価ではない。