GitHubは2026年9月4日、複数のプロバイダーのAIモデルをプログラミングタスクの実行中に調整する、Project HydraFusionを発表した。これはGitHub Copilot内で研究プレビューとして提供されるプロジェクトである。単一のモデルを事前に選択するのではなく、HydraFusionは実行計画を作成し、タスクに直接的な解決、独立したレビュー、またはより高性能なモデルへのエスカレーションのいずれが必要かを判断する。
この取り組みは、GitHubが今年前半に開始した、各タスクに最適なモデルを選択するAuto model selection機能に続くものだ。しかしHydraFusionは、モデルの選択から、結果の品質、コスト、応答時間のバランスを取る完全なワークフローの構築へと発想を拡張する。一方、開発者がCopilotで他のモデルを選ぶのと同じようにHydraFusionを選択すれば、運用上の複雑さは開発者から見えないままとなる。
タスク実行の3つの経路
システムは、推論、コード生成、デバッグ、ツール利用に関連するシグナルを評価し、次の3つの実行モードのいずれかを選択する。
- Single:能力が十分な場合に、単一のモデルがタスクを直接解決する。
- Cascade:より効率的なモデルが解決策の作成を開始し、その後、品質ゲートが採用するか、タスクをより強力なモデルに引き渡すかを判断する。
- Critique:1つのモデルが初期解を作成し、その後、異なるファミリーの独立したモデルが読み取り専用のコンテキストでレビューを行い、最初のモデルが解決策を1回改訂する。
GitHubによると、選択性の目的は、結果の改善が見込まれる場合にのみ追加の呼び出しを使用することだ。これにより、直接的な経路は速度と効率を維持し、一方の2つの経路は、レビューまたはエスカレーションから恩恵を受けるタスクにそれらを追加する。
テストで示された結果
GitHubは、3つのコーディングエージェント評価でHydraFusionの固定ポリシーを評価した。対象はTerminalBench 2.1、DeepSWE、そしてGitHub Copilotの実際のセッションに基づく社内のCheckpointBenchである。結果はClaude Opus 5とGPT-5.6 Solという2つのベースラインと比較され、入力、ツール、実行上限、価格設定の前提、評価条件は同一にされた。
TerminalBench 2.1では、HydraFusionは検証済みタスクの品質で4.9ポイントの改善を達成し、Claude Opus 5と比較してワークフローの推定コストを67%削減した。リポジトリレベルのソフトウェアエンジニアリングタスクとファイル間の依存関係の理解に重点を置くDeepSWEでは、システムはOpus 5に1.5ポイント差まで迫り、コストを36%削減した。CheckpointBenchでは、品質差はわずか0.1ポイントで、コストは65%削減された。
コスト計算には、作成、レビュー、修正、エスカレーション、再試行、フォールバック計画を含む、実行の全段階が含まれる。ただしGitHubは、これらの結果をオフラインテストであり、使用した評価のバージョン、ワークフロー設定、モデルセット、価格の前提によって限定されるものだと説明している。
運用上の制御とプレビューの制限
GitHubは、各段階のコストと使用量の記録、キャンセルおよび実行のタイムアウト設定、ツールを持たずリポジトリを変更しないコンテキストへのレビュー手順の隔離などの制御を中心にHydraFusionを設計した。またシステムは、ワークフロー定義、モデルの紐付け、代替動作、モデルの可用性を事前に検証し、処理がキャンセルされた場合、または検証処理に失敗した場合には修正を適用しない。
GitHubは現在、Copilotの自動実行モードに1つのプロンプトで送信する、規模が大きく明確に定義されたプログラミングタスクから試すことを推奨している。同社は今後、複数ターンでより長時間にわたるセッションのパフォーマンス改善に注力する。また、プレビュー期間中にモデル、ワークフロー、名称、可用性、製品の動作が変わる可能性があると注意を促している。
編集部の見解:モデル選択からワークフロー設計へ
ここで最も重要な変化は、新しいモデルの追加ではなく、実行に関する判断を開発者から調整レイヤーへ移し、1回の試行で十分な場合と、レビューまたはエスカレーションのコストをかける価値がある場合を判断させることだ。テスト結果が実際の利用にも反映されれば、開発者は一部のタスクで、より強力なモデルをすべてのリクエストに使うコストを負担することなく、それに近い品質を得られる可能性がある。
しかし、これらの数値は、すべてのプログラミングパターンにおける一般的な優位性をまだ証明していない。特定の評価、調整されたポリシー、オフラインの結果に結び付いているためだ。応答時間、信頼性、長時間セッションにおけるシステムの動作、キャッシュ効率、安全性については、依然として疑問が残されており、GitHubはこれらの側面をプレビュー期間中に測定すると述べている。