Geoff Tateは、メーカー別に見ると、グラフィックス・プロセッシング・ユニット(GPU)が依然として世界で導入済みのAIコンピューティング能力の約70%を占めていると見ている。一方、専用チップは30%で、その大部分をGoogleとAmazonが占めている。しかし、特定のワークロードの運用コストを削減し、電力消費を改善するため、クラウド企業や先進的なモデルの開発者が独自ハードウェアの設計を始めたことで、この優位性はもはや保証されていない。
筆者が参照するEpoch.aiのデータによれば、世界の導入済みAIコンピューティング能力は3年間で17倍に増加した。2023年にはNvidiaのシェアが90%、Googleが10%だった一方、過去3年間の成長の20%を専用コンピューティングが占めた。Tateは、このデータにはMeta、Microsoft、Cerebrasが含まれておらず、この測定における同社らの能力は比較的小規模だと述べている。
Nvidiaの優位性はプロセッサ単体を超える
筆者の見解では、Nvidiaの強みは単一のGPUに依存するものではなく、インターコネクトおよび拡張ユニット、ラック、中央処理装置、ネットワークプロセッサを含む統合エコシステムに基づいている。同社は、NVL72システム、AIエージェントのワークロード向けVeraプロセッサ、BlueFieldユニット、Spectrum-6ネットワークに加え、低レイテンシ推論向けのGroq 3 LPXという選択肢を提供している。
Nvidiaによれば、Veraプロセッサはエージェントのワークロードにおいて従来型プロセッサの1.8倍の性能を提供する。また同社は、インタラクティブ性のレベルに応じて、Vera RubinシステムがDeepSeek-v4-PROのテストでGB300と比較して2倍から30倍の改善を実現するとしている。記事はさらに、Vera RubinシステムがCoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud、Nebiusのラックで稼働し始めたと述べている。
Nvidiaは次の会計年度に70%の成長を予想しており、需要は供給によって制約されていると指摘している。業績説明会で示された同社の供給確保に関するコミットメントも、1,190億ドルから2,790億ドルに増加した。Tateは、TSMCの製造枠を確保し、HBMメモリを供給できるかどうかが、競争における決定的な要因であり続けると見ている。
専用チップが競争の核心に近づく
チップを社内で設計することで、クラウド企業やモデル開発者は、自社のワークロード、トレーニングと推論のニーズの違い、インフラストラクチャのボトルネックを直接把握できる。コンピューティング規模の拡大に伴い、トレーニング用と推論用にそれぞれ特化した2種類のチップを設計することは、経済的に実行しやすくなった。特に、それによって1ワット当たりのスループットが10%から30%向上し、シリコン面積も同程度削減できる場合はなおさらである。
記事では、OpenAIがJalapeñoチップを通じて注目されている。これは同社が自社ワークロード向けに設計した推論アクセラレーターで、prefillとdecodeの両段階をサポートし、KV Cacheをローカルに保持する。このシステムはBroadcomのTomahawk 6スイッチを使用して128チップのドメインを構築し、グローバル規模では最大2,048チップに達する。OpenAIの初期テストによれば、JalapeñoはGPT-OSS、DeepSeek R1、Kimi K2.5のワークロードでNvidia GB300を上回った。ただし、テストは1トークン予測に基づいており、同社が性能を3倍から5倍向上させると予想しているマルチトークン予測はまだ含まれていない。
Tateは、JalapeñoとVera Rubinの比較を概算と説明している。これは公開された性能曲線を外挿したものであり、完全な直接テストではない。そのため、結果は有望だが、本番環境への展開時や、より広範な規模およびワークロードで検証する必要があると見ている。また、Jalapeñoは推論専用であり、OpenAIのコンピューティング需要の3分の1以上を占める可能性があるトレーニングのニーズには対応していない。
Google、Meta、AMDが代替手段を拡大
Googleは第8世代TPUで、TPU 8tをトレーニング向け、TPU 8iを推論向けとする2つのバージョンを同時に投入している。記事によれば、TPU 8iは追加のHBMメモリを必要とするため、8tより約1.4倍大きい。また、トレーニングと推論の要件が異なることから、2つのバージョンではインターコネクトのトポロジーも異なる。Googleは新世代が従来世代の約2倍の性能を提供すると述べている。一方、Morgan Stanleyは、TPUの売上高を2026年下半期に約90億ドル、2027年に840億ドル、2028年に1,080億ドルと見積もった。
Metaは、まずレコメンデーションシステムのワークロード、続いてトレーニングと生成AIを対象とするMTIAシリーズを開発している。一方、CerebrasはCS-4チップを発表し、CS-3と比較してユーザー当たりのトークン速度を2倍にし、1ワット当たりのスループットを最大10倍にするとしている。AMDもMI455xユニットとHeliosシステムを発表した。記事によれば、世界の導入済み能力に占める同社のシェアは0%から6%に上昇したが、紹介された発表には特定のAIベンチマークに関する性能チャートはなかった。
これはGPUメーカーに何を意味するのか?
certi.newsの見方では、データはGPUが近く終焉を迎えることを示しているのではなく、競争が汎用チップの性能から、システム全体の効率、電力・メモリ・製造能力の確保、特定のワークロードにハードウェアを対応させる能力へと移行していることを示している。多様なモデルやワークロードを運用する顧客にとって、GPUの柔軟性は重要な優位性であり続ける。一方、専用チップは、設計を個別に行うことを正当化できるほど企業のワークロードが明確で安定している場合に、優位に立つことができる。
Tateは、Nvidiaが単一の汎用設計に依存するのではなく、トレーニングと推論向けに別々のチップを開発することを検討し、銅配線が実用上の限界に近づく中で、NvidiaとAMDがoptical circuit switchingやco-packaged opticsなどの光インターコネクト技術を採用することを提案している。ただし、これらの提案の一部は分析上の見解であり、同氏は光インターコネクト技術に取り組む2社の取締役でもあるため、独立した事実ではなく、記事執筆者による提言として扱う必要があると説明している。
筆者が示す結論は、Nvidiaには大きな防衛障壁があるものの、莫大なリソースを持ち、自社モデルを独自ハードウェアで稼働させる直接的な動機を持つ顧客に直面しているというものだ。Jalapeñoが本番環境でVera Rubinと同等またはそれ以上の性能を実証すれば、GPUの優位性が単なる理論上の可能性ではなく、実際に競争にさらされていることを示す強力な指標となる。