Microsoftでクラウドコンピューティング・プラットフォームのハードウェアとインフラの計画、エンジニアリング、開発、展開を担う組織を率いるラニ・ブールカーは、AI時代の進歩を測る別の見方を示している。チップ数、データセンターの規模、システムが生成できるトークン数に注目する代わりに、利用可能な資源から生み出せる有用な成果の量、すなわち「歩留まり(Yield)」という概念を採用することを提案している。
ブールカーはこの概念を半導体業界から借用している。同業界では、歩留まりは1枚のウェハーから取り出せる正常なチップの数を指す。彼女の見方によれば、この原則を資本、エネルギー、メモリ、通信、モデル、ソフトウェア、さらにはAIが仕事や日常生活にもたらす価値にまで広げるべきだという。
なぜ、インフラの拡張だけでは不十分になったのか?
記事は、AIの普及がインターネット、パーソナルコンピューター、スマートフォンで起きた変化を上回る速度で加速した一方、世界の利用は依然として労働力の約18%にとどまり、その大半が会話に集中していると指摘している。システムが推論、計画、ツールの利用、より長いエージェント型ワークフローの実行へ移行するにつれて、インフラ要件は根本的に変化している。
ブールカーによれば、1つのエージェント型タスクが、通常の会話インタラクションで消費されるトークン数の3400倍を超えて使用する場合がある。この増加は、エネルギー、ラック密度、パッケージサイズ、メモリ容量に圧力をかける。彼女は、シリコン、メモリ、電力、ファイバーをさらに追加するという従来の対応は永遠には続けられず、新たな改善のたびに前世代より大きな投入が必要になる可能性があると考えている。
この見方は、2つの並行する道筋を提案している。すなわち、効率、利用率、経済的実現可能性を高めるための現行アーキテクチャーの段階的な改善と、システムおよびモデル設計における新たなアーキテクチャー、材料、手法によって性能曲線そのものを再構築する、より深い変革である。ブールカーは、クロック周波数の向上が電力の壁に突き当たった後のマルチコア設計への移行と、NANDメモリが平面設計から垂直設計へ移行したことを例に挙げている。
歩留まりは全レイヤーの協働の結果
記事は、ボトルネックが必ずしもそれが現れるレイヤーで解決されるとは限らないと強調している。単一コンポーネントの性能を測るだけでは不十分である。データセンター、シリコン、モデル、エージェントのタスクを調整するツールの間で、利得と損失が積み重なるからだ。そのためブールカーは、まず必要な成果を定義し、単一要素の性能を最大化するのではなく、システム全体を改めて最適化する「協調設計」を呼びかけている。
メモリについて、Microsoftは問題を単なるコンポーネント不足ではなく、システムレベルの課題だと捉えている。推論には、より大きなモデルとより長いコンテキストを収容し、データを高速に提供することが必要である。一方、エージェントは、生成、検索、ツール利用、継続的なメモリの処理を、数分から数時間続くループに加える。Azure Maiaプラットフォームの経験は、KVキャッシュのメモリ消費を削減するには、モデルエンジニアリング、データサイエンス、圧縮に加えて、メモリ階層、シリコン、データ移動、コンパイラー最適化をソフトウェアで管理することを組み合わせられることを示している。
ここでの考え方は、単に新たなバイト数を追加することではなく、利用可能な各バイトから、より多くの有用な知能を引き出すことである。
ネットワークからエネルギーまで
クラスターのレベルでは、知能は1つのチップから生まれるのではなく、1つのシステムとして動作する数千のチップから生まれる。そのため成果はリンクの速度だけでなく、輻輳管理、障害復旧、ワークロードの分散、プログラミングの複雑さ、シリコン、システム、ソフトウェアの境界にも左右される。
ブールカーによれば、Maiaプラットフォームの設計は、あらかじめ存在するネットワーク設計からではなく、達成すべき成果、すなわちフリート規模での効率的な推論から始まった。これには、2階層のスケールアウトネットワークの構築、ネットワークカード機能のチップへの統合、専用トランスポート層の開発が含まれていた。記事によれば、この手法により、高密度な推論クラスターでスケーラブルな性能を実現し、プログラミングを簡素化し、ワークロードの柔軟性を高め、必要なネットワークハードウェアを削減した。
一方、エネルギーは、システムが消費する資源から、電力網からチップに至るまで設計に最初から組み込むべき制約へと変化した。記事は、ラックの電力が数十キロワットから数百キロワットへ上昇し、データセンター群がギガワット規模で稼働していることを指摘している。また、配電損失を削減するソリッドステート変圧器や800ボルトの直流配電などのソリューションにも言及している。
MicrosoftのArmベースのサーバープロセッサーAzure Cobalt 200は、この協調設計の一例である。各コアに電圧と周波数を個別に制御する機能を備え、各仮想マシンの電力消費をソフトウェアで特定できる。Microsoftによれば、このきめ細かな制御により、重要なワークロードの性能を保護しながら電力を調整でき、同じ電力制限の中でより多くのサーバーを稼働させられる。
実際に重要なのは何か?
この提案の意義は、議論の焦点を生の容量競争から、資源を成果へ変換する効率へ移すことにある。クラウド事業者やデータセンターにとって、これはハードウェアの評価をネットワーク、ソフトウェア、冷却、負荷管理から切り離せないことを意味する。モデルやエージェントの開発者にとっては、モデルの規模だけでなく、メモリ効率、タスクの長さ、ツール統合もスケーラビリティに影響する要因となる。
ただし、この結論はMicrosoftから示された見解であり、大規模なAIインフラの構築・運用における同社の経験に部分的に基づくもので、すべての環境に対して実証された独立した基準ではない。また記事は、MaiaやCobalt 200の効果を測定する詳細な比較数値を示しておらず、Azure以外の状況で上述のソリューションを適用するためのコストやスケジュールも明らかにしていない。
それでも、「歩留まりの必要性」は業界に実践的な問いを投げかけている。エネルギー、チップ、データセンターへの増加する投資は、適切なコストで利用できる知能や、具体的な生産性と価値につながっているのか。ブールカーの見方では、トークンを生成した時点で歩留まりは完成しない。それらの出力が、より速い科学的発見、早期に検知される医療上の兆候、より良い学習、あるいは中小企業にとっての新たな機会へと変わったときに初めて、歩留まりは完成する。