データセンターにおけるAI能力の増強は、もはやプロセッサーやアクセラレーターの数だけに左右されるものではなく、これらのリソースをどのように配分し、システムの他のコンポーネントと接続するかにかかっている。本稿では、一部のリソースをプロセッサーの近くに保持し、別のリソースを複数のサーバーにまたがって拡張し、GPUやNVMeストレージなど高コストのリソースを共有インフラ経由で共有するハイブリッドな構想を提示する。
PCI Express、すなわちPCIeは、プロセッサー、GPU、アクセラレーター、SmartNICまたはDPU、ストレージを接続するための広範なハードウェアおよびソフトウェアエコシステムを提供するため、この構想において重要な役割を果たす。しかし、転送速度の高速化と接続デバイス数の増加は、単に追加のポートを用意するだけでは解決できない課題をもたらす。そこで、PCIeスイッチとリタイマーの統合機能が重要になる。
リソース分配の3つのパターン
システム内スケールアップ(Scale-up)は、プロセッサーとアクセラレーターの距離を最も近くできるため、遅延に敏感なAIワークロードに適している。ただし、この方式は、プロセッサーのレーン数、筐体のスペース、電力および冷却要件、そしてサーバーが収容できるデバイス数の制約に直面する。
サーバー間スケールアウト(Scale-out)は、EthernetまたはInfiniBandを使用して複数のノードに性能を分散する。これによりクラスターを拡張できる一方、遅延が増加し、ノード間でデータとワークロードを調整できるソフトウェアが必要になる。
これに対して、ディスアグリゲーテッドアーキテクチャは、GPU、ストレージ、SmartNICおよびDPUなどの特定のリソースを単一サーバーの所有から切り離し、共有ファブリック経由で利用できるようにする。これにより、リソース利用率の向上や、コンピューティングおよびエンドポイントの独立した拡張が可能になる場合があるが、リソース競合、分離、管理、遅延に関する問題が加わる。
したがって、本稿はこれらの方式のいずれかを他の方式に対する包括的な代替として提示しているわけではない。実際の判断では、ローカルに保持すべきリソース、サーバー間で分散すべきリソース、複数のシステム間で共有することがコストに見合うリソースを特定する必要がある。
PCIe 7.0がもたらすもの
PCIe 7.0は、PCIe 6.xと比較してレーン当たりの raw 転送速度を2倍にし、128 GT/sに達する。また、x16構成を使用した場合、双方向で最大512ギガバイト/秒の帯域幅を提供する。この向上により、増え続けるアクセラレーターやデータ転送量の多いプラットフォームを収容する余地が広がると同時に、より広範なPCIeエコシステムとの後方互換性も維持される。
しかし、より高い速度だけでは、拡張可能なシステムを構築するには不十分である。信号速度が上がると、チャネル損失、反射、クロストーク、ノイズ、ジッターへの対処がより困難になる。また、PCIe 5.0とPCIe 6.xは現在のアーキテクチャにおいて依然として重要な構成要素であり、世代間の互換性はシステム設計における実際的な要因となる。
拡張とトラフィック管理のためのPCIeスイッチ
PCIeスイッチはトランザクションを受け取り、その宛先を判断したうえで、アップストリームポートとダウンストリームポートの間で転送する。これにより、接続ポイント数を増やし、より柔軟なアーキテクチャをサポートし、接続されたデバイス間に直接の通信経路を提供できる。
しかし、ポート数と最大速度だけで実効性能が決まるわけではない。GPU、ストレージ、制御トラフィックが同じ帯域幅を奪い合う場合、調停、バッファリング、クレジット管理、オーバーサブスクリプションポリシー、ヘッド・オブ・ライン・ブロッキングの回避が、実際に利用可能な性能に影響する要因となる。また、スイッチを経由する追加のホップごとに遅延が増加し、新たな競合点が生じる可能性がある。
構成可能性は、チップ設計チームにとって特に重要である。単一のスイッチアーキテクチャ内で、異なるポート構成、アップストリームポートの選択肢、さまざまなエンドポイント数、複数のトラフィックパターンをサポートできるためである。
距離と信号品質に対処するリタイマー
リソースが、基板上のより長い配線、コネクター、ケーブル、拡張シャーシを通じてプロセッサーから遠く離れると、電気チャネルはより複雑になる。リタイマーはクロックとデータを復元し、電気的なセグメントを終端したうえで、次のセグメントへクリーンな信号を再送信する。
これらのコンポーネントは、デバイス配置における設計者の柔軟性を高めるが、距離を無制限にするものではない。リタイマーを通過する各セグメントについて、遅延、電力、熱、イコライゼーション、診断、プロセッサー、エンドポイント、PHYインターフェース、コネクター、ケーブル、ファームウェア間の互換性を考慮しながら、設計と検証を行う必要がある。
ソリューション選定前に測定すべきこと
本稿は、一般的な仕様一覧ではなく、実際の用途を代表するワークロードとトポロジーから評価を始めることを推奨している。チームは、必要な帯域幅と遅延、入出力接続数、オーバーサブスクリプションのレベル、トラフィック構成、チャネル損失、消費電力、管理性、相互運用性の目標を特定すべきである。
この観点では、PCIeスイッチが拡張性とトラフィックルーティングを提供し、リタイマーが実用可能な距離を延ばし、信号の完全性を維持する。本稿は、RambusのPCIeスイッチおよびリタイマーコントローラーのソリューションを、ASICおよびFPGA実装向けの設計ブロックとして挙げている。しかし、実際の価値はコンポーネントの名称よりも、ワークロード、トポロジー、システムの電気的制約への適合度によって測られる。
編集部による読み解き:ここでの実質的な変化は、新しい規格や製品の投入ではなく、AIアーキテクチャの設計判断が最大速度を問うものから、近接性、拡張性、リソース利用率、信号品質のバランスを取るものへ移行したことである。基本的な制約は依然として明確だ。ホップ数と共有コンポーネントが増えるほど、管理、競合、遅延の複雑さが増す。また、本稿はRambusによるスポンサー付きブログであるため、マーケティングの観点から枠組みを示しており、独立した測定結果やベンダー間の比較は提示していない。