クラウドコンピューティングとデータセンター

AIデータセンターが直面する、計算能力に転換可能な滞留電力の問題

AIデータセンターは、バックアップ電源システムと信頼性要件のため、利用可能な電力容量の一部を消費し、実際には使用されない容量を残している。分析では、電圧低減技術と負荷管理により、この容量を活用しつつ、電源の一つが故障した際には急速に縮退運転へ移行できる可能性を検討する一方、スケジューリング、セキュリティ、障害対応の課題も残るとしている。

2026-09-15
1 分で読めます
3 閲覧数
فريق تحرير certi.news
AIデータセンターが直面する、計算能力に転換可能な滞留電力の問題

AIデータセンターにおける電力問題は、消費電力量だけでなく、障害に対応するために費用を負担して確保しているにもかかわらず、未使用のまま残る容量にもある。Semiconductor Engineeringが2026年9月15日に掲載した分析は、基本的な矛盾を示している。チップやサーバーの消費電力を削減すれば効率は向上するが、利用可能な電力と実際の使用電力との差が拡大する可能性がある。一方、バックアップ電源の構成により、運用時には容量の大部分を使用しないまま残すことを事業者に求められる。

この問題はAI負荷の拡大に伴って重要性を増している。新たな電力容量を確保するには、送電線、許認可、サイト内の追加発電が必要になる場合があるためだ。Utilidataの最高技術責任者であるマリサ・ホーモンによれば、既存の利用可能容量に設備を追加する方が、新しいデータセンターを建設したり、供給増を待ったりするより容易な場合がある。

なぜ容量は未使用のまま残るのか?

データセンターは通常、電源の一つを失ってもサービスを停止せずに耐えられるよう設計される。「3+1」構成では、施設はフル容量の電源を3系統必要とし、4系統目を予備として追加する。4系統はそれぞれ約75%の容量で稼働でき、1系統が故障した場合には残りの3系統が負荷を引き受けられる。2N構成では二重の電源系統を用意し、一方を失っても他方が対応できるよう、各系統の負荷を約50%に維持する。

ホーモンは、2Nを採用すると、2ギガワット向けに構成されたサイトが実際には1ギガワットのサイトとして扱われ、その容量のうち通常使用されるのは約70%から80%にすぎない場合があると説明する。その結果、サイト全体で見ると、実際にコンピューティング基盤へ届く電力は、定格2ギガワットの約3分の1に達する可能性がある。これは設備の不具合による浪費ではなく、信頼性要件と運用マージンが直接もたらす結果である。

チップの消費電力削減だけでは問題は解決しない

電力最適化は、回路設計と、チップに組み込まれた知的財産の管理から始まる。Cadenceのアリフ・カーンは、未使用のインターフェースやチャネルを停止し、複数の待機状態を利用し、実行中の処理に応じてクロック周波数と電圧を調整する重要性を指摘した。低消費電力のAMBAインターフェースであるQチャネルやPチャネルは、クロック停止、電力ドメイン、複数状態の管理を制御する仕組みを提供する。

チップ内の相互接続ネットワークも中心的な役割を果たす。SignatureIPは、クロック停止機能と、ネットワーク・オン・チップの各ノード向けに独立した電力状態を採用している。しかし、電力削減には、削減量と動作復帰時間のバランスが必要となる。また、チップの挙動は一様ではない。電圧は通常、負荷、温度、経年劣化が最悪の条件となる場合に基づいて決められるが、これらの条件が常に同時に発生するとは限らない。

proteanTecsのノアム・ブルサールによれば、回路内モニタリングによって実際の安全マージンを測定し、最大のマージンが不要な場合には電圧を下げ、負荷や環境が変化した際には電圧を引き上げられる。もっとも、電圧を下げすぎると、負荷の急変や動的な電圧降下が発生した際に回路タイミングが損なわれる可能性があるため、高速な保護機構が引き続き必要となる。保護機構は、電圧が安全な水準に戻るまで、クロック周波数を下げたり、性能を一時的に制限したりする場合がある。

データセンターで実際に何が変わるのか?

より広い考え方は、通常運転中に予備容量を使用し、電源の喪失前または喪失時に負荷を削減することである。Utilidataは2つの制御ループを提案している。1つ目はより低速で負荷スケジューリングと接続され、各ラック、列、ホールで利用可能な電力の予測を提供する。これによりスケジューラーは、変動する容量に応じてGPUのタスクを割り当てられる。2つ目はより高速で、DVFSなどのインターフェースとサーバー管理を利用し、ミリ秒単位の時間範囲で電力を制御する。

この技術は作業を直接スケジュールしたりキャンセルしたりするのではなく、電力データを通じてスケジューラーに影響を与える。NVIDIAの管理ライブラリとベースボード管理コントローラー(BMC)を利用して電力挙動と測定値にアクセスし、個々のサーバーの推定値を集計するのではなく、ラックレベルで直接測定する。ホーモンによれば、この方法により、3+1構成の4系統を通常時には約95%から98%の容量で稼働させ、必要に応じて負荷を秩序立てて削減できる可能性がある。

制約と未解決の問題

予備容量を活用できるからといって、サーバーの追加が無料になったり、制約なしに可能になったりするわけではない。追加設備にはスペース、冷却、通信が必要となる。また、AI負荷の移行には、実行中のリクエストを処理してモデルの重みを別のコピーへロードする作業が必要になる場合があり、これには数秒かかる可能性がある。一方、電源の障害に対処するにはチップの電圧を下げるだけでは不十分であり、監視と対応をラックおよび施設レベルで行わなければならない。

この構成は、機微なセキュリティ面も生み出す。BMCを搭載したサーバーはすべて、十分な権限を持つプロセス向けに電力上限を設定するインターフェースをGPUホストが公開していることを示しているためだ。そのためUtilidataは、自社システムがセキュアブート、ハードウェアのルート・オブ・トラスト、署名済みファームウェア、インターフェース上の相互認証に依存し、インターネットに依存せず制御ループをローカルで実行すると述べている。編集上の重要性は、予備電力を固定的な余裕から管理可能な資源へ転換する点にある。しかし、その成功は、事業者が迅速な対応を保証し、負荷に悪影響を与えず、一度に数千台のサーバーに影響を及ぼし得る制御ツールを安全に保護できるかどうかにかかっている。

ニュースの出典
Semiconductor Engineering
原文を開く ↗
ف
著者

فريق تحرير certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る