Cloud Computing und Rechenzentren

KI-Rechenzentren stehen vor einem Problem mit gebundener Energie, die in Rechenleistung umgewandelt werden kann

KI-Rechenzentren verbrauchen aufgrund von Notstromsystemen und Zuverlässigkeitsanforderungen einen Teil ihrer verfügbaren elektrischen Leistung, wodurch Kapazität ungenutzt bleibt. Die Analyse stellt Techniken zur Spannungsabsenkung und Lastverwaltung vor, die es ermöglichen könnten, diese Kapazität zu nutzen und bei Ausfall einer Versorgungsquelle schnell zurückzufahren, wobei Herausforderungen bei Planung, Sicherheit und Fehlerreaktion bestehen bleiben.

2026-09-15
5 Min. Lesezeit
3 Aufrufe
فريق تحرير certi.news
KI-Rechenzentren stehen vor einem Problem mit gebundener Energie, die in Rechenleistung umgewandelt werden kann

Das Energieproblem in KI-Rechenzentren besteht nicht nur darin, wie viel Strom verbraucht wird, sondern auch darin, wie viel Leistung bezahlt und für den Umgang mit Ausfällen reserviert wird und anschließend ungenutzt bleibt. Eine am 15. September 2026 von Semiconductor Engineering veröffentlichte Analyse zeigt ein grundlegendes Paradoxon: Eine Senkung des Verbrauchs von Chips und Servern verbessert zwar die Effizienz, kann aber den Abstand zwischen verfügbarer und tatsächlich genutzter Leistung vergrößern, während die Struktur der Notstromversorgung Betreiber dazu zwingt, einen großen Teil der Kapazität außerhalb des normalen Betriebs ungenutzt zu lassen.

Die Bedeutung dieses Problems nimmt mit der Ausweitung von KI-Lasten zu, da die Beschaffung neuer elektrischer Leistung Übertragungsleitungen, Genehmigungen und zusätzliche Erzeugung am Standort erfordern kann. Laut Marisa Hummon, technische Leiterin bei Utilidata, kann es einfacher sein, einer bereits verfügbaren Leistung zusätzliche Ausrüstung hinzuzufügen, als ein neues Rechenzentrum zu bauen oder auf eine Erhöhung der Versorgung zu warten.

Warum bleibt Leistung ungenutzt?

Rechenzentren werden üblicherweise so ausgelegt, dass sie den Ausfall einer Versorgungsquelle ohne Dienstunterbrechung verkraften. Bei einer „3+1“-Anordnung benötigt die Anlage drei Quellen mit voller Leistung und fügt eine vierte als Reserve hinzu, sodass die vier Quellen mit etwa 75 % ihrer Leistung betrieben werden können und die drei verbleibenden Quellen die Last beim Ausfall einer Quelle abdecken. In einer 2N-Architektur erfolgt die Versorgung doppelt, und die Last jeder Leitung wird vorsorglich bei etwa 50 % gehalten, falls die andere ausfällt.

Hummon erklärt, dass ein für 2 Gigawatt ausgelegter Standort bei einer 2N-Auslegung praktisch als Standort mit 1 Gigawatt behandelt werden kann; innerhalb dieser Leistung werden normalerweise nur etwa 70 % bis 80 % genutzt. Damit kann die Leistung, die bei Betrachtung des gesamten Standorts tatsächlich die Recheninfrastruktur erreicht, ungefähr ein Drittel der nominalen Leistung von 2 Gigawatt betragen. Dies ist keine durch einen Gerätefehler verursachte Verschwendung, sondern eine direkte Folge der Zuverlässigkeitsanforderungen und Betriebsreserven.

Eine Senkung des Chipverbrauchs löst das Problem allein nicht

Die Energieoptimierung beginnt beim Schaltungsdesign und bei der Verwaltung der in den Chip integrierten Intellectual Property. Arif Khan von Cadence wies auf die Bedeutung hin, nicht genutzte Schnittstellen und Kanäle abzuschalten, mehrere Bereitschaftszustände zu verwenden und Taktfrequenz sowie Spannung an die aktuelle Arbeit anzupassen. Stromsparende AMBA-Schnittstellen wie die Q- und P-Kanäle bieten Mechanismen zur Steuerung der Taktabschaltung, von Power Domains und der Verwaltung mehrerer Zustände.

Das Netzwerk innerhalb des Chips spielt eine zentrale Rolle, da SignatureIP für Knoten des Network-on-Chip abschaltbare Takte und unabhängige Energiezustände nutzt. Eine Senkung der Leistung erfordert jedoch ein Abwägen zwischen dem Umfang der Einsparung und der Zeit bis zur Wiederaufnahme des Betriebs. Außerdem verhalten sich Chips nicht identisch: Die Spannung wird üblicherweise anhand der schlechtesten Last-, Temperatur- und Alterungsbedingungen festgelegt, obwohl diese Bedingungen nicht immer gleichzeitig auftreten.

Die In-Circuit-Überwachung kann laut Noam Broussard von proteanTecs die tatsächliche Sicherheitsmarge messen und die Spannung senken, wenn die maximalen Margen nicht erforderlich sind, und sie bei einer Änderung der Last oder der Bedingungen wieder erhöhen. Es bleibt jedoch ein schnelles Schutzmechanismus erforderlich, da eine zu starke Spannungsabsenkung das Timing der Schaltungen gefährden kann, wenn sich die Last plötzlich ändert oder ein dynamischer Spannungseinbruch auftritt. Der Schutz kann darin bestehen, die Taktfrequenz zu senken oder die Leistung vorübergehend zu begrenzen, bis die Spannung wieder ein sicheres Niveau erreicht.

Was ändert sich praktisch im Rechenzentrum?

Die übergeordnete Idee besteht darin, die Reserveleistung während des normalen Betriebs zu nutzen und die Lasten vor oder beim Ausfall einer Versorgungsquelle zu senken. Utilidata schlägt zwei Regelkreise vor: Der erste ist langsamer und mit der Lastplanung verbunden. Er liefert Prognosen zur verfügbaren Leistung für jeden Schrank, jede Reihe oder jeden Saal, damit der Scheduler Aufgaben von Grafikprozessoren entsprechend der wechselnden Kapazität verteilt. Der zweite ist schneller und nutzt Schnittstellen wie DVFS sowie Servermanagement, um die Leistung innerhalb eines Zeitbereichs von Millisekunden zu steuern.

Die Technologie plant oder beendet die Arbeit nicht direkt, sondern beeinflusst den Scheduler über Leistungsdaten. Sie nutzt die NVIDIA-Managementbibliothek und den Baseboard Management Controller (BMC), um auf Leistungsverhalten und Messwerte zuzugreifen, und misst direkt auf Rack-Ebene, statt Schätzungen einzelner Server zu aggregieren. Laut Hummon könnte dieser Ansatz ermöglichen, die vier Leitungen einer 3+1-Anordnung unter normalen Bedingungen mit etwa 95 % bis 98 % ihrer Leistung zu betreiben und die Last bei Bedarf anschließend kontrolliert zu reduzieren.

Beschränkungen und offene Fragen

Die Nutzung der Reserveleistung bedeutet nicht, dass das Hinzufügen von Servern kostenlos oder ohne Einschränkungen wird. Zusätzliche Ausrüstung benötigt Platz, Kühlung und Netzwerkverbindungen. Außerdem kann die Verlagerung von KI-Lasten das Entleeren laufender Anfragen und das Laden von Modellgewichten auf eine andere Kopie erfordern; diese Vorgänge können Sekunden dauern. Umgekehrt reicht eine alleinige Senkung der Chipspannung nicht aus, um einen Ausfall einer Versorgungsquelle zu bewältigen; Überwachung und Reaktion müssen auf Rack- und Anlagenebene erfolgen.

Diese Architektur erweitert zudem die sensible Angriffsfläche. Jeder Server ist mit einem BMC ausgestattet, während die Hosts von Grafikprozessoren Schnittstellen zur Festlegung von Leistungsgrenzen für Prozesse mit ausreichenden Berechtigungen offenlegen. Daher erklärt Utilidata, dass sein System auf sicherem Booten, einer Hardware-Root-of-Trust, signierter Firmware und gegenseitiger Authentifizierung an den Schnittstellen basiert; außerdem wird der Regelkreis lokal betrieben und ist nicht vom Internet abhängig. Die redaktionelle Bedeutung dieser Entwicklung liegt darin, Reserveenergie von einer starren Marge in eine verwaltbare Ressource umzuwandeln. Der Erfolg hängt jedoch davon ab, ob der Betreiber eine schnelle Reaktion gewährleisten, die Lasten unbeeinträchtigt lassen und die Steuerungsinstrumente absichern kann, die auf Tausende von Servern gleichzeitig einwirken könnten.

Nachrichtenquelle
Semiconductor Engineering
Originalquelle öffnen ↗
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen