Die Erweiterung der KI-Kapazitäten in Rechenzentren hängt nicht mehr nur von der Anzahl der Prozessoren und Beschleuniger ab, sondern auch davon, wie diese Ressourcen verteilt und mit den übrigen Systemkomponenten verbunden werden. Der Artikel entwirft ein hybrides Konzept, das einige Ressourcen in der Nähe des Prozessors belässt, andere Ressourcen über mehrere Server hinweg skaliert und kostenintensive Ressourcen wie Grafikprozessoren und NVMe-Speicher über eine gemeinsame Infrastruktur verfügbar macht.
PCI Express beziehungsweise PCIe spielt in diesem Konzept eine zentrale Rolle, da es ein umfangreiches Hardware- und Software-Ökosystem für die Verbindung von Prozessoren, Grafikprozessoren, Beschleunigern, SmartNIC- oder DPU-Einheiten sowie Speichergeräten bereitstellt. Die höheren Übertragungsgeschwindigkeiten und die wachsende Zahl angeschlossener Geräte bringen jedoch Herausforderungen mit sich, die über die bloße Bereitstellung zusätzlicher Anschlüsse hinausgehen. Hier kommen die kombinierten Funktionen von PCIe-Switches und Retimern ins Spiel.
Drei Muster für die Ressourcenverteilung
Das Muster der Skalierung innerhalb des Systems, also Scale-up, bietet den höchsten Grad an Nähe zwischen Prozessor und Beschleunigern und eignet sich daher für latenzempfindliche KI-Workloads. Dieses Muster stößt jedoch an Grenzen hinsichtlich der Anzahl der Prozessor-Lanes, des verfügbaren Platzes im Gehäuse, des Energie- und Kühlbedarfs sowie der Zahl der Geräte, die der Server aufnehmen kann.
Die Skalierung über mehrere Server, also Scale-out, verteilt die Leistung auf mehrere Knoten mithilfe von Ethernet oder InfiniBand. Dies ermöglicht das Wachstum von Clustern, führt jedoch zu zusätzlicher Latenz und erfordert Software, die Daten und Workloads zwischen den Knoten koordinieren kann.
Im Gegensatz dazu trennt die disaggregierte Infrastruktur bestimmte Ressourcen wie Grafikprozessoren, Speicher oder SmartNIC- und DPU-Einheiten von der Bindung an einen einzelnen Server, sodass sie über ein gemeinsames Fabric verfügbar werden. Dies kann die Ressourcenauslastung verbessern und die Rechenleistung sowie die Endpunkte unabhängig voneinander skalieren. Gleichzeitig entstehen jedoch zusätzliche Fragen hinsichtlich Ressourcenkonkurrenz, Isolation, Verwaltung und Latenz.
Der Artikel stellt daher keines dieser Muster als umfassenden Ersatz für die anderen dar. Die praktische Entscheidung besteht darin, festzulegen, welche Ressourcen lokal verbleiben müssen, welche über mehrere Server verteilt werden sollten und bei welchen Ressourcen sich die gemeinsame Nutzung durch mehrere Systeme wirtschaftlich rechtfertigt.
Was bringt PCIe 7.0?
PCIe 7.0 verdoppelt die Rohübertragungsrate pro Lane gegenüber PCIe 6.x auf 128 GT/s und bietet bei einer x16-Konfiguration bis zu 512 Gigabyte pro Sekunde bidirektionale Bandbreite. Dieser Zuwachs schafft mehr Spielraum für eine wachsende Zahl von Beschleunigern und Plattformen mit hohem Datendurchsatz, während die Rückwärtskompatibilität mit dem breiteren PCIe-Ökosystem erhalten bleibt.
Die höhere Geschwindigkeit allein reicht jedoch nicht aus, um ein skalierbares System aufzubauen. Die höhere Signalfrequenz erschwert den Umgang mit Kanalverlust, Reflexionen, Übersprechen, Rauschen und Jitter. Außerdem bleiben PCIe 5.0 und PCIe 6.x wichtige Bestandteile aktueller Infrastrukturen, wodurch die generationsübergreifende Kompatibilität zu einem praktischen Faktor bei der Systemauslegung wird.
Der PCIe-Switch zur Skalierung und Verkehrssteuerung
Ein PCIe-Switch empfängt Transaktionen, bestimmt deren Ziel und leitet sie zwischen Upstream- und Downstream-Ports weiter. Dadurch kann er die Zahl der Verbindungspunkte erhöhen, flexiblere Strukturen unterstützen und direkte Kommunikationspfade zwischen den angeschlossenen Geräten bereitstellen.
Die Anzahl der Ports und die maximale Geschwindigkeit allein bestimmen jedoch nicht die tatsächliche Leistung. Wenn Grafikprozessoren, Speicher und Steuerverkehr um dieselbe Bandbreite konkurrieren, werden Arbitrierungsmechanismen, Pufferung, Credit-Management, Oversubscription-Richtlinien und die Vermeidung von Head-of-Line-Blocking zu Faktoren, die die nutzbare Leistung beeinflussen. Außerdem kann jeder zusätzliche Hop über den Switch die Latenz erhöhen und einen neuen Konkurrenzpunkt schaffen.
Die Konfigurierbarkeit gewinnt insbesondere für Chipdesign-Teams an Bedeutung, da unterschiedliche Portaufteilungen, Optionen für Upstream-Ports, verschiedene Anzahlen von Endpunkten und mehrere Verkehrsmuster innerhalb einer einzigen Switch-Architektur unterstützt werden können.
Retimer zur Bewältigung von Entfernung und Signalqualität
Wenn Ressourcen weiter vom Prozessor entfernt angeordnet werden und längere Leiterbahnen auf der Platine, Steckverbinder, Kabel oder Erweiterungsgehäuse zum Einsatz kommen, wird der elektrische Kanal anspruchsvoller. Ein Retimer stellt Takt und Daten wieder her, terminiert einen elektrischen Abschnitt und überträgt anschließend ein bereinigtes Signal an den nächsten Abschnitt.
Diese Komponenten geben den Designern mehr Flexibilität bei der Verteilung der Geräte, machen die Entfernung jedoch nicht unbegrenzt. Jeder retimte Abschnitt muss entworfen und getestet werden, wobei Latenz, Energieverbrauch, Wärme, Entzerrung, Diagnose sowie die Kompatibilität zwischen Prozessoren, Endpunkten, PHY-Schnittstellen, Steckverbindern, Kabeln und Firmware berücksichtigt werden müssen.
Was sollte vor der Auswahl einer Lösung gemessen werden?
Der Artikel empfiehlt, die Bewertung mit einem Workload und einer Topologie zu beginnen, die der tatsächlichen Nutzung entsprechen, statt von einer allgemeinen Spezifikationsliste auszugehen. Die Teams sollten die erforderliche Bandbreite und Latenz, die Anzahl der eingehenden und ausgehenden Verbindungen, den Grad der Oversubscription, die Verkehrsmischung, den Kanalverlust, den Energieverbrauch, die Verwaltbarkeit und die Interoperabilitätsziele bestimmen.
Aus dieser Perspektive bieten PCIe-Switches Skalierbarkeit und Verkehrslenkung, während Retimer die nutzbare Entfernung erweitern und die Signalintegrität bewahren. Der Artikel nennt die PCIe-Switches und Retimer-Controller von Rambus als Designbausteine für ASIC- und FPGA-Implementierungen. Der praktische Wert wird jedoch weniger am Namen der Komponente gemessen als an ihrer Eignung für den Workload, die Topologie und die elektrischen Randbedingungen des Systems.
Redaktionelle Einordnung: Die tatsächliche Veränderung besteht hier nicht in der Einführung eines neuen Standards oder Produkts, sondern darin, dass sich die Designentscheidung für eine KI-Infrastruktur von der Frage nach der maximalen Geschwindigkeit hin zu einer Abwägung zwischen Nähe, Skalierbarkeit, Ressourcenauslastung und Signalqualität verlagert. Die grundlegenden Einschränkungen bleiben deutlich: Je höher die Zahl der Hops und gemeinsam genutzten Komponenten, desto größer werden die Komplexität der Verwaltung, die Konkurrenz und die Latenz. Außerdem stellt der Artikel, da es sich um einen von Rambus gesponserten Blogbeitrag handelt, den Rahmen aus einer Marketingperspektive dar und präsentiert weder unabhängige Messergebnisse noch einen Vergleich zwischen Anbietern.