Rani Borkar, die bei Microsoft die Organisationen leitet, die für die Planung, Entwicklung, Konstruktion und Bereitstellung der Hardware und Infrastruktur der Cloud-Computing-Plattform verantwortlich sind, entwirft eine andere Vorstellung davon, wie der Fortschritt im Zeitalter der künstlichen Intelligenz gemessen werden kann. Statt sich auf die Anzahl der Chips, die Größe der Rechenzentren oder die Zahl der Token zu konzentrieren, die ein System erzeugen kann, schlägt sie vor, das Konzept des „Ertrags“ (Yield) zu übernehmen: also die Menge an nützlichem Ergebnis, die aus den verfügbaren Ressourcen erzeugt werden kann.
Borkar entlehnt das Konzept der Halbleiterindustrie, in der sich der Ertrag auf die Anzahl funktionsfähiger Chips bezieht, die aus jedem Wafer gewonnen werden können. Ihrer Auffassung nach sollte dieses Prinzip auf Kapital, Energie, Speicher, Verbindungen, Modelle und Software ausgeweitet werden – bis hin zu dem Wert, den künstliche Intelligenz bei der Arbeit und im täglichen Leben schafft.
Warum reicht eine Erweiterung der Infrastruktur nicht mehr aus?
Der Artikel weist darauf hin, dass sich die Verbreitung künstlicher Intelligenz schneller beschleunigt hat als bei Internet, PCs und Smartphones. Weltweit wird sie jedoch weiterhin nur von etwa 18 % der Erwerbsbevölkerung genutzt, wobei der Großteil der Nutzung auf Gespräche entfällt. Mit dem Übergang der Systeme zu Aufgaben wie Schlussfolgern, Planen, der Nutzung von Werkzeugen und der Ausführung längerer agentischer Arbeitsabläufe verändern sich die Anforderungen an die Infrastruktur grundlegend.
Borkar zufolge kann eine einzige agentische Aufgabe mehr als das 3400-Fache der Token-Anzahl verbrauchen, die bei gewöhnlichen Chat-Interaktionen anfällt. Diese Zunahme belastet Energieversorgung, Rack-Dichte, Bandbreite und Speicherkapazität. Ihrer Ansicht nach kann die traditionelle Antwort – mehr Silizium, Speicher, Energie und Glasfaser hinzuzufügen – nicht unbegrenzt fortgesetzt werden, da jeder neue Fortschritt möglicherweise größere Eingaben als die vorherige Generation erfordert.
Die Vision umfasst zwei parallele Wege: schrittweise Verbesserungen bestehender Architekturen zur Steigerung von Effizienz, Auslastung und Wirtschaftlichkeit sowie tiefgreifendere Veränderungen, die durch neue Architekturen, Materialien und Methoden beim Entwurf von Systemen und Modellen die Leistungskurve neu gestalten. Borkar verweist auf den Übergang zu Mehrkern-Designs, nachdem die Erhöhung der Taktfrequenz an eine Energiegrenze gestoßen war, sowie auf den Übergang des NAND-Speichers von einem planaren zu einem vertikalen Design.
Der Ertrag ist das Ergebnis der Zusammenarbeit aller Ebenen
Der Artikel betont, dass sich ein Engpass nicht unbedingt auf der Ebene lösen lässt, auf der er auftritt. Die Messung der Leistung einer einzelnen Komponente reicht nicht aus, da sich Gewinne und Verluste zwischen Rechenzentrum, Silizium, Modellen und den Werkzeugen, die agentische Aufgaben koordinieren, aufaddieren. Deshalb fordert Borkar ein „Co-Design“, das zunächst das gewünschte Ergebnis festlegt und anschließend das gesamte System optimiert, statt die Leistung eines einzelnen Elements zu maximieren.
Beim Speicher ist Microsoft der Ansicht, dass das Problem nicht nur in einem Mangel an Komponenten besteht, sondern eine Herausforderung auf Systemebene darstellt. Inferenz muss größere Modelle und längere Kontexte aufnehmen und Daten schnell bereitstellen können, während Agenten innerhalb von Schleifen, die sich über Minuten oder Stunden erstrecken können, Generierung, Abruf, Werkzeugnutzung und dauerhaften Speicher hinzufügen. Die Erfahrung mit der Azure-Maia-Plattform zeigt, dass sich der Verbrauch des KV-Cache-Speichers durch die Verbindung von Modellarchitektur, Datenwissenschaft und Komprimierung senken lässt – ergänzt durch Softwaremanagement für Speicherhierarchien sowie Optimierungen von Silizium, Datenbewegungen und Compilern.
Die Idee besteht hier nicht lediglich darin, neue Bytes hinzuzufügen, sondern aus jedem verfügbaren Byte mehr nützliche Intelligenz herauszuholen.
Von Netzwerken bis zur Energie
Auf Clusterebene entsteht die Intelligenz nicht durch einen einzelnen Chip, sondern durch Tausende von Chips, die als ein System zusammenarbeiten. Deshalb hängt das Ergebnis nicht allein von der Geschwindigkeit der Verbindungen ab, sondern auch vom Überlastungsmanagement, der Fehlerbehebung, der Verteilung von Arbeitslasten, der Komplexität der Programmierung und den Grenzen zwischen Silizium, System und Software.
Borkar zufolge begann das Design der Maia-Plattform mit dem angestrebten Ergebnis – effizienter Inferenz im Maßstab der gesamten Flotte – und nicht mit einem bereits festgelegten Netzwerkdesign. Dazu gehörten der Aufbau eines zweistufigen Skalierungsnetzwerks, die Integration von Funktionen der Netzwerkkarte in den Chip und die Entwicklung einer eigenen Transportschicht. Dem Artikel zufolge führte dieser Ansatz zu skalierbarer Leistung in dichten Inferenzclustern, einer vereinfachten Programmierung, einer höheren Flexibilität der Arbeitslasten und weniger benötigter Netzwerkhardware.
Bei der Energie hat sich der Fokus von einer Ressource, die das System verbraucht, zu einer Einschränkung verschoben, die bereits vom Stromnetz bis hin zum Chip in das Design einfließen muss. Der Artikel weist auf den Anstieg der Rack-Leistung von Dutzenden auf Hunderte Kilowatt sowie darauf hin, dass Rechenzentrumskomplexe im Gigawatt-Maßstab betrieben werden. Außerdem werden Lösungen wie Festkörpertransformatoren und die Verteilung von Gleichstrom mit 800 Volt genannt, um Verteilungsverluste zu reduzieren.
Microsoft präsentiert den Arm-basierten Serverprozessor Azure Cobalt 200 als Beispiel für dieses Co-Design. Er ermöglicht jeder Kern eine individuelle Steuerung von Spannung und Frequenz und erlaubt zugleich, den Energieverbrauch jeder virtuellen Maschine softwareseitig festzulegen. Nach Angaben des Unternehmens ermöglicht die präzise Steuerung, die Energie anzupassen und gleichzeitig die Leistung kritischer Arbeitslasten zu schützen, sodass mehr Server innerhalb derselben Energiegrenzen betrieben werden können.
Was ist in der Praxis wichtig?
Die Bedeutung dieses Ansatzes liegt darin, die Diskussion vom Wettlauf um die reine Kapazität auf die Effizienz der Umwandlung von Ressourcen in Ergebnisse zu verlagern. Für Betreiber von Cloud- und Rechenzentren bedeutet dies, dass die Bewertung der Hardware nicht von Netzwerken, Software, Kühlung und Lastmanagement getrennt werden kann. Für Entwickler von Modellen und Agenten werden Speichereffizienz, Aufgabendauer und die Integration von Werkzeugen zu Faktoren, die die Skalierbarkeit ebenso beeinflussen wie die Modellgröße.
Diese Schlussfolgerung bleibt jedoch eine von Microsoft stammende Sichtweise, die teilweise auf den Erfahrungen des Unternehmens beim Aufbau und Betrieb groß angelegter Infrastrukturen für künstliche Intelligenz beruht, und stellt keinen unabhängig bestätigten Maßstab für alle Umgebungen dar. Außerdem liefert der Artikel keine detaillierten Vergleichszahlen zur Messung der Vorteile von Maia oder Cobalt 200 und nennt weder Kosten noch einen Zeitplan für die Umsetzung der genannten Lösungen außerhalb des Azure-Kontexts.
Dennoch stellt die „Notwendigkeit des Ertrags“ der Branche eine praktische Frage: Führen die wachsenden Investitionen in Energie, Chips und Rechenzentren zu einer Intelligenz, die zu angemessenen Kosten zugänglich ist, sowie zu konkreter Produktivität und greifbarem Wert? In Borkars Vorstellung ist der Ertrag nicht mit der Erzeugung von Token vollendet, sondern erst dann, wenn diese Ergebnisse in schnellere wissenschaftliche Entdeckungen, ein früher erkanntes medizinisches Signal, besseres Lernen oder neue Chancen für kleine Unternehmen umgewandelt werden.