Aktuelle Berichte, Erklärungen und verbundene Technologiethemen.
Rechenzentren bewegen sich auf heterogene Cluster zu, die CPUs, GPUs, NPUs, kundenspezifische Beschleuniger und optische Verbindungen kombinieren, statt für alle Aufgaben auf eine einzige GPU zu setzen. Dadurch werden Software sowie Netzwerk- und Energiemanagement zu entscheidenden Faktoren, um die Tokenkosten zu senken und die Hardwareauslastung zu verbessern.
Das Start-up Etched hat 700 Millionen Dollar bei einer Bewertung von 21 Milliarden Dollar eingesammelt, nachdem Jane Street das erste vollständige KI-System getestet hatte, das das Unternehmen ausgeliefert hatte, und das System für den Betrieb in seinem Rechenzentrum kaufte. Die Finanzierung spiegelt die Wette auf die Designs des Unternehmens wider, die Inferenz von KI-Modellen zu beschleunigen und ihre Kosten zu senken.
Sharad Choul von Expedera analysiert, wie der Übergang von herkömmlichen Bildverarbeitungsnetzwerken zu LLM- und VLM-Modellen bei Edge-Geräten die Art des Engpasses verändert: weg von der Rechenleistung hin zur Speicherbewegung. Er erläutert die Rolle der paketbasierten Verarbeitung bei der Reduzierung des externen Datentransfers und der Verbesserung des Modellbetriebs in Fahrzeugen und eingebetteten Geräten.