Aktuelle Berichte, Erklärungen und verbundene Technologiethemen.
JetBrains hat die Funktion Junie Local vorgestellt, die den Programmieragenten Junie lokal auf einem Mac mit dem Modell Qwen3.6-27B ausführt, ohne Code oder Eingaben an die Cloud zu senden. Dafür sind ein Mac mit M5-Prozessor und 64 Gigabyte Arbeitsspeicher sowie ein Download von etwa 20 Gigabyte erforderlich.
JetBrains erläutert die Änderungen an Junie und der Inferenz-Engine, um Qwen3.6-27B lokal auf MacBooks mit M5-Chip auszuführen. Das Experiment zeigt, dass die Leistung lokaler Programmieragenten ebenso stark von der Kontextverwaltung und der Prefill-Phase abhängt wie von der Geschwindigkeit der Token-Generierung.
Rechenzentren bewegen sich auf heterogene Cluster zu, die CPUs, GPUs, NPUs, kundenspezifische Beschleuniger und optische Verbindungen kombinieren, statt für alle Aufgaben auf eine einzige GPU zu setzen. Dadurch werden Software sowie Netzwerk- und Energiemanagement zu entscheidenden Faktoren, um die Tokenkosten zu senken und die Hardwareauslastung zu verbessern.
Das Start-up Etched hat 700 Millionen Dollar bei einer Bewertung von 21 Milliarden Dollar eingesammelt, nachdem Jane Street das erste vollständige KI-System getestet hatte, das das Unternehmen ausgeliefert hatte, und das System für den Betrieb in seinem Rechenzentrum kaufte. Die Finanzierung spiegelt die Wette auf die Designs des Unternehmens wider, die Inferenz von KI-Modellen zu beschleunigen und ihre Kosten zu senken.
Sharad Choul von Expedera analysiert, wie der Übergang von herkömmlichen Bildverarbeitungsnetzwerken zu LLM- und VLM-Modellen bei Edge-Geräten die Art des Engpasses verändert: weg von der Rechenleistung hin zur Speicherbewegung. Er erläutert die Rolle der paketbasierten Verarbeitung bei der Reduzierung des externen Datentransfers und der Verbesserung des Modellbetriebs in Fahrzeugen und eingebetteten Geräten.