Künstliche Intelligenz

High-Bandwidth-Flash-Speicher könnte die Servicelatenz großer Sprachmodelle um bis zu 87 % senken

Eine Studie der UC Berkeley und von FuriosaAI untersucht den Einsatz von High Bandwidth Flash zur Erweiterung des Speichers von KI-Beschleunigern beim Betrieb großer Sprachmodelle. Simulationen zufolge könnte die Abschlusslatenz um bis zu 87 % sinken, bei potenziellen Verbesserungen des Energieverbrauchs und einer Verlängerung der Schreibhaltbarkeit durch cache-bewusste Planung.

2026-10-02
3 Min. Lesezeit
12 Aufrufe
certi.news Editorial Team
High-Bandwidth-Flash-Speicher könnte die Servicelatenz großer Sprachmodelle um bis zu 87 % senken

Eine Forschungsarbeit der University of California, Berkeley, und FuriosaAI schlägt den Einsatz von High Bandwidth Flash (HBF) als zusätzliche Speicherschicht neben High Bandwidth Memory (HBM) und Hostspeicher vor, um den Anforderungen beim Betrieb großer Sprachmodelle gerecht zu werden. Die Arbeit befasst sich mit den Herausforderungen, die durch wachsende Modellgrößen und längere Gesprächskontexte entstehen, wodurch Speicherkapazität und Bandbreite zu Engpässen für die Inferenzleistung werden.

Systeme für den Betrieb großer Sprachmodelle halten Modellgewichte und KV cache-Daten im Speicher. Die Aufbewahrung dieser Daten gewinnt bei agentischen Workloads an Bedeutung, die wiederholte Interaktionen innerhalb von Kontexten ausführen, die mit der Zeit wachsen. Die Erweiterung des Speichers durch HBF bringt jedoch Zielkonflikte mit sich: Flash ist beim Zugriff langsamer als HBM, und seine Schreibhaltbarkeit ist im Vergleich zu flüchtigem Speicher begrenzt.

Was wurde in der Arbeit untersucht?

Die Forschenden stellten eine hierarchische Speicherarchitektur vor, die HBM, HBF und Hostspeicher kombiniert, ergänzt durch einen temporären Planungsmechanismus, der den Inhalt des Caches und die Datenpositionen berücksichtigt. Mithilfe von durch reale Ablaufspuren gesteuerten Simulationen analysierten sie den Einfluss von Entscheidungen zur Datenplatzierung und -planung auf Ausführungszeit, Energieverbrauch und die erwartete Schreibhaltbarkeit von HBF.

Den veröffentlichten Ergebnissen zufolge verkürzten die schnellsten HBF-gestützten Systeme die Abschlusslatenz im Vergleich zu Systemen, die ausschließlich auf HBM basieren, um 36,1 % bis 87,0 %. Die berechneten Energieeinsparungen erreichten in den bewerteten Szenarien 55,8 %.

Der Vorteil ist nicht bei jedem Workload garantiert

Die Ergebnisse stellen HBF nicht als direkten Ersatz für HBM dar. Die Arbeit stellte fest, dass der Einsatz von HBF bei einigen leichten Workloads den Energieverbrauch erhöhte. Das bedeutet, dass der Nutzen von der Art der Last, der Größe der vorgehaltenen Daten und der Planung der Lese- und Schreibvorgänge abhängt.

Die Bedeutung des Schreibmanagements zeigt sich deutlich bei der Schätzung der Betriebsdauer. Die cache-bewusste temporäre Planung erhöhte die erwartete Schreibhaltbarkeit von HBF in der bewerteten Konfiguration von 4,77 auf 14,82 Jahre.

Warum ist diese Forschung wichtig?

Die Ergebnisse zeigen, dass das Hinzufügen einer größeren Speicherschicht allein nicht ausreicht, um Engpässe beim Betrieb der Modelle zu beseitigen. Die Vorteile hängen von der Abstimmung des Datenstandorts mit der Planungsstrategie ab, sodass Inferenz-Workloads mit langen Kontexten von der zusätzlichen Kapazität profitieren können, ohne die Lebensdauer des Flash-Speichers zu verkürzen oder unnötige Energiekosten zu verursachen.

Für Entwickler von KI-Beschleunigern und Betreiber von Infrastrukturen eröffnet die Arbeit einen Forschungspfad zur Erweiterung der Speicherkapazität über HBM hinaus, belegt jedoch noch nicht die allgemeine kommerzielle Praxistauglichkeit. Die Ergebnisse basieren auf Simulationen und Ablaufspuren aus dem Betrieb; die tatsächliche Leistung und Lebensdauer werden zudem von der Hardwarearchitektur, den Eigenschaften der Workloads und den Speicherverwaltungsrichtlinien in realen Systemen abhängen.

Die Arbeit trägt den Titel „Characterizing High Bandwidth Flash for LLM Serving“. An ihrer Erstellung waren Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer und Amir Gholami beteiligt. Sie wurde im September 2026 als Forschungsentwurf auf arXiv unter der Nummer arXiv:2609.39131 veröffentlicht.

Nachrichtenquelle
Semiconductor Engineering
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen