Chips und Halbleiter

REACH schlägt eine kostengünstigere Architektur zum Schutz von HBM vor Speicherkorrumpierung während der Inferenz von KI-Modellen vor

Forschende des Rensselaer Polytechnic Institute und von IBM haben die REACH-Architektur zur Verwaltung von Fehlerkorrekturcodes über große Spannweiten innerhalb eines HBM-Controllers vorgestellt. Ziel ist es, die Kosten der Dekodierung bei Inferenz-Workloads großer Sprachmodelle zu senken. Der Ansatz nutzt interne Codes für häufige Fehler und einen externen Code zur Reparatur von Abschnitten, die bekanntermaßen als Auslöschungen markiert sind.

2026-09-11
3 Min. Lesezeit
10 Aufrufe
فريق تحرير certi.news
REACH schlägt eine kostengünstigere Architektur zum Schutz von HBM vor Speicherkorrumpierung während der Inferenz von KI-Modellen vor

Forschende des Rensselaer Polytechnic Institute und des IBM T.J. Watson Research Center haben eine technische Arbeit veröffentlicht, in der eine neue Architektur für die Verwaltung der Fehlerkorrektur von High-Bandwidth Memory (HBM) vorgeschlagen wird, das in Workloads zur Inferenz künstlicher Intelligenz eingesetzt wird. Die Architektur trägt den Namen REACH, ein Akronym für den Titel der Arbeit „REACH: Controller-Managed Long-Span ECC for HBM AI Inference“.

Die Arbeit behandelt ein praktisches Problem in HBM-Systemen: Die hohen Speicherkosten führen zu einem Bedarf an stärkerem Schutz, der mit einer größeren Bandbreite an Fehlerraten von Speichergeräten umgehen kann, ohne den Fehlerkorrekturmechanismus zu einer erheblichen Belastung für den Speichercontroller oder die für die Inferenz verfügbare Bandbreite zu machen.

Wie funktioniert der Ansatz?

REACH schlägt vor, zunächst interne Fehlerkorrekturcodes zur Behandlung häufiger Fehler einzusetzen und anschließend die noch nicht korrigierten Abschnitte zu bestimmen. Danach wird ein externer Code mit großer Spannweite reserviert, um diese Abschnitte zu reparieren, wenn bekannt ist, dass es sich um Auslöschungsfälle handelt. Dadurch müssen nicht alle Speicherzugriffe so behandelt werden, als benötigten sie eine Dekodierung über eine große Spannweite.

Die Arbeit weist darauf hin, dass die direkte Anwendung von Codes mit großer Spannweite kleine Zugriffe an einen Zustand binden kann, der sich über einen größeren Datenbereich erstreckt. Außerdem kann sie bei HBM-Geschwindigkeiten hohe Dekodierungskosten verursachen. Daher konzentriert sich die vorgeschlagene Architektur darauf, einen Teil des Schutzes im Speichercontroller auszuführen und die umfassendere Reparatur auf Fälle zu verschieben, in denen ausreichende Informationen über die Position der Daten vorliegen, die nicht direkt wiederhergestellt werden können.

Warum ist diese Nachricht relevant?

REACH nutzt die Eigenschaften von Inferenz-Workloads großer Sprachmodelle, die laut Beschreibung der Arbeit überwiegend durch Lesevorgänge geprägt sind. Sequentielle Lesevorgänge können die Zusammenfassung von Datenbereichen ermöglichen, bevor der umfassendere Schutzmechanismus angewendet wird, während verstreute Schreibvorgänge die Bewegung zur Aktualisierung von Paritätsdaten begrenzen. Auf diese Weise versucht die Architektur, den Fehlerkorrekturmechanismus an das tatsächliche Zugriffsmuster bei der Inferenz anzupassen, anstatt ein einheitliches Design für alle Arten von Workloads zu verwenden.

Die praktische Bedeutung liegt hier nicht nur im Hinzufügen einer weiteren Schutzschicht, sondern im Ausbalancieren von Zuverlässigkeit, Controllerkosten und Bandbreite. Eine stärkere Fehlerkorrektur kann nützlich sein, wenn die Fehlerraten von Speichergeräten steigen, kann im Gegenzug jedoch zusätzlichen Rechenaufwand und zusätzliche Datenübertragungen verursachen. REACH bietet ein Konzept zur Verringerung dieser Belastung, indem der externe Code in bekannten Reparaturfällen eingesetzt wird, während die internen Codes für den normalen Pfad zuständig bleiben.

Was belegt das Material und was nicht?

Das in dem veröffentlichten Material verfügbare Ergebnis ist eine Zusammenfassung der Architekturidee und der Gründe für ihre Eignung zur Inferenz großer Sprachmodelle. Der extrahierte Text enthält keine Zahlen zur Höhe der Kosten- oder Energieeinsparung oder zu den Auswirkungen von REACH auf Latenz und Datenübertragungsrate. Ebenso enthält er keinen quantitativen Vergleich mit anderen HBM-Designs. Daher sollte sie als vorgeschlagenes Forschungsdesign betrachtet werden, nicht als fertiger kommerzieller Nachweis oder als veröffentlichte Leistungszahl.

Die Arbeit wurde im September 2026 unter ihrem vollständigen Titel auf arXiv eingestellt und trägt die Nummer arXiv:2609.10861; die DOI lautet 10.48550/arXiv.2609.10861. An ihrer Erstellung waren Rui Xie, Yunhua Fang, Asad Ul Haq, Linsen Ma, Sanchari Sen, Swagath Venkataramani, Liu Liu und Tong Zhang beteiligt.

Nachrichtenquelle
Semiconductor Engineering
Originalquelle öffnen ↗
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen