Puces et semi-conducteurs

REACH propose une architecture moins coûteuse pour protéger la HBM contre les erreurs mémoire lors de l’inférence de modèles d’IA

Des chercheurs du Rensselaer Polytechnic Institute et d’IBM ont présenté l’architecture REACH pour gérer des codes de correction d’erreurs à longue portée au sein d’un contrôleur HBM, en visant à réduire le coût du décodage dans les charges d’inférence de grands modèles de langage. L’idée repose sur des codes internes pour les erreurs courantes et sur un code externe pour corriger les parties connues comme étant effacées.

2026-09-11
4 min de lecture
10 vues
فريق تحرير certi.news
REACH propose une architecture moins coûteuse pour protéger la HBM contre les erreurs mémoire lors de l’inférence de modèles d’IA

Des chercheurs du Rensselaer Polytechnic Institute et de l’IBM T.J. Watson Research Center ont publié un article technique proposant une nouvelle architecture de gestion de la correction des erreurs de la mémoire à large bande passante HBM utilisée dans les charges d’inférence d’intelligence artificielle. Cette architecture s’appelle REACH, acronyme du titre de l’article « REACH: Controller-Managed Long-Span ECC for HBM AI Inference ».

L’article aborde un problème pratique des systèmes HBM : le coût élevé de la mémoire accroît le besoin d’une protection plus robuste, capable de gérer une plage plus large de taux d’erreurs des composants mémoire, sans transformer le mécanisme de correction des erreurs en charge importante pour le contrôleur mémoire ou pour la bande passante disponible lors de l’inférence.

Comment l’idée fonctionne-t-elle ?

REACH propose d’utiliser des codes de correction d’erreurs internes pour traiter d’abord les erreurs courantes, puis pour déterminer les parties qui n’ont pas encore été corrigées. Un code externe à longue portée est ensuite réservé à la correction de ces parties lorsqu’elles sont connues comme étant des cas d’effacement, au lieu de traiter tous les accès mémoire comme s’ils nécessitaient un décodage à longue portée.

L’article indique que l’application directe de codes à longue portée peut lier les petits accès à un état s’étendant sur une plage de données plus vaste, et peut également imposer un coût de décodage élevé aux débits de la HBM. L’architecture proposée met donc l’accent sur l’exécution d’une partie de la protection au sein du contrôleur mémoire, en reportant la correction plus large aux cas où des informations suffisantes sont disponibles sur l’emplacement des données qui ne peuvent pas être récupérées directement.

Pourquoi cette information est-elle importante ?

REACH exploite les caractéristiques des charges d’inférence des grands modèles de langage, qui sont principalement, selon la description de l’article, des charges de lecture. Les lectures séquentielles peuvent permettre de regrouper des plages de données avant l’application du mécanisme de protection plus large, tandis que les écritures dispersées limitent le trafic de mise à jour des données de parité. L’architecture tente ainsi d’adapter le mécanisme de correction des erreurs au schéma d’accès effectivement utilisé lors de l’inférence, plutôt que d’employer une conception uniforme pour tous les types de charges.

L’importance pratique ne réside pas seulement dans l’ajout d’une couche de protection, mais dans l’équilibre entre la fiabilité, le coût du contrôleur et la bande passante. Une correction des erreurs plus robuste peut être utile lorsque les taux d’erreurs des composants mémoire augmentent, mais elle peut en contrepartie entraîner des calculs et des transferts de données supplémentaires. REACH propose de réduire cette charge en utilisant le code externe dans les cas de correction connus, tout en laissant les codes internes prendre en charge le chemin habituel.

Que démontre l’article et que ne démontre-t-il pas ?

Le contenu disponible dans l’article publié est un résumé de l’idée de l’architecture et des raisons de son adéquation à l’inférence de grands modèles de langage. Le texte extrait ne fournit aucun chiffre sur la réduction des coûts, la consommation d’énergie ou l’effet de REACH sur la latence et le débit de transfert des données, et ne présente pas non plus de comparaison quantitative avec d’autres conceptions HBM. Il convient donc de considérer cette proposition comme une conception de recherche, et non comme une preuve commerciale prête à l’emploi ou comme un chiffre de performance annoncé.

L’article a été référencé sur arXiv sous son titre complet en septembre 2026. Il porte le numéro arXiv:2609.10861 et l’identifiant DOI est 10.48550/arXiv.2609.10861. Il a été rédigé par Rui Xie, Yunhua Fang, Asad Ul Haq, Linsen Ma, Sanchari Sen, Swagath Venkataramani, Liu Liu et Tong Zhang.

Source de l’actualité
Semiconductor Engineering
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités