Чипы и полупроводники

REACH предлагает менее затратную архитектуру защиты HBM от ошибок памяти при выполнении ИИ-моделей

Исследователи из Rensselaer Polytechnic Institute и IBM представили архитектуру REACH для управления кодами исправления ошибок с увеличенной длиной охвата внутри контроллера HBM, нацеленную на снижение стоимости декодирования при выполнении больших языковых моделей. Идея опирается на внутренние коды для распространённых ошибок и внешний код для исправления частей, которые известны как стёртые.

2026-09-11
3 мин. чтения
10 просмотров
فريق تحرير certi.news
REACH предлагает менее затратную архитектуру защиты HBM от ошибок памяти при выполнении ИИ-моделей

Исследователи из Rensselaer Polytechnic Institute и IBM T.J. Watson Research Center опубликовали техническую работу, в которой предложена новая архитектура управления исправлением ошибок памяти высокой пропускной способности HBM, используемой в нагрузках ИИ-вычислений. Архитектура получила название REACH — это сокращение от названия работы «REACH: Controller-Managed Long-Span ECC for HBM AI Inference».

В работе рассматривается практическая проблема систем HBM: высокая стоимость памяти создаёт потребность в более мощной защите, способной работать с более широким диапазоном частот ошибок устройств памяти, не превращая механизм исправления ошибок в значительную нагрузку для контроллера памяти или доступной пропускной способности при выполнении.

Как работает идея?

REACH предлагает использовать внутренние коды исправления ошибок для первоначальной обработки распространённых ошибок, а затем определять части, которые ещё не были исправлены. После этого внешний код с увеличенной длиной охвата резервируется для исправления этих частей, когда они известны как стёртые, вместо того чтобы обрабатывать все обращения к памяти так, будто для них требуется декодирование с увеличенной длиной охвата.

В работе отмечается, что непосредственное применение кодов с увеличенной длиной охвата может связывать небольшие обращения с состоянием, охватывающим больший диапазон данных, а также приводить к высокой стоимости декодирования на скоростях HBM. Поэтому предложенная архитектура сосредоточена на выполнении части защиты внутри контроллера памяти, откладывая более масштабное исправление до случаев, когда имеется достаточно информации о местоположении данных, которые невозможно напрямую восстановить.

Почему это важно?

REACH использует особенности нагрузок при выполнении больших языковых моделей, в которых, согласно описанию работы, преобладает чтение. Последовательные чтения могут позволить группировать диапазоны данных перед применением более масштабного механизма защиты, тогда как разрозненные операции записи ограничивают объём обновления данных чётности. Таким образом, архитектура пытается согласовать механизм исправления ошибок с фактическим шаблоном доступа при выполнении, вместо использования единой конструкции для всех типов нагрузок.

Практическая значимость здесь связана не только с добавлением уровня защиты, но и с балансом между надёжностью, стоимостью контроллера и пропускной способностью. Повышение возможностей исправления ошибок может быть полезным при росте частоты ошибок устройств памяти, но одновременно способно привести к дополнительным вычислительным операциям и передаче данных. REACH предлагает снизить эту нагрузку за счёт использования внешнего кода в известных случаях исправления, оставляя внутренним кодам ответственность за обычный путь обработки.

Что подтверждает материал, а чего он не подтверждает?

Доступный опубликованный материал содержит краткое описание идеи архитектуры и причин её соответствия выполнению больших языковых моделей. Извлечённый текст не содержит данных о степени снижения стоимости, энергопотреблении или влиянии REACH на задержку и скорость передачи данных, а также не приводит количественного сравнения с другими конструкциями HBM. Поэтому её следует рассматривать как предложенную исследовательскую конструкцию, а не как готовое коммерческое решение или заявленный показатель производительности.

Работа была размещена на arXiv под своим полным названием в сентябре 2026 года; ей присвоен номер arXiv:2609.10861, а идентификатор DOI — 10.48550/arXiv.2609.10861. В её подготовке участвовали Rui Xie, Yunhua Fang, Asad Ul Haq, Linsen Ma, Sanchari Sen, Swagath Venkataramani, Liu Liu и Tong Zhang.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости