チップおよび半導体

REACH、大規模AIモデル推論中のメモリエラーからHBMを保護する低コストアーキテクチャを提案

Rensselaer Polytechnic InstituteとIBMの研究者らは、HBMコントローラー内で長スパンの誤り訂正符号を管理するREACHアーキテクチャを提案した。大規模言語モデルの推論ワークロードにおけるデコードコストの削減を目指している。この方式は、一般的なエラーには内符号を使用し、消去として既知の部分を修復するために外符号を使用する。

2026-09-11
1 分で読めます
10 閲覧数
فريق تحرير certi.news
REACH、大規模AIモデル推論中のメモリエラーからHBMを保護する低コストアーキテクチャを提案

Rensselaer Polytechnic InstituteとIBM T.J. Watson Research Centerの研究者らは、AI推論ワークロードで使用される高帯域幅メモリHBMのメモリエラー訂正を管理する新しいアーキテクチャを提案する技術論文を発表した。このアーキテクチャはREACHと名付けられており、論文タイトル「REACH: Controller-Managed Long-Span ECC for HBM AI Inference」の略称である。

この論文は、HBMシステムにおける実際的な問題を扱っている。メモリの高コストにより、メモリデバイスのより広いエラー率に対応できる強力な保護が必要になる一方、誤り訂正機構がメモリーコントローラーや推論に利用可能な帯域幅に大きな負担をかけないことも求められる。

仕組み

REACHは、まず内側の誤り訂正符号を使用して一般的なエラーを処理し、その後、まだ解決されていない部分を特定する。次に、これらの部分が消去状態であることが分かっている場合、それらを修復するために長スパンの外符号を確保する。これにより、すべてのメモリアクセスを広範囲のデコードが必要なものとして扱う必要がなくなる。

論文によれば、長スパン符号を直接適用すると、小規模なアクセスがより広いデータ範囲にまたがる状態と結び付く可能性があり、HBMの速度では高いデコードコストが生じることもある。そのため提案アーキテクチャは、保護処理の一部をメモリーコントローラー内で実行し、直接復元できないデータの位置について十分な情報が得られた場合に、より広範な修復を遅延して実行することに重点を置いている。

なぜ重要なのか

REACHは、論文の説明によれば、読み出しが中心となる大規模言語モデルの推論ワークロードの特性を活用する。連続読み出しでは、より広範な保護機構を適用する前にデータ範囲をまとめることが可能になる一方、分散した書き込みではパリティデータの更新トラフィックが抑えられる。このように、このアーキテクチャは、すべての種類のワークロードに統一設計を使用するのではなく、実際の推論におけるアクセスパターンに誤り訂正機構を適合させようとしている。

ここでの実際的な意義は、単に保護層を追加することではなく、信頼性、コントローラーのコスト、帯域幅のバランスを取ることにある。誤り訂正能力の向上は、メモリデバイスのエラー率が上昇した場合に有用となり得るが、その一方で、追加の計算やデータ転送を招く可能性がある。REACHは、通常の経路を内符号に担わせながら、既知の修復ケースでは外符号を使用することで、この負担を軽減する構想を示している。

この資料が示すこと、示さないこと

公開された資料で確認できるのは、アーキテクチャの構想と、それが大規模言語モデルの推論に適している理由の概要である。抽出された本文には、コスト削減量、消費電力、REACHがレイテンシーやデータ転送速度に与える影響に関する数値は含まれておらず、他のHBM設計との定量的な比較も示されていない。したがって、これは商用化済みの証明や公表性能値ではなく、提案された研究設計として扱うべきである。

この論文は、完全なタイトルで2026年9月にarXivへ登録され、番号はarXiv:2609.10861、DOI識別子は10.48550/arXiv.2609.10861である。著者はRui Xie、Yunhua Fang、Asad Ul Haq、Linsen Ma、Sanchari Sen、Swagath Venkataramani、Liu Liu、Tong Zhangである。

ニュースの出典
Semiconductor Engineering
原文を開く ↗
ف
著者

فريق تحرير certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る