来自伦斯勒理工学院(Rensselaer Polytechnic Institute)和IBM T.J. Watson Research Center的研究人员发表了一篇技术论文,提出了一种用于管理人工智能推理负载中所使用的高带宽内存HBM纠错的新架构。该架构名为REACH,是论文标题“REACH: Controller-Managed Long-Span ECC for HBM AI Inference”的缩写。
该论文探讨了HBM系统中的一个实际问题:内存成本上升带来了更强保护的需求,这种保护需要应对更广范围的内存设备错误率,同时不能让纠错机制成为内存控制器或推理可用带宽的重大负担。
这一方案如何运作?
REACH建议首先使用内部纠错码处理常见错误,然后确定尚未解决的部分。之后,在这些部分已知属于擦除情况时,使用长跨度外部代码对其进行修复,而不是把所有内存访问都当作需要大范围解码的操作来处理。
论文指出,直接应用长跨度代码可能会使小规模访问操作关联到跨越更大数据范围的状态,并且在HBM速度下可能带来较高的解码成本。因此,该架构侧重于在内存控制器内部执行部分保护,并将更广泛的修复推迟到能够获得足够信息、确定无法直接恢复的数据位置时。
为什么这条消息值得关注?
REACH利用了大型语言模型推理负载的特性。根据论文的描述,这类负载以读取为主。顺序读取可以在应用更广泛的保护机制之前实现数据范围的聚合,而分散写入则会限制奇偶校验数据更新的流量。由此,该架构试图使纠错机制与推理中的实际访问模式相匹配,而不是为所有类型的负载采用统一设计。
这里的实际意义不仅在于增加一层保护,还在于在可靠性、控制器成本和带宽之间取得平衡。当内存设备错误率上升时,提高纠错能力可能很有用,但另一方面也可能带来额外的计算和数据传输操作。REACH提出通过仅在已知修复情况下使用外部代码来减轻这一负担,同时让内部代码负责常规路径。
材料证明了什么,又没有证明什么?
目前已发表材料中可获得的是对该架构理念及其适用于大型语言模型推理原因的概述。所提取的文本没有提供关于成本降低幅度、能耗或REACH对延迟和数据传输速率影响的数字,也没有展示与其他HBM设计的定量比较。因此,应将其视为一项提出的研究设计,而不是现成的商业验证,或已经公布的性能数字。
该论文于2026年9月以完整标题发布在arXiv上,编号为arXiv:2609.10861,DOI标识符为10.48550/arXiv.2609.10861。参与论文撰写的人员包括Rui Xie、Yunhua Fang、Asad Ul Haq、Linsen Ma、Sanchari Sen、Swagath Venkataramani、Liu Liu和Tong Zhang。