加州大学伯克利分校与FuriosaAI的一篇研究论文提出,使用高带宽闪存,即High Bandwidth Flash(HBF),作为高带宽内存HBM和主机内存之外的附加层,以满足大语言模型服务的需求。论文讨论了模型规模不断增长以及对话上下文不断延长所带来的问题:内存容量及其带宽成为制约推理性能的瓶颈。
大语言模型服务系统将模型权重和KV cache数据存储在内存中。在代理型工作负载中,保留这些数据的重要性不断提高,因为这类工作负载会在持续扩展的上下文中执行重复交互。但使用HBF扩展内存也存在权衡:闪存在访问速度上慢于HBM,而且与易失性内存相比,其写入耐久性有限。
论文测试了什么?
研究人员提出了一种结合HBM、HBF和主机内存的分层存储架构,并配套采用一种考虑缓存内容和数据位置的缓存感知型调度机制。他们使用由运行轨迹驱动的模拟,分析数据分配与调度决策对完成时间、能耗以及HBF预计写入寿命的影响。
根据公布的结果,最快的HBF支持系统相较于仅依赖HBM的系统,将完成时间缩短了36.1%至87.0%。在所评估的场景中,计算得出的节能幅度最高达到55.8%。
收益并非适用于所有工作负载
研究结果并未将HBF作为HBM的直接替代品。论文指出,在一些较轻的工作负载中,使用HBF反而增加了能耗,这意味着其收益取决于负载性质、所保留数据的规模,以及读写操作的调度方式。
在运行寿命评估中,写入管理的重要性尤为明显。在所评估的配置中,缓存感知型调度将HBF预计写入寿命从4.77年延长至14.82年。
这项研究为何重要?
结果表明,仅仅增加更大容量的内存,并不足以解决模型服务瓶颈。收益取决于数据位置与调度策略之间的协调,使具有长上下文的推理工作负载能够利用额外容量,同时避免耗尽闪存寿命或产生不必要的能源成本。
对于人工智能加速器设计者和基础设施运营商而言,这篇论文提出了一条在HBM之外扩展内存容量的研究路径,但尚未证明其普遍商业部署的可行性。相关结果基于模拟和运行轨迹,实际性能与寿命还将取决于硬件设计、工作负载特性以及现实系统中的内存管理策略。
论文题为“Characterizing High Bandwidth Flash for LLM Serving”,参与撰写者包括Yu、Zack、Chloe Wong、Coleman Hooper、Minjae Lee、Wonjun Kang、Youngjin Cho、Michael W. Mahoney、Yakun Sophia Shao、Kurt Keutzer和Amir Gholami。该论文于2026年9月以研究草稿形式发布在arXiv,编号为arXiv:2609.39131。