В исследовательской статье Калифорнийского университета в Беркли и FuriosaAI предлагается использовать флеш-память с высокой пропускной способностью, или High Bandwidth Flash (HBF), в качестве дополнительного уровня наряду с памятью высокой пропускной способности HBM и хост-памятью для удовлетворения потребностей обслуживания больших языковых моделей. В статье рассматривается проблема, создаваемая растущими размерами моделей и более длинными диалоговыми контекстами, из-за которых ёмкость памяти и её пропускная способность становятся узким местом для производительности вывода.
Системы обслуживания больших языковых моделей хранят веса модели и данные KV cache в памяти. Сохранение этих данных становится особенно важным в агентских рабочих нагрузках, которые выполняют повторяющиеся взаимодействия в контекстах, расширяющихся с течением времени. Однако расширение памяти с помощью HBF связано с компромиссами: флеш-память медленнее HBM при доступе, а её выносливость к операциям записи ограничена по сравнению с энергозависимой памятью.
Что исследовала статья?
Исследователи представили иерархическую архитектуру хранения, объединяющую HBM, HBF и хост-память, а также механизм планирования с учётом содержимого кэша и расположения данных. Они использовали моделирование на основе рабочих трасс для анализа влияния решений по размещению данных и планированию на время выполнения, энергопотребление и ожидаемый ресурс записи HBF.
Согласно опубликованным результатам, самые быстрые системы с поддержкой HBF сократили время завершения на 36,1–87,0% по сравнению с системами, использующими только HBM. Расчётная экономия энергии также достигла 55,8% в оценённых сценариях.
Преимущество не гарантировано для всех рабочих нагрузок
Результаты не представляют HBF как прямую замену HBM. В статье отмечается, что использование HBF увеличило энергопотребление в некоторых лёгких рабочих нагрузках, то есть эффект зависит от характера нагрузки, объёма сохраняемых данных и способа планирования операций чтения и записи.
Важность управления записями особенно ясно проявляется при оценке срока службы. Планирование с учётом кэша увеличило ожидаемый ресурс записи HBF с 4,77 до 14,82 года в оценённой конфигурации.
Почему это исследование важно?
Результаты показывают, что одного добавления памяти большей ёмкости недостаточно для устранения узких мест при обслуживании моделей. Преимущества связаны с согласованием размещения данных и политики планирования, чтобы рабочие нагрузки вывода с длинными контекстами могли использовать дополнительную ёмкость без исчерпания ресурса флеш-памяти или возникновения ненужных затрат энергии.
Для разработчиков ускорителей ИИ и операторов инфраструктуры статья предлагает исследовательское направление по расширению ёмкости памяти за пределы HBM, однако пока не доказывает целесообразность широкого коммерческого внедрения. Результаты основаны на моделировании и рабочих трассах, а фактические производительность и ресурс будут зависеть от конструкции оборудования, характеристик рабочих нагрузок и политик управления памятью в реальных системах.
Статья носит название “Characterizing High Bandwidth Flash for LLM Serving”; среди её авторов Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer и Amir Gholami. Она была опубликована как исследовательский препринт на arXiv в сентябре 2026 года под номером arXiv:2609.39131.