Un article de recherche de l’Université de Californie à Berkeley et de FuriosaAI propose d’utiliser une mémoire flash à haute bande passante, ou High Bandwidth Flash (HBF), comme couche supplémentaire aux côtés de la mémoire à haute bande passante HBM et de la mémoire hôte afin de répondre aux besoins du service des grands modèles de langage. L’article traite le problème posé par l’augmentation de la taille des modèles et l’allongement des contextes conversationnels, alors que la capacité mémoire et sa bande passante deviennent un goulot d’étranglement pour les performances d’inférence.
Les systèmes de service des grands modèles de langage stockent les poids du modèle et les données du KV cache en mémoire. La conservation de ces données revêt une importance croissante dans les charges de travail agentiques, qui exécutent des interactions répétées au sein de contextes s’étendant au fil du temps. Toutefois, l’extension de la mémoire au moyen de HBF implique des compromis : le flash est plus lent que la HBM en matière d’accès, et sa résistance aux opérations d’écriture est limitée par rapport à la mémoire volatile.
Qu’a testé l’article ?
Les chercheurs ont présenté une architecture de stockage hiérarchique combinant HBM, HBF et mémoire hôte, ainsi qu’un mécanisme de planification tenant compte du contenu de la mémoire cache et de la localisation des données. Ils ont utilisé une simulation alimentée par des traces opérationnelles afin d’analyser l’effet des décisions de répartition des données et de planification sur le temps d’exécution, la consommation d’énergie et la durée de vie prévue en écriture de la HBF.
Selon les résultats annoncés, les systèmes HBF les plus rapides ont réduit le temps d’achèvement de 36,1 % à 87,0 % par rapport aux systèmes reposant uniquement sur la HBM. Les économies d’énergie calculées ont également atteint 55,8 % dans les scénarios évalués.
Le gain n’est pas garanti pour toutes les charges de travail
Les résultats ne présentent pas HBF comme un remplacement direct de HBM. L’article indique que l’utilisation de HBF a augmenté la consommation d’énergie dans certaines charges de travail légères, ce qui signifie que le bénéfice dépend de la nature de la charge, de la quantité de données conservées et de la manière dont les opérations de lecture et d’écriture sont planifiées.
L’importance de la gestion des écritures apparaît clairement dans l’estimation de la durée de vie opérationnelle. La planification tenant compte de la mémoire cache a porté la durée de vie prévue en écriture de HBF de 4,77 à 14,82 ans dans la configuration évaluée.
Pourquoi cette recherche est-elle importante ?
Les résultats montrent que l’ajout d’une couche de mémoire plus grande ne suffit pas à lui seul à résoudre les goulots d’étranglement du service des modèles. Les gains sont liés à la coordination entre l’emplacement des données et la politique de planification, afin que les charges d’inférence à contextes longs bénéficient de la capacité supplémentaire sans épuiser la durée de vie du flash ni entraîner un coût énergétique inutile.
Pour les concepteurs d’accélérateurs d’intelligence artificielle et les opérateurs d’infrastructures, l’article propose une piste de recherche visant à étendre la capacité mémoire au-delà de la HBM, mais il ne démontre pas encore la viabilité d’un déploiement commercial généralisé. Les résultats reposent sur une simulation et des traces opérationnelles, tandis que les performances et la durée de vie réelles dépendront de la conception matérielle, des caractéristiques des charges de travail et des politiques de gestion de la mémoire dans les systèmes réels.
L’article s’intitule “Characterizing High Bandwidth Flash for LLM Serving”. Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer et Amir Gholami ont participé à sa rédaction. Il a été publié sous forme de projet de recherche sur arXiv en septembre 2026 sous le numéro arXiv:2609.39131.