Inteligencia artificial

La memoria flash de alto ancho de banda podría reducir hasta un 87 % el tiempo de servicio de los modelos de lenguaje grandes

Un artículo de UC Berkeley y FuriosaAI analiza el uso de High Bandwidth Flash para ampliar la memoria de los aceleradores de inteligencia artificial al ejecutar modelos de lenguaje grandes. Las simulaciones indican una reducción de hasta el 87 % en el tiempo de finalización, con posibles mejoras en el consumo de energía y una prolongación de la vida útil de escritura mediante una planificación consciente de la caché.

2026-10-02
4 min de lectura
12 visitas
certi.news Editorial Team
La memoria flash de alto ancho de banda podría reducir hasta un 87 % el tiempo de servicio de los modelos de lenguaje grandes

Un artículo de investigación de la Universidad de California en Berkeley y FuriosaAI propone utilizar memoria flash de alto ancho de banda, o High Bandwidth Flash (HBF), como una capa adicional junto a la memoria de alto ancho de banda HBM y la memoria del host para satisfacer las necesidades del servicio de modelos de lenguaje grandes. El artículo aborda el problema que plantean el crecimiento del tamaño de los modelos y el alargamiento de los contextos de conversación, donde la capacidad y el ancho de banda de la memoria se convierten en un cuello de botella para el rendimiento de la inferencia.

Los sistemas de servicio de modelos de lenguaje grandes mantienen los pesos del modelo y los datos de la KV cache en la memoria. Conservar estos datos adquiere mayor importancia en las cargas de trabajo agénticas, que ejecutan interacciones repetidas dentro de contextos que se expanden con el tiempo. Sin embargo, ampliar la memoria mediante HBF implica ciertas compensaciones: la memoria flash es más lenta que la HBM en el acceso y su resistencia a las operaciones de escritura es limitada en comparación con la memoria volátil.

¿Qué probó el artículo?

Los investigadores presentaron una arquitectura de almacenamiento jerárquico que combina HBM, HBF y memoria del host, junto con un mecanismo de planificación temporal consciente del contenido de la memoria caché y de las ubicaciones de los datos. Utilizaron una simulación basada en trazas operativas para analizar el efecto de las decisiones de distribución de datos y planificación sobre el tiempo de ejecución, el consumo de energía y la vida útil esperada de escritura de HBF.

Según los resultados anunciados, los sistemas compatibles con HBF más rápidos redujeron el tiempo de finalización entre un 36,1 % y un 87,0 % en comparación con los sistemas que dependían únicamente de HBM. El ahorro de energía calculado también alcanzó el 55,8 % en los escenarios evaluados.

La ganancia no está garantizada en todas las cargas de trabajo

Los resultados no presentan HBF como un sustituto directo de HBM. El artículo señaló que el uso de HBF aumentó el consumo de energía en algunas cargas de trabajo ligeras, lo que significa que el beneficio depende de la naturaleza de la carga, del volumen de datos conservados y de la forma en que se planifican las operaciones de lectura y escritura.

La importancia de gestionar las escrituras se hace especialmente evidente en la estimación de la vida útil operativa. La planificación temporal consciente de la memoria caché aumentó la vida útil esperada de escritura de HBF de 4,77 a 14,82 años en la configuración evaluada.

¿Por qué es importante esta investigación?

Los resultados muestran que añadir una capa de memoria más grande no basta por sí solo para resolver los cuellos de botella del servicio de modelos. Las ganancias están vinculadas a coordinar la ubicación de los datos con la política de planificación, de modo que las cargas de inferencia con contextos largos aprovechen la capacidad adicional sin agotar la vida útil de la memoria flash ni generar un coste energético innecesario.

Para los diseñadores de aceleradores de inteligencia artificial y los operadores de infraestructuras, el artículo plantea una línea de investigación para ampliar la capacidad de memoria más allá de HBM, pero todavía no demuestra la viabilidad de un despliegue comercial general. Los resultados se basan en simulaciones y trazas operativas, y tanto el rendimiento como la vida útil reales dependerán del diseño del hardware, las características de las cargas de trabajo y las políticas de gestión de memoria de los sistemas reales.

El artículo se tituló “Characterizing High Bandwidth Flash for LLM Serving”, y fue elaborado por Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer y Amir Gholami. Se publicó como borrador de investigación en arXiv en septiembre de 2026 con el número arXiv:2609.39131.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias