El diseño de las unidades de procesamiento neuronal de inteligencia artificial NPU está cambiando a medida que los dispositivos periféricos pasan de depender únicamente de redes de visión a ejecutar modelos de lenguaje grandes LLM, modelos de visión y lenguaje VLM y funciones de inteligencia artificial generativa junto con las redes de percepción tradicionales. Sharad Chol, científico jefe y cofundador de Expedera, considera que esta transformación desplaza el centro del problema de maximizar las operaciones computacionales a gestionar el movimiento de datos y la memoria, especialmente en teléfonos, automóviles y puertas de enlace integradas.
El material se publicó en formato de blog patrocinado en Semiconductor Engineering, por lo que las cifras y los resultados relacionados con la arquitectura Origin Evolution se presentan como resultados y experimentos a los que hace referencia Expedera, no como una prueba independiente realizada por el medio que lo publica.
Del cuello de botella computacional al cuello de botella de memoria
En las cargas de visión basadas en redes CNN, como los detectores YOLO, los clasificadores MobileNet y las redes de segmentación de imágenes, la principal limitación histórica era la capacidad computacional. Los datos y los pesos se reutilizaban en gran medida, y la ejecución durante la inferencia seguía siendo casi sin estado, lo que llevó a que el diseño de los aceleradores se centrara en aumentar el número de operaciones de multiplicación y acumulación MAC dentro de los límites de área y energía.
Expedera afirma que programar el trabajo en forma de paquetes, en lugar de capas enormes, mejoró la utilización de las unidades MAC y redujo el movimiento de activaciones hacia la memoria DDR externa. Sin embargo, los modelos LLM y VLM cambian la naturaleza de la carga. La fase de Prefill puede seguir siendo intensiva en operaciones computacionales, mientras que la fase de Decode queda rápidamente limitada por el acceso a la caché de claves y valores KV cache, por el tamaño de los parámetros y sus patrones de acceso, con una menor reutilización efectiva.
Según el análisis, las unidades NPU diseñadas principalmente para procesar CNN paralelas y sin estado no pueden evaluarse suficientemente mediante la cifra nominal de TOPS cuando las operaciones de decodificación de los transformadores están limitadas por el ancho de banda de memoria y el tamaño de la KV cache.
Los paquetes en las cargas de los transformadores
Expedera estudia ampliar el concepto de procesamiento basado en paquetes desde las redes CNN hacia los bloques de transformadores y el acceso a la KV cache, diseñando conjuntamente el hardware y el software de acuerdo con el comportamiento de los modelos LLM y VLM, en lugar de tratarlos simplemente como otro modelo más.
La arquitectura, según la descripción del autor, consta de bloques de procesamiento separados para las operaciones de alimentación directa, atención y vectores, y los paquetes se dirigen entre ellos de acuerdo con la estructura de la red y la fase de ejecución actual, ya sea Prefill o Decode. La empresa afirma que su motor puede escalar hasta 128 teraflops en un solo núcleo y hasta el nivel de los petaflops cuando se utilizan configuraciones multinúcleo, manteniendo el comportamiento de la memoria en el centro del diseño.
Según Expedera, la arquitectura mantiene la ejecución de los modelos tal como fueron entrenados, sin reentrenamiento ni reducción de precisión. La empresa también señala que el procesamiento basado en paquetes redujo, en comparación con métodos alternativos, el movimiento de memoria externa en más del 75% al ejecutar Llama 3.2 1B y Qwen2 1.5B. Asimismo, menciona resultados que describe como miles de teraflops efectivos y decenas de tokens por segundo por milímetro cuadrado de silicio en escenarios limitados por la memoria.
¿Qué significa esto para los dispositivos periféricos y los automóviles?
Ejecutar la inferencia localmente puede reducir la latencia de extremo a extremo y mantener los datos del habitáculo o del dispositivo fuera de la nube. Esto adquiere importancia en automóviles y dispositivos móviles, donde los requisitos de la experiencia de uso se combinan con las limitaciones de privacidad y los requisitos regulatorios, según expone el autor.
Por el contrario, transmitir la KV cache a DDR o HBM en cada paso de la decodificación supone una carga para la energía y el coste, especialmente en los nodos periféricos y los sistemas integrados en vehículos. Expedera considera que reducir las transferencias externas y aumentar la reutilización local podría permitir un mayor número de tokens por segundo dentro de un presupuesto energético determinado.
Los sistemas de automoción en chip también necesitan ejecutar simultáneamente la percepción, la supervisión del conductor, el infoentretenimiento y las funciones generativas. Desde la perspectiva del autor, una familia de NPU que gestione conjuntamente CNN y LLM como cargas fundamentales podría simplificar el diseño de la plataforma y reducir la necesidad de aceleradores separados, en lugar de añadir compatibilidad con LLM a un núcleo optimizado originalmente para redes CNN.
El artículo señala que Origin Evolution recibió el premio a la «Mejor propiedad intelectual para un procesador de inteligencia artificial periférica» en los premios Edge AI and Vision Product of the Year de 2026, y el autor relaciona este galardón con la importancia de abordar los cuellos de botella de memoria y energía, en lugar de limitarse a elevar los indicadores máximos de rendimiento.
Modelado de las fases Prefill y Decode
Chol considera que el valor de ingeniería no reside únicamente en el concepto de los paquetes, sino en modelar las fases Prefill y Decode y optimizarlas por separado. La primera necesita un alto rendimiento computacional y se parece parcialmente al comportamiento de las redes CNN, aunque trabaja con modelos más grandes, mientras que la segunda está dominada por las lecturas de la KV cache, la transmisión de memoria y cálculos más pequeños en cada paso.
Según el material, los flujos de paquetes y los bloques separados permiten construir modelos de rendimiento y de ancho de banda que distinguen entre ambas fases, y estudiar configuraciones de la jerarquía de memoria y de las interfaces de transmisión, como el ancho de DRAM o HBM y el tamaño y la partición de la SRAM, de acuerdo con los patrones reales de acceso a la KV cache. También pueden utilizarse para analizar la latencia máxima y el efecto del ancho de banda en cargas automotrices sensibles a la seguridad cuando las funciones LLM o VLM están vinculadas a la interfaz hombre-máquina o a la supervisión del conductor.
Compatibilidad de software y papel de las herramientas EDA
Expedera afirma que el paquete Origin Evolution recibe modelos de HuggingFace, Llama.cpp, TVM y otros, y admite precisión entera y fraccionaria, modos mixtos, fusión o división de capas, además del control centralizado de varios núcleos a nivel de chip o de un chiplet multinúcleo.
Desde el punto de vista del autor, los paquetes no representan un nuevo modelo de programación para los usuarios de los modelos; su conversión se realiza dentro del flujo del compilador y del entorno de ejecución, con la posibilidad de colocar los modelos entrenados en el hardware sin reentrenamiento ni reducción de precisión. Esto podría reducir la necesidad de reescrituras específicas para cada hardware y permitir que los equipos de EDA y verificación prueben el rendimiento frente a aplicaciones de referencia como Llama 3 y Qwen 2.
El artículo concluye que la próxima cuestión no se limita al éxito de los paquetes con CNN, sino que se refiere a hasta qué punto simplifican el modelado, la programación y la verificación en cargas de inteligencia artificial heterogéneas. A medida que las funciones generativas llegan a los automóviles y los dispositivos periféricos, estos factores podrían determinar qué arquitecturas de aceleradores pasan a producción y cuáles permanecen en presentaciones de referencia.