La conception des unités de traitement neuronal de l’intelligence artificielle NPU évolue à mesure que les appareils périphériques passent de la dépendance exclusive aux réseaux de vision à l’exécution de grands modèles de langage LLM et de modèles de vision et de langage VLM, ainsi que de fonctions d’intelligence artificielle générative, en complément des réseaux de perception traditionnels. Sharad Chol, scientifique en chef et cofondateur d’Expedera, estime que cette transition déplace le centre du problème de la maximisation des calculs vers la gestion des mouvements de données et de mémoire, notamment dans les téléphones, les voitures et les passerelles embarquées.
L’article est publié sous la forme d’un billet sponsorisé dans Semiconductor Engineering. Les chiffres et résultats relatifs à l’architecture Origin Evolution sont donc présentés comme des résultats et des expériences rapportés par Expedera, et non comme un test indépendant réalisé par l’éditeur.
Du goulet d’étranglement du calcul à celui de la mémoire
Dans les charges de travail de vision reposant sur des réseaux CNN, comme les détecteurs YOLO, les classificateurs MobileNet et les réseaux de segmentation d’images, la principale limitation était historiquement la capacité de calcul. Les données et les poids sont largement réutilisés, tandis que l’exécution pendant l’inférence reste presque sans état, ce qui a conduit la conception des accélérateurs à se concentrer sur l’augmentation du nombre d’opérations de multiplication-accumulation MAC dans les limites de surface et de puissance.
Expedera affirme que la planification du travail sous forme de paquets, plutôt que de couches volumineuses, a amélioré l’utilisation des unités MAC et réduit les mouvements des activations vers la mémoire DDR externe. Les modèles LLM et VLM modifient toutefois la nature de la charge. L’étape de Prefill peut rester fortement liée aux opérations de calcul, tandis que l’étape de Decode devient rapidement limitée par l’accès au cache des clés et des valeurs KV cache, par la taille des paramètres et par leurs modes d’accès, avec une baisse de la réutilisation effective.
Selon l’analyse, les unités NPU principalement conçues pour le traitement parallèle et sans état des CNN ne peuvent pas être évaluées uniquement à partir de leur valeur nominale en TOPS lorsque les opérations de décodage des transformateurs sont limitées par la bande passante mémoire et la taille du KV cache.
Les paquets dans les charges de travail des transformateurs
Expedera étudie l’extension du concept de traitement fondé sur les paquets, des réseaux CNN aux blocs de transformateurs et à l’accès au KV cache, en concevant conjointement le matériel et les logiciels selon le comportement des modèles LLM et VLM, plutôt qu’en les traitant simplement comme un autre modèle.
Selon la description de l’auteur, l’architecture se compose de blocs de traitement distincts pour les opérations d’entrée, l’attention et les vecteurs. Les paquets sont orientés entre ces blocs selon la structure du réseau et l’étape d’exécution en cours, qu’il s’agisse de Prefill ou de Decode. L’entreprise affirme que son moteur peut évoluer jusqu’à 128 téraflops dans un seul cœur et atteindre le niveau du pétaflop avec des configurations multicœurs, tout en plaçant le comportement de la mémoire au centre de la conception.
Selon Expedera, l’architecture conserve l’exécution des modèles tels qu’ils ont été entraînés, sans réentraînement ni réduction de précision. L’entreprise indique également que le traitement fondé sur les paquets a réduit, par rapport à d’autres approches, les mouvements de mémoire externe de plus de 75 % lors de l’exécution de Llama 3.2 1B et de Qwen2 1.5B. Elle mentionne aussi des résultats qu’elle décrit comme des milliers de téraflops effectifs et des dizaines de tokens par seconde par millimètre carré de silicium dans les scénarios limités par la mémoire.
Qu’est-ce que cela signifie pour les appareils périphériques et les voitures ?
Exécuter l’inférence localement peut réduire la latence de bout en bout et maintenir les données de l’habitacle ou de l’appareil hors du cloud. Cela revêt une importance particulière dans les voitures et les appareils mobiles, où les exigences liées à l’expérience utilisateur se combinent aux contraintes de confidentialité et aux exigences réglementaires, selon l’auteur.
En revanche, diffuser le KV cache vers la DDR ou la HBM à chaque étape du décodage représente une charge en matière d’énergie et de coût, en particulier dans les nœuds périphériques et les systèmes embarqués dans les véhicules. Expedera estime que la réduction des transferts externes et l’augmentation de la réutilisation locale pourraient permettre d’obtenir davantage de tokens par seconde dans le cadre d’un budget énergétique donné.
Les systèmes automobiles sur puce doivent également exécuter simultanément la perception, la surveillance du conducteur, l’infodivertissement et les fonctions génératives. Du point de vue de l’auteur, une famille de NPU traitant conjointement les CNN et les LLM comme des charges fondamentales pourrait simplifier la conception de la plateforme et réduire le besoin d’accélérateurs distincts, plutôt que d’ajouter la prise en charge des LLM à un cœur déjà optimisé pour les réseaux CNN.
L’article indique qu’Origin Evolution a reçu le prix du « meilleur cœur de propriété intellectuelle pour processeur d’intelligence artificielle périphérique » dans le cadre des Edge AI and Vision Product of the Year Awards 2026, l’auteur reliant cette distinction à l’importance du traitement des goulets d’étranglement liés à la mémoire et à l’énergie, plutôt qu’à la seule augmentation des indicateurs de performance maximaux.
Modélisation des étapes Prefill et Decode
Chol estime que la valeur d’ingénierie ne réside pas uniquement dans le concept des paquets, mais dans la modélisation des étapes Prefill et Decode et leur optimisation séparée. La première nécessite un débit de calcul élevé et ressemble partiellement au comportement des réseaux CNN, tout en traitant des modèles plus grands, tandis que la seconde est dominée par les lectures du KV cache, la diffusion de mémoire et des calculs plus réduits à chaque étape.
Selon l’article, les flux de paquets et les blocs distincts permettent de construire des modèles de performance et de bande passante qui différencient les deux étapes, et d’étudier les configurations de la mémoire et des interfaces de diffusion, comme la largeur de la DRAM ou de la HBM, ainsi que la taille et la répartition de la SRAM, en fonction des modes d’accès réels au KV cache. Ils peuvent également être utilisés pour analyser la latence maximale et l’effet de la bande passante dans les charges automobiles sensibles à la sécurité lorsque les fonctions LLM ou VLM sont liées à l’interface homme-machine ou à la surveillance du conducteur.
Compatibilité logicielle et rôle des outils EDA
Expedera affirme que la suite Origin Evolution accepte les modèles provenant de HuggingFace, Llama.cpp, TVM et d’autres sources, et prend en charge les précisions entières et fractionnaires, les modes mixtes, la fusion ou le découpage des couches, ainsi que le contrôle centralisé de plusieurs cœurs au niveau de la puce ou d’une puce multi-tuiles.
Du point de vue de l’auteur, les paquets ne constituent pas un nouveau modèle de programmation pour les utilisateurs des modèles : leur conversion s’effectue dans la chaîne du compilateur et l’environnement d’exécution, avec la possibilité de déployer les modèles entraînés sur le matériel sans réentraînement ni réduction de précision. Cela peut réduire le besoin de réécriture spécifique à chaque matériel et permettre aux équipes EDA et de vérification de tester les performances par rapport à des applications de référence comme Llama 3 et Qwen 2.
L’article conclut que la prochaine question ne se limite pas à la réussite des paquets avec les CNN, mais concerne leur capacité à simplifier la modélisation, la planification et la vérification pour des charges d’intelligence artificielle hétérogènes. À mesure que les fonctions génératives gagnent les voitures et les appareils périphériques, ces facteurs pourraient déterminer quelles architectures d’accélérateurs passeront à la production et lesquelles resteront au stade des présentations de référence.