Geoff Tate estime que les unités de traitement graphique (GPU) représentent encore environ 70 % de la capacité installée mondiale de calcul de l’intelligence artificielle, selon le fabricant, contre 30 % pour les puces personnalisées, dominées principalement par Google et Amazon. Mais cet avantage n’est plus garanti, alors que les entreprises du cloud et les développeurs de modèles avancés commencent à concevoir leur propre matériel afin de réduire le coût d’exécution de charges de travail spécifiques et d’améliorer la consommation énergétique.
Les données d’Epoch.ai sur lesquelles s’appuie l’auteur indiquent que la capacité mondiale installée de calcul de l’intelligence artificielle a été multipliée par 17 en trois ans. En 2023, la part de Nvidia s’élevait à 90 %, contre 10 % pour Google, tandis que le calcul personnalisé a représenté 20 % de la croissance au cours des trois dernières années. Tate précise que les données n’incluent pas Meta, Microsoft et Cerebras, dont il décrit les capacités comme relativement modestes dans le cadre de cette mesure.
Les avantages de Nvidia dépassent le simple GPU
Selon l’auteur, la force de Nvidia ne repose pas sur un GPU isolé, mais sur un écosystème intégré comprenant des unités d’interconnexion et d’extension, des racks, des unités centrales de traitement et des processeurs réseau. L’entreprise propose la plateforme NVL72, le processeur Vera destiné aux charges de travail des agents d’intelligence artificielle, l’unité BlueField et les réseaux Spectrum-6, ainsi que l’option Groq 3 LPX pour l’inférence à faible latence.
Nvidia affirme que le processeur Vera offre des performances 1,8 fois supérieures dans les charges de travail des agents par rapport à un processeur traditionnel. L’entreprise présente également les systèmes Vera Rubin comme offrant une amélioration comprise entre deux et trente fois par rapport à GB300 dans le test DeepSeek-v4-PRO, selon le niveau d’interactivité. L’article indique par ailleurs que les systèmes Vera Rubin ont commencé à fonctionner dans des racks chez CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud et Nebius.
Nvidia prévoit une croissance de 70 % au cours de son prochain exercice fiscal, tout en précisant que la demande est limitée par l’offre. Selon les éléments évoqués lors de la conférence téléphonique sur les résultats, ses engagements visant à sécuriser les approvisionnements sont également passés de 119 milliards de dollars à 279 milliards de dollars. Tate estime que l’obtention de capacités de production auprès de TSMC et la disponibilité de mémoire HBM resteront deux facteurs déterminants dans la compétition.
Les puces personnalisées se rapprochent du cœur de la compétition
La conception de puces en interne donne aux entreprises du cloud et aux développeurs de modèles une connaissance directe de leurs charges de travail, de la distinction entre les besoins d’entraînement et d’inférence, ainsi que des goulots d’étranglement de l’infrastructure. Avec l’augmentation des volumes de calcul, la conception de deux puces spécialisées, l’une pour l’entraînement et l’autre pour l’inférence, devient plus viable économiquement, en particulier si elle permet d’améliorer le débit par watt de 10 % à 30 % et de réduire la surface de silicium dans une proportion similaire.
Dans l’article, OpenAI se distingue avec la puce Jalapeño, un accélérateur d’inférence conçu par l’entreprise pour ses charges de travail, prenant en charge les phases de prefill et de decode tout en conservant localement la mémoire KV Cache. Le système utilise des commutateurs Broadcom Tomahawk 6 pour construire un domaine comprenant 128 puces, ainsi qu’un domaine mondial pouvant atteindre 2048 puces. Selon les premiers tests d’OpenAI, Jalapeño a surpassé Nvidia GB300 dans les charges de travail GPT-OSS, DeepSeek R1 et Kimi K2.5, mais les tests reposaient sur la prédiction d’un seul token et n’incluaient pas encore la prédiction mult token, dont l’entreprise prévoit qu’elle augmentera les performances d’un facteur compris entre trois et cinq.
Tate décrit la comparaison entre Jalapeño et Vera Rubin comme une estimation approximative, fondée sur l’extrapolation de courbes de performances publiées, et non comme un test direct complet. Il estime donc que les résultats sont prometteurs, mais qu’ils doivent être vérifiés lors du déploiement en production et sur des échelles et des charges de travail plus larges. En outre, Jalapeño est dédié à l’inférence et ne répond pas aux besoins d’entraînement, qui peuvent représenter un tiers des besoins de calcul d’OpenAI ou davantage.
Google, Meta et AMD élargissent les solutions de rechange
Pour sa huitième génération de TPU, Google lance deux versions simultanées : le TPU 8t pour l’entraînement et le TPU 8i pour l’inférence. L’article indique que le TPU 8i est environ 1,4 fois plus grand que le 8t en raison de ses besoins supplémentaires en mémoire HBM, tandis que la topologie d’interconnexion diffère entre les deux versions en fonction des exigences distinctes de l’entraînement et de l’inférence. Google affirme que la nouvelle génération offre environ deux fois les performances des générations précédentes. Morgan Stanley a pour sa part estimé les ventes de TPU à environ 9 milliards de dollars au second semestre 2026, 84 milliards de dollars en 2027 et 108 milliards de dollars en 2028.
Meta développe quant à elle la série MTIA pour les charges de travail des systèmes de recommandation, puis pour l’entraînement et l’intelligence générative. Cerebras a présenté la puce CS-4, qui, selon l’entreprise, double la vitesse des tokens par utilisateur par rapport à CS-3 et atteint jusqu’à dix fois le débit par watt. AMD a également présenté l’unité MI455x et le système Helios. Selon l’article, sa part de la capacité mondiale installée est passée de zéro à 6 %, alors qu’aucun schéma de performances pour un test d’intelligence artificielle précis n’était fourni dans la présentation mentionnée.
Qu’est-ce que cela signifie pour les fabricants de GPU ?
Lecture de certi.news : les données ne signalent pas la fin imminente des GPU, mais plutôt un déplacement de la concurrence, qui passe des performances de la puce généraliste à l’efficacité du système complet, à la disponibilité de l’énergie, de la mémoire et des capacités de production, ainsi qu’à l’aptitude du matériel à servir des charges de travail spécifiques. La flexibilité des GPU restera un avantage important pour les clients qui exécutent des modèles et des charges de travail variés, tandis que les puces personnalisées peuvent prendre l’avantage lorsque les charges de travail de l’entreprise sont suffisamment connues et stables pour justifier une conception dédiée.
Tate suggère que Nvidia étudie le développement de puces distinctes pour l’entraînement et l’inférence au lieu de s’appuyer sur une seule conception généraliste, et que Nvidia et AMD adoptent des technologies d’interconnexion optique telles que l’optical circuit switching et la co-packaged optics, alors que le cuivre se rapproche de ses limites pratiques. Il précise toutefois que certaines de ces propositions relèvent de l’analyse, et qu’il siège au conseil d’administration de deux entreprises actives dans les technologies d’interconnexion optique, ce qui impose de les considérer comme les recommandations de l’auteur de l’article et non comme des faits indépendants.
La conclusion de l’auteur est que Nvidia dispose d’importantes barrières défensives, mais qu’elle fait face à des clients qui possèdent des ressources considérables et une motivation directe pour exécuter leurs modèles sur leur propre matériel. Si Jalapeño démontre en production des performances comparables ou supérieures à celles de Vera Rubin, cela constituera un indicateur fort que la domination des GPU fait l’objet d’une concurrence réelle, et non d’une simple possibilité théorique.