La nature de la concurrence dans l’infrastructure de l’intelligence artificielle évolue. Après des années durant lesquelles l’avantage de Nvidia reposait principalement sur la possession des unités de traitement graphique GPU les plus avancées, cette analyse indique que le centre de gravité se déplace progressivement vers ce qui entoure le processeur : la gestion de la mémoire, l’acheminement des données, le stockage, les réseaux et la coordination du travail entre les composants du système. À mesure que les charges de travail d’intelligence artificielle atteignent l’échelle du gigawatt, augmenter le nombre de cycles de traitement ne suffit plus à lui seul pour atteindre l’efficacité requise.
Cette analyse intervient à un moment où de grandes entreprises de l’infrastructure cloud, telles qu’Amazon et Google, ont commencé à développer leurs propres puces, ce qui a affaibli l’idée que Nvidia soit l’unique choix pour obtenir du matériel avancé destiné à l’intelligence artificielle. Cela a soulevé des questions sur la pérennité de l’avance de l’entreprise, notamment après que sa capitalisation boursière a été multipliée par dix entre le début de 2023 et le milieu de 2025, avant que l’évolution de son action ne devienne plus modérée au cours de l’année suivante, dans un contexte de craintes liées à la concurrence dans les unités GPU.
Du processeur au système de rack
Selon l’article, Nvidia propose actuellement l’architecture Vera Rubin, qui associe l’unité Rubin GPU à un ensemble d’autres unités, notamment le processeur Vera CPU, l’accélérateur d’inférence Groq 3 LPX et des racks dédiés au stockage et aux réseaux. Ces composants ne se concentrent pas nécessairement sur l’exécution directe des tokens, mais sur la garantie que les données parviennent aux unités GPU à la vitesse et au moment appropriés.
Le GPU peut être comparé au moteur, tandis que les autres composants du système remplissent les fonctions de la voiture qui permettent d’exploiter efficacement la puissance du moteur. Plus la capacité des centres de données augmente, plus le besoin en mémoire s’accroît, mais transférer les données de la mémoire vers le processeur sans goulets d’étranglement est devenu un défi indépendant. Ce défi gagne en importance alors que les opérateurs d’infrastructures cherchent à réduire le nombre de tokens pouvant être produits par watt.
Le rôle du Vera CPU dans l’acheminement des données
Jason Hardy, vice-président de Nvidia chargé des technologies de stockage, a déclaré que Vera est importante parce que la quantité de mémoire pouvant être installée dans un seul serveur ou une seule plateforme de calcul est limitée. Selon ce que l’analyse lui attribue, les opérations ont enregistré une amélioration pouvant atteindre trois fois lorsque le Vera CPU a permis de les accélérer, ce qui a autorisé l’utilisation des unités de stockage flash à leur plein potentiel au lieu de voir leurs performances entravées par des goulets d’étranglement dans le transfert des données.
Le message pratique est que les performances d’un centre de données ne sont pas déterminées uniquement par les spécifications d’un GPU pris isolément. Même une unité de traitement rapide peut ne pas produire tous ses bénéfices si les données ne lui parviennent pas au moment voulu, ou si la mémoire, le stockage et les réseaux ne sont pas capables de suivre le flux de travail. C’est pourquoi Nvidia tente de vendre un système intégré, et non une simple puce distincte.
Une solution différente d’OpenAI
La résolution du problème de la circulation des données ne se limite pas à Nvidia. Lorsque OpenAI a développé la puce Jalapeño, la réduction de la quantité de données devant être transférées entre les composants constituait un axe central de la conception. L’entreprise a indiqué que la grande surface de la puce permettait de maintenir l’intégralité de la charge de travail au sein d’un seul système connecté, ce qui réduit les mouvements de données et les latences de communication, et contribue à maintenir la rapidité et l’efficacité de la requête de bout en bout.
Les deux approches diffèrent : l’écosystème de Nvidia tente de gérer efficacement la circulation des données au moyen d’un ensemble de composants spécialisés, tandis qu’OpenAI cherche à réduire cette circulation elle-même en maintenant la charge de travail au sein d’une puce ou d’un système intégré. Mais le résultat visé est le même : améliorer l’efficacité plutôt que de compter uniquement sur l’ajout de cycles de traitement ou de puces supplémentaires.
Pourquoi cette évolution est-elle importante ?
Une nouvelle couche de concurrence dans l’intelligence artificielle apparaît ici. Construire un GPU concurrent ne suffit plus nécessairement ; les entreprises doivent également faire fonctionner l’ensemble du système efficacement. Cela ouvre aux fabricants de puces et aux opérateurs de services cloud un espace de concurrence dans la conception des racks, la coordination de la mémoire et la gestion du stockage et des réseaux, et pas seulement dans la puissance de traitement brute.
Analyse de certi.news : Ce qui a réellement changé, c’est la définition des performances dans les centres de données d’intelligence artificielle. Le critère passe de la question « Quelle est la vitesse de la puce ? » à une question plus large : « Avec quelle efficacité le système maintient-il la puce alimentée par les bonnes données ? » Cela donne à Nvidia la possibilité d’étendre son avantage à une couche difficile à dissocier du reste de l’infrastructure, mais cela ne tranche pas la concurrence. L’entreprise sera confrontée à des concurrents dans les unités GPU ainsi que dans la gestion et la coordination des systèmes, et la source ne fournit pas de chiffres comparatifs exhaustifs entre l’écosystème de Nvidia et les solutions concurrentes, pas plus qu’elle ne prouve que l’avantage actuel se maintiendra à long terme.
Pour les opérateurs de centres de données, cela signifie que les décisions d’infrastructure peuvent nécessiter d’examiner l’efficacité de l’ensemble du système, et pas seulement le prix ou les performances du processeur. Pour les concepteurs de puces, le défi s’étend de l’augmentation de la capacité de calcul à la réduction des mouvements de données et des goulets d’étranglement. L’analyse indique que Nvidia semble disposer, à ce stade précoce, d’une avance solide dans cette nouvelle couche, sans que cela signifie la fin de la concurrence ni ne garantisse une supériorité permanente.