Intelligence artificielle

Microsoft : le critère du progrès en intelligence artificielle doit être le « rendement utile », et non la taille de l’infrastructure

Rani Borkar, de Microsoft, estime que le succès de l’infrastructure d’intelligence artificielle ne se mesure pas au nombre de puces ou de tokens traités, mais à la quantité d’intelligence utile produite par unité d’énergie, de mémoire et d’investissement. Elle appelle à une conception intégrée s’étendant des centres de données et des puces aux modèles, aux logiciels et aux agents.

2026-09-02
8 min de lecture
7 vues
فريق تحرير certi.news
Microsoft : le critère du progrès en intelligence artificielle doit être le « rendement utile », et non la taille de l’infrastructure

Rani Borkar, qui dirige chez Microsoft les organisations responsables de la planification, de l’ingénierie, du développement et du déploiement du matériel et de l’infrastructure de la plateforme de cloud computing, propose une autre manière de mesurer les progrès à l’ère de l’intelligence artificielle. Plutôt que de se concentrer sur le nombre de puces, la taille des centres de données ou le nombre de tokens que le système peut générer, elle propose d’adopter le concept de « rendement » (Yield) : autrement dit, la quantité de résultat utile pouvant être produite à partir des ressources disponibles.

Borkar emprunte ce concept à l’industrie des semi-conducteurs, où le rendement désigne le nombre de puces fonctionnelles pouvant être extraites de chaque wafer. Selon sa vision, ce principe devrait être étendu au capital, à l’énergie, à la mémoire, aux communications, aux modèles et aux logiciels, jusqu’à la valeur que l’intelligence artificielle apporte au travail et à la vie quotidienne.

Pourquoi l’extension de l’infrastructure ne suffit-elle plus ?

L’article indique que l’adoption de l’intelligence artificielle s’est accélérée à un rythme supérieur à celui observé avec Internet, les ordinateurs personnels et les smartphones, mais que son utilisation mondiale ne concerne encore qu’environ 18 % de la population active, tandis que la majeure partie des usages se concentre sur les conversations. À mesure que les systèmes passent à des tâches de raisonnement, de planification, d’utilisation d’outils et d’exécution de flux de travail agentiques plus longs, les exigences de l’infrastructure évoluent radicalement.

Borkar mentionne qu’une seule tâche agentique peut utiliser plus de 3 400 fois le nombre de tokens consommés par les interactions conversationnelles habituelles. Cette hausse exerce une pression sur l’énergie, la densité des racks, le volume des boîtiers et la capacité mémoire. Elle estime que la réponse traditionnelle consistant à ajouter toujours plus de silicium, de mémoire, d’énergie et de fibre ne peut pas se poursuivre indéfiniment, car chaque nouvelle amélioration pourrait nécessiter davantage d’intrants que la génération précédente.

Cette vision propose deux voies parallèles : des améliorations progressives des architectures actuelles afin d’accroître l’efficacité, l’utilisation et la viabilité économique, ainsi que des transformations plus profondes qui remodèlent la courbe de performance grâce à de nouvelles architectures, de nouveaux matériaux et de nouvelles méthodes de conception des systèmes et des modèles. Borkar cite le passage des processeurs aux conceptions multicœurs après que l’augmentation de la fréquence d’horloge s’est heurtée à une limite énergétique, ainsi que le passage de la mémoire NAND d’une conception plane à une conception verticale.

Le rendement, résultat de la collaboration entre toutes les couches

L’article souligne qu’un goulet d’étranglement n’est pas nécessairement résolu dans la couche où il apparaît. Mesurer les performances d’un composant isolé ne suffit pas, car les gains et les pertes s’accumulent entre le centre de données, le silicium, les modèles et les outils qui coordonnent les tâches des agents. Borkar appelle donc à une « conception conjointe » qui définisse d’abord le résultat recherché, puis optimise à nouveau l’ensemble du système au lieu de maximiser les performances d’un seul élément.

En matière de mémoire, Microsoft estime que le problème ne réside pas seulement dans une pénurie de composants, mais constitue un défi à l’échelle du système. L’inférence doit prendre en charge des modèles plus grands, des contextes plus longs et fournir rapidement les données, tandis que les agents ajoutent des opérations de génération, de récupération, d’utilisation d’outils et de mémoire persistante au sein de boucles pouvant durer des minutes ou des heures. L’expérience de la plateforme Azure Maia montre que la réduction de la consommation de mémoire du KV cache peut associer l’ingénierie des modèles, la science des données et la compression, ainsi que la gestion logicielle des hiérarchies de mémoire, l’optimisation du silicium, le déplacement des données et les compilateurs.

L’idée n’est pas simplement d’ajouter de nouveaux octets, mais d’extraire davantage d’intelligence utile de chaque octet disponible.

Des réseaux à l’énergie

À l’échelle des clusters, l’intelligence ne provient pas d’une seule puce, mais de milliers de puces fonctionnant comme un système unique. Le résultat ne dépend donc pas uniquement de la vitesse des interconnexions, mais aussi de la gestion de la congestion, de la récupération après incident, de la répartition des charges de travail, de la complexité de la programmation et des frontières entre le silicium, le système et les logiciels.

Borkar affirme que la conception de la plateforme Maia est partie du résultat à atteindre, à savoir une inférence efficace à l’échelle de la flotte, et non d’une conception de réseau préexistante. Cela a notamment impliqué la création d’un réseau d’extension à deux niveaux, l’intégration de fonctions de carte réseau dans la puce et le développement d’une couche de transport dédiée. Selon l’article, cette approche a permis d’obtenir des performances évolutives dans des clusters d’inférence denses, de simplifier la programmation, d’accroître la flexibilité des charges de travail et de réduire le matériel réseau nécessaire.

Quant à l’énergie, elle est passée du statut de ressource consommée par le système à celui de contrainte devant être intégrée à la conception, du réseau électrique jusqu’à la puce. L’article évoque l’augmentation de la puissance des racks, passée de dizaines à des centaines de kilowatts, ainsi que le fonctionnement de complexes de centres de données à l’échelle du gigawatt. Il mentionne également des solutions telles que les transformateurs à semi-conducteurs et la distribution en courant continu à 800 volts afin de réduire les pertes de distribution.

Microsoft présente le processeur serveur Azure Cobalt 200 basé sur Arm comme un exemple de cette conception conjointe ; chaque cœur dispose d’un contrôle dédié de la tension et de la fréquence, avec une détermination logicielle de la consommation d’énergie de chaque machine virtuelle. L’entreprise affirme que ce contrôle précis permet d’ajuster la puissance tout en protégeant les performances des charges de travail critiques, ce qui permet d’exécuter davantage de serveurs dans les mêmes limites énergétiques.

Qu’est-ce qui compte en pratique ?

L’importance de cette proposition réside dans le déplacement du débat, qui passe de la course à la capacité brute à l’efficacité de la conversion des ressources en résultats. Pour les opérateurs de cloud et de centres de données, cela signifie que l’évaluation du matériel ne peut être dissociée des réseaux, des logiciels, du refroidissement et de la gestion des charges. Pour les développeurs de modèles et d’agents, l’efficacité de la mémoire, la durée des tâches et l’intégration des outils deviennent des facteurs qui influencent l’évolutivité autant que la taille du modèle.

Cette conclusion reste toutefois une vision émanant de Microsoft et reposant en partie sur son expérience de la construction et de l’exploitation d’une infrastructure d’intelligence artificielle à grande échelle ; elle ne constitue pas une norme indépendante établie pour tous les environnements. De plus, l’article ne fournit pas de chiffres comparatifs détaillés permettant de mesurer les gains de Maia ou de Cobalt 200, et ne précise ni le coût ni le calendrier de mise en œuvre des solutions mentionnées en dehors du contexte d’Azure.

Néanmoins, la « nécessité du rendement » pose une question pratique à l’industrie : les investissements croissants dans l’énergie, les puces et les centres de données produisent-ils une intelligence accessible à un coût approprié, ainsi que des gains de productivité et une valeur concrète ? Dans la vision de Borkar, le rendement ne s’achève pas avec la production de tokens, mais lorsque ces résultats se transforment en découverte scientifique plus rapide, en signal médical détecté précocement, en meilleur apprentissage ou en nouvelles opportunités pour les petites entreprises.

Source de l’actualité
Microsoft Official Blog
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités