Informatique en nuage et centres de données

Les centres de données d’IA confrontés à un problème de puissance immobilisée pouvant être convertie en capacité de calcul

Les centres de données d’intelligence artificielle consomment une partie de leur capacité électrique disponible en raison des systèmes d’alimentation de secours et des exigences de fiabilité, laissant une capacité qui n’est pas réellement utilisée. L’analyse présente des techniques de réduction de tension et de gestion des charges qui pourraient permettre d’exploiter cette capacité, avec une réduction rapide en cas de défaillance de l’une des sources d’alimentation, tout en maintenant des difficultés liées à la planification, à la sécurité et à la réponse aux pannes.

2026-09-15
7 min de lecture
3 vues
فريق تحرير certi.news
Les centres de données d’IA confrontés à un problème de puissance immobilisée pouvant être convertie en capacité de calcul

Le problème énergétique des centres de données d’intelligence artificielle ne réside pas seulement dans la quantité d’électricité consommée, mais aussi dans la quantité de puissance payée et réservée pour faire face aux pannes, puis laissée inutilisée. Une analyse publiée par Semiconductor Engineering le 15 septembre 2026 présente un paradoxe fondamental : réduire la consommation des puces et des serveurs améliore l’efficacité, mais peut accroître l’écart entre la puissance disponible et la puissance effectivement utilisée, tandis que l’architecture d’alimentation de secours contraint les opérateurs à laisser une grande partie de la capacité hors de l’usage normal.

Ce problème prend de l’importance avec l’expansion des charges d’intelligence artificielle, car l’obtention d’une nouvelle capacité électrique peut nécessiter des lignes de transport, des autorisations et une production supplémentaire sur site. Selon Marissa Houmon, directrice technique chez Utilidata, ajouter des équipements à une capacité déjà disponible peut être plus facile que construire un nouveau centre de données ou attendre une augmentation de l’approvisionnement.

Pourquoi la capacité reste-t-elle inutilisée ?

Les centres de données sont généralement conçus pour supporter la perte d’une source d’alimentation sans interrompre le service. Dans une configuration « 3+1 », l’installation a besoin de trois sources à pleine capacité et en ajoute une quatrième en réserve, de sorte que les quatre sources fonctionnent à environ 75 % de leur capacité et que les trois sources restantes puissent couvrir la charge en cas de défaillance de l’une d’elles. Dans une architecture 2N, deux alimentations sont disponibles et la charge de chaque ligne est maintenue à environ 50 % en prévision de la perte de l’autre.

Houmon explique qu’un site conçu pour 2 gigawatts peut être traité en pratique comme un site d’une capacité de 1 gigawatt lorsqu’il adopte le 2N, puis que seulement 70 % à 80 % environ de cette capacité sont généralement utilisés. Ainsi, la puissance qui parvient effectivement à l’infrastructure informatique, si l’on considère l’ensemble du site, peut atteindre environ un tiers de la capacité nominale de 2 gigawatts. Il ne s’agit pas d’un gaspillage dû à une défaillance des équipements, mais d’une conséquence directe des exigences de fiabilité et des marges d’exploitation.

Réduire la consommation de la puce ne suffit pas à résoudre le problème

L’amélioration énergétique commence par la conception des circuits et par la gestion de la propriété intellectuelle intégrée à la puce. Arif Khan, de Cadence, a souligné l’importance de désactiver les interfaces et les canaux inutilisés, d’utiliser plusieurs états de veille et d’ajuster la fréquence d’horloge et la tension en fonction du travail en cours. Les interfaces AMBA à faible consommation, comme les canaux Q et P, fournissent des mécanismes permettant de contrôler l’arrêt de l’horloge, les domaines d’alimentation et la gestion de plusieurs états.

Le réseau d’interconnexion à l’intérieur de la puce joue un rôle central, car SignatureIP s’appuie sur des horloges désactivables et des états d’alimentation indépendants pour les nœuds du réseau sur puce. Mais la réduction de la puissance impose un équilibre entre le niveau d’économie réalisé et le délai de retour au fonctionnement. Les puces ne se comportent pas non plus toutes de la même manière : la tension est généralement définie en fonction des pires conditions de charge, de température et de vieillissement, même si ces conditions ne surviennent pas toujours simultanément.

Selon Noam Broussard, de proteanTecs, la surveillance intégrée au circuit peut mesurer la marge de sécurité réelle et réduire la tension lorsque les marges maximales ne sont pas nécessaires, puis l’augmenter lorsque la charge ou les conditions changent. Un mécanisme de protection rapide reste toutefois nécessaire, car une réduction excessive de la tension peut compromettre le timing des circuits en cas de variation soudaine de la charge ou de chute dynamique de tension. La protection peut réduire la fréquence d’horloge ou limiter temporairement les performances jusqu’au retour de la tension à un niveau sûr.

Qu’est-ce qui change concrètement dans le centre de données ?

L’idée générale consiste à utiliser la capacité de secours pendant le fonctionnement normal, puis à réduire les charges avant ou au moment de la perte d’une source d’alimentation. Utilidata propose deux boucles de contrôle : la première, plus lente, est connectée à la planification des charges et fournit des prévisions de la puissance disponible pour chaque baie, rangée ou salle, afin que l’ordonnanceur répartisse les tâches des unités de traitement graphique en fonction de la capacité variable. La seconde est plus rapide et utilise des interfaces telles que le DVFS ainsi que la gestion des serveurs pour contrôler la puissance sur une échelle de temps de l’ordre de la milliseconde.

La technologie ne planifie ni n’annule directement le travail ; elle influence l’ordonnanceur au moyen de données de puissance. Elle s’appuie sur la bibliothèque de gestion de NVIDIA et sur le contrôleur de gestion de la carte mère BMC pour accéder au comportement énergétique et aux mesures, avec une mesure directe au niveau de la baie plutôt que la collecte d’estimations provenant de serveurs pris individuellement. Selon Houmon, cette approche pourrait permettre de faire fonctionner les quatre lignes de la configuration 3+1 à environ 95 % à 98 % de leur capacité dans des conditions normales, puis de réduire la charge de manière ordonnée lorsque cela est nécessaire.

Limites et questions ouvertes

Exploiter la capacité de secours ne signifie pas que l’ajout de serveurs devient gratuit ou exempt de contraintes. Les équipements supplémentaires nécessitent de l’espace, du refroidissement et des communications. En outre, le déplacement des charges d’intelligence artificielle peut exiger de vider les requêtes en cours et de charger les poids des modèles sur une autre instance, des opérations qui peuvent prendre quelques secondes. À l’inverse, réduire uniquement la tension des puces ne suffit pas à traiter une défaillance d’une source d’alimentation ; la surveillance et la réponse doivent être assurées au niveau de la baie et de l’installation.

Cette architecture ajoute une surface d’attaque sensible. Chaque serveur est équipé d’un BMC, tandis que les hôtes des unités de traitement graphique exposent des interfaces permettant de définir les limites de puissance pour les opérations disposant de privilèges suffisants. Utilidata affirme donc que son système repose sur un démarrage sécurisé, une racine de confiance matérielle, des micrologiciels signés et une authentification mutuelle sur les interfaces, avec une boucle de contrôle exécutée localement et sans dépendre d’Internet. Sur le plan éditorial, l’importance de cette évolution réside dans la transformation de l’énergie de secours, qui passe d’une marge rigide à une ressource gérable. Sa réussite dépend toutefois de la capacité de l’opérateur à garantir une réponse rapide, à ne pas nuire aux charges et à sécuriser les outils de contrôle susceptibles d’influencer des milliers de serveurs simultanément.

Source de l’actualité
Semiconductor Engineering
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités