Puces et semi-conducteurs

Les accélérateurs d’IA de 1 kilowatt redéfinissent la signification de la vérification de la fiabilité

Fonctionner au niveau de 1 kilowatt ne constitue pas un cas de test unique, car les risques varient selon la charge, l’emplacement de la chaleur, la durée de fonctionnement et le chemin d’acheminement de l’énergie. Selon une analyse de Semiconductor Engineering, la vérification doit couvrir la puce, le boîtier, le système de test et les données de terrain, et pas seulement la détection des défaillances électriques.

2026-09-10
7 min de lecture
9 vues
فريق تحرير certi.news
Les accélérateurs d’IA de 1 kilowatt redéfinissent la signification de la vérification de la fiabilité

Les accélérateurs d’IA approchant une puissance de 1 kilowatt poussent les ingénieurs en semi-conducteurs à repenser la notion de couverture des tests. Atteindre cette valeur de puissance ne prouve pas que la puce a été testée dans les conditions auxquelles elle sera effectivement confrontée ; deux charges différentes peuvent consommer la même puissance tout en activant des blocs de calcul, des interfaces mémoire et des chemins de distribution d’énergie différents, et en générant des points chauds différents à l’intérieur du boîtier.

Selon une analyse publiée par Semiconductor Engineering le 10 septembre 2026, la vérification à ces niveaux ne se limite pas au dispositif sous test (DUT), mais englobe le boîtier, le système de refroidissement, la carte de charge, les sockets et les points de contact, ainsi que les équipements de test automatisé. L’article cite Christopher Rand, de Nordson Test & Inspection, selon lequel les outils de ce système sont devenus une partie de l’ensemble qu’il convient de qualifier et de vérifier, et non de simples moyens neutres de mesurer la puce.

La puissance totale ne révèle pas l’emplacement du risque

Les tests de puces se sont longtemps appuyés sur la couverture des défauts et sur des motifs de test révélant les défauts structurels et poussant le dispositif vers ses limites de fonctionnement. Mais Brent Bullock, d’Advantest, estime que la vérification des accélérateurs d’IA exige de relier la couverture des défauts à la couverture thermique. Un motif donné peut tester la logique requise sans placer la chaleur aux mêmes endroits que ceux exposés par la puce lors d’une charge fonctionnelle réelle, ou sans la maintenir assez longtemps pour que ses effets électriques et thermiques apparaissent.

Faire fonctionner toutes les unités à leur intensité maximale ne suffit pas nécessairement. Les tests scan, même en tenant compte de la puissance, peuvent créer une commutation synchronisée qui ne représente pas le fonctionnement fonctionnel. Les modes mission-mode et built-in self-test peuvent se rapprocher davantage des conditions d’utilisation, mais ils nécessitent des charges reproduisant l’état que l’ingénieur souhaite examiner.

Le problème tient au fait que le chiffre de 1 000 watts décrit la puissance au niveau global, mais ne précise pas comment elle est répartie sur la puce. La température de surface du boîtier peut sembler acceptable, tandis qu’une zone plus petite est suffisamment chaude pour affecter le timing ou la fiabilité à long terme. C’est pourquoi Lang Lin, de Synopsys, préconise d’exécuter la conception réelle avec la charge effective et de mesurer les températures dans différentes zones du dispositif, plutôt que de s’appuyer uniquement sur des tableaux ou des limites maximales générales.

Le temps fait partie de la couverture

Tous les mécanismes de défaillance n’apparaissent pas à la même échelle de temps. Bullock a indiqué que la puce peut entrer en emballement thermique en quelques centaines de microsecondes, ce qui exige une surveillance rapide de la chute de tension ou des indicateurs de courant, ainsi que l’arrêt du test avant qu’un dommage important ne survienne. D’autres problèmes nécessitent toutefois plusieurs secondes de courant continu pour que la température des points de contact augmente, que leur résistance s’accroisse et que leur capacité à transporter le courant diminue.

Glenn Cunningham, de Modus Test, a expliqué qu’un point de contact peut réussir le test initial de continuité, puis échouer lorsqu’on lui applique le courant réel. De même, les différences de résistance entre des points de contact similaires peuvent concentrer le courant sur un seul chemin, ce qui augmente la température et peut entraîner une surcharge électrique (EOS) endommageant le point de contact, le socket et le dispositif.

Un compromis pratique apparaît alors : les tests de qualification ou de burn-in ne peuvent pas simuler des années de fonctionnement, tandis que les sociétés d’assemblage et de test externalisés (OSAT) doivent maintenir la cadence de production. Selon Brad Booth, de NLM Photonics, ces systèmes ne peuvent pas fonctionner indéfiniment pour s’assurer qu’ils dureront éternellement. La durée du test doit donc être choisie en fonction du mécanisme de défaillance ciblé, en reconnaissant qu’une seule durée ne couvrira pas simultanément l’emballement rapide, l’échauffement des contacts et la dégradation due à des cycles thermiques répétés.

De la puce à l’ensemble du système de test

À ces niveaux de puissance, la source du défaut peut se trouver dans le chemin de test et non dans le silicium. La carte de charge, le socket, le handler ou prober, le système de refroidissement et les équipements de test automatisé évoluent tous électriquement et thermiquement pendant le fonctionnement. Bullock estime que séparer ces composants comme cela se faisait historiquement ne suffit plus et qu’il faut examiner la « pile complète » pour connaître l’état qui parvient réellement au dispositif.

Le boîtier lui-même ajoute une autre complexité. La chaleur peut modifier le mouvement des porteurs de charge, les performances des transistors et le timing, dans une boucle interdépendante entre puissance, température, contrainte et timing. Les vides, le délaminage précoce entre les couches et les fissures aux interfaces peuvent également affaiblir la conduction thermique ou évoluer après que le dispositif a réussi le test électrique initial. Des phénomènes tels que la déformation du boîtier peuvent disparaître lors du retrait de la chaleur, alors que les dommages causés par la contrainte subsistent.

Le contrôle non destructif avant et après la mise en charge prend donc une importance accrue, au moyen de techniques telles que l’inspection acoustique et les rayons X, avec recours à l’analyse destructive lorsqu’une hypothèse précise existe sur l’emplacement ou la cause du défaut.

Lecture de certi.news : la vérification passe de la mesure à l’interconnexion

Le véritable changement n’est pas que les tests nécessitent simplement davantage de courant ou un refroidissement plus puissant, mais que la notion de « couverture » est devenue multidimensionnelle. Il faut relier la couverture électrique aux couvertures thermique, de charge, spatiale et temporelle. Il faut également relier la marge de timing à la chute de tension produite par la résistance, à la température et à la dégradation des composants, au lieu de traiter chaque mesure isolément.

L’article indique que la détection de ces relations ne s’arrête pas à la porte du laboratoire. Certaines interactions entre la puce, le système et le centre de données sont difficiles à reproduire lors de la qualification et peuvent n’apparaître qu’après la mise en service sur le terrain. La surveillance de la marge de timing, de la chute de tension, des fluctuations de tension et de la variation d’un cycle à l’autre devient donc une source importante pour comprendre la fiabilité après le déploiement du dispositif.

La limite fondamentale est que cette vision ne fournit pas un test unique permettant de trancher la question de la fiabilité. Elle exige une meilleure modélisation, des instruments de mesure plus rapides, une caractérisation du chemin de l’énergie et du refroidissement, ainsi qu’une mise en relation des données de test avec les conditions réelles de charge. La question ouverte reste de savoir quelle quantité d’informations peut être recueillie avant la production et ce qu’il restera nécessaire d’apprendre à partir de milliers de dispositifs après leur mise en service.

Source de l’actualité
Semiconductor Engineering
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités