KI-Beschleuniger, die sich einer Leistung von 1 Kilowatt nähern, veranlassen Halbleiteringenieure, das Konzept der Testabdeckung neu zu überdenken. Das Erreichen derselben Leistungszahl beweist nicht, dass der Chip unter den Bedingungen getestet wurde, denen er tatsächlich ausgesetzt sein wird. Zwei unterschiedliche Lasten können dieselbe Leistung verbrauchen, während sie verschiedene Rechenblöcke, Speicherschnittstellen und Energieverteilungspfade aktivieren und unterschiedliche Hotspots innerhalb des Gehäuses erzeugen.
Laut einer am 10. September 2026 veröffentlichten Analyse von Semiconductor Engineering beschränkt sich die Verifizierung auf diesen Leistungsniveaus nicht auf das zu testende Gerät (DUT), sondern umfasst auch das Gehäuse, das Kühlsystem, die Lastplatine, Sockel und Kontaktpunkte sowie die automatischen Testgeräte. Der Artikel zitierte Christopher Rand von Nordson Test & Inspection mit der Aussage, dass die Werkzeuge dieses Systems zu der Gesamtheit gehören, die qualifiziert und verifiziert werden sollte, und nicht lediglich neutrale Mittel zur Messung des Chips sind.
Die Gesamtleistung zeigt nicht, wo die Gefahr liegt
Chiptests stützten sich lange auf die Fehlerabdeckung und auf Testmuster, die strukturelle Defekte aufdecken und das Gerät an seine Betriebsgrenzen führen. Brent Bullock von Advantest ist jedoch der Ansicht, dass die Verifizierung von KI-Beschleunigern eine Verknüpfung der Fehlerabdeckung mit der thermischen Abdeckung erfordert. Ein bestimmtes Muster kann die erforderliche Logik testen, ohne die Wärme an denselben Stellen zu erzeugen, denen der Chip während einer realen funktionalen Last ausgesetzt ist, oder ohne ihn lange genug in diesem Zustand zu halten, damit seine elektrischen und thermischen Auswirkungen sichtbar werden.
Es reicht nicht unbedingt aus, alle Einheiten mit maximaler Intensität zu betreiben. Scan-Tests können selbst unter Berücksichtigung der Leistung einen synchronisierten Schaltvorgang erzeugen, der keinen funktionalen Betrieb abbildet. Mission-Mode und Built-in Self-Test können sich den Einsatzbedingungen stärker annähern, benötigen jedoch Lasten, die den zu untersuchenden Zustand reproduzieren.
Das Problem besteht darin, dass die Zahl 1.000 Watt die Leistung auf einer Gesamtebene beschreibt, aber nicht angibt, wie sie auf dem Die verteilt ist. Die Temperatur an der Oberfläche des Gehäuses kann akzeptabel erscheinen, während ein kleinerer Bereich heiß genug ist, um das Timing oder die langfristige Zuverlässigkeit zu beeinflussen. Daher fordert Lang Lin von Synopsys, das tatsächliche Design mit der realen Last zu betreiben und die Temperaturen im gesamten Gerät zu messen, statt sich allein auf Tabellen oder allgemeine Maximalgrenzen zu verlassen.
Die Zeit ist Teil der Abdeckung
Nicht alle Ausfallmechanismen treten auf derselben Zeitskala auf. Bullock wies darauf hin, dass der Chip innerhalb weniger hundert Mikrosekunden in ein thermisches Durchgehen geraten kann, weshalb ein schneller Einbruch der Versorgungsspannung oder Stromindikatoren überwacht und der Test vor dem Auftreten größerer Schäden beendet werden muss. Andere Probleme benötigen jedoch Sekunden konstanten Stroms, bis die Temperatur der Kontaktpunkte steigt, ihr Widerstand zunimmt und ihre Fähigkeit zur Stromführung abnimmt.
Glenn Cunningham von Modus Test erklärte, dass ein Kontaktpunkt den anfänglichen Durchgangstest bestehen und anschließend beim Anlegen des realen Stroms ausfallen kann. Außerdem können Widerstandsunterschiede zwischen ähnlichen Kontaktpunkten dazu führen, dass sich der Strom auf einem einzigen Pfad konzentriert. Dadurch steigt die Temperatur, was zu einer übermäßigen elektrischen Belastung (EOS) führen kann, die den Kontaktpunkt, den Sockel und das Gerät beschädigt.
Hier entsteht ein praktischer Zielkonflikt: Qualifikations- oder Burn-in-Tests können nicht jahrelangen Betrieb simulieren, während Auftragsfertiger und ausgelagerte Halbleitermontage- und Testunternehmen (OSAT) die Produktionsgeschwindigkeit aufrechterhalten müssen. Brad Booth von NLM Photonics zufolge können diese Systeme nicht unbegrenzt betrieben werden, um sicherzustellen, dass sie für immer halten. Deshalb sollte die Testdauer entsprechend dem angestrebten Ausfallmechanismus gewählt werden, wobei anzuerkennen ist, dass ein einziger Zeitraum schnelles thermisches Durchgehen, die Erwärmung von Kontakten und die durch wiederholte Temperaturzyklen verursachte Verschlechterung nicht gleichzeitig abdecken wird.
Vom Chip zur Testsystemarchitektur
Bei diesen Leistungen kann die Fehlerquelle im Testpfad und nicht im Silizium liegen. Die Lastplatine, der Sockel, der Handler oder Prober, das Kühlsystem und die automatischen Testgeräte verändern sich während des Betriebs sowohl elektrisch als auch thermisch. Bullock zufolge reicht es nicht mehr aus, diese Komponenten wie in der Vergangenheit getrennt zu betrachten. Stattdessen sollte der „vollständige Stack“ untersucht werden, um festzustellen, welcher Zustand das Gerät tatsächlich erreicht.
Das Gehäuse selbst bringt zusätzliche Komplexität mit sich. Wärme kann die Bewegung von Ladungsträgern, die Leistung der Transistoren und das Timing verändern, wodurch eine miteinander verbundene Schleife aus Leistung, Wärme, Belastung und Timing entsteht. Hohlräume, frühe Delamination zwischen Schichten und Risse an Grenzflächen können außerdem die Wärmeleitung beeinträchtigen oder sich weiterentwickeln, nachdem das Gerät den anfänglichen elektrischen Test bestanden hat. Phänomene wie das Verbiegen des Gehäuses können nach dem Entfernen der Wärme verschwinden, während der durch die Belastung verursachte Schaden bestehen bleibt.
Daher gewinnt die zerstörungsfreie Prüfung vor und nach der Belastung an Bedeutung, unter Einsatz von Techniken wie akustischer Prüfung und Röntgeninspektion, während eine zerstörende Analyse herangezogen wird, wenn eine konkrete Hypothese über den Ort oder die Ursache des Defekts vorliegt.
Lesart von certi.news: Die Verifizierung bewegt sich von der Messung zur Verknüpfung
Die eigentliche Veränderung besteht nicht einfach darin, dass die Tests mehr Strom oder eine stärkere Kühlung benötigen, sondern darin, dass die Bedeutung von „Abdeckung“ mehrdimensional geworden ist. Die elektrische Abdeckung sollte mit der thermischen, lastbezogenen, räumlichen und zeitlichen Abdeckung verknüpft werden. Ebenso müssen Timing-Margen mit dem durch Widerstand verursachten Spannungseinbruch, der Temperatur und der Verschlechterung von Komponenten verknüpft werden, statt jede Messung isoliert zu betrachten.
Der Beitrag weist darauf hin, dass die Erkennung dieser Zusammenhänge nicht am Labortor endet. Einige Wechselwirkungen zwischen Chip, System und Rechenzentrum lassen sich während der Qualifikation nur schwer reproduzieren und treten möglicherweise erst im Feldeinsatz auf. Deshalb werden die Überwachung der Timing-Marge, des Spannungseinbruchs, der Spannungsschwankungen und der Veränderungen von Zyklus zu Zyklus zu wichtigen Quellen für das Verständnis der Zuverlässigkeit nach der Einführung des Geräts.
Die grundlegende Einschränkung besteht darin, dass diese Sichtweise keinen einzelnen Test liefert, der die Zuverlässigkeit endgültig festlegt. Sie erfordert eine bessere Modellierung, schnellere Messgeräte, eine Charakterisierung des Energie- und Kühlpfads sowie eine Verknüpfung von Testdaten mit den tatsächlichen Lastbedingungen. Die offene Frage bleibt, wie viel vor der Produktion erfasst werden kann und was weiterhin aus Tausenden von Geräten gelernt werden muss, nachdem sie in Betrieb genommen wurden.