Chips y semiconductores

Los aceleradores de IA de 1 kilovatio redefinen el significado de la verificación de la fiabilidad

Operar a un nivel de 1 kilovatio no representa un único caso de prueba, ya que los riesgos cambian según la carga, la ubicación del calor, la duración de la operación y la ruta de suministro de energía. El análisis de Semiconductor Engineering sostiene que la verificación debe abarcar el chip, el paquete, el sistema de prueba y los datos de campo, no solo la detección de fallos eléctricos.

2026-09-10
7 min de lectura
9 visitas
فريق تحرير certi.news
Los aceleradores de IA de 1 kilovatio redefinen el significado de la verificación de la fiabilidad

Los aceleradores de inteligencia artificial que se acercan a una potencia de 1 kilovatio están llevando a los ingenieros de semiconductores a replantearse el concepto de cobertura de pruebas. Alcanzar la misma cifra de potencia no demuestra que el chip haya sido probado en las condiciones que afrontará realmente; dos cargas diferentes pueden consumir la misma potencia, mientras activan distintos bloques de cómputo, interfaces de memoria y rutas de distribución de energía, y generan diferentes puntos calientes dentro del paquete.

Según un análisis publicado por Semiconductor Engineering el 10 de septiembre de 2026, la verificación en estos niveles no se limita al dispositivo bajo prueba (DUT), sino que incluye el paquete, el sistema de refrigeración, la placa de carga, los zócalos y puntos de contacto, y los equipos de prueba automatizados. El artículo citó a Christopher Rand, de Nordson Test & Inspection, quien afirmó que las herramientas de este sistema se han convertido en parte del conjunto que debe cualificarse y verificarse, y no simplemente en medios neutrales para medir el chip.

La potencia total no revela dónde está el riesgo

Las pruebas de chips se han basado durante mucho tiempo en la cobertura de fallos y en patrones de prueba que detectan defectos estructurales y llevan el dispositivo hasta sus límites operativos. Sin embargo, Brent Bullock, de Advantest, considera que la verificación de los aceleradores de inteligencia artificial requiere vincular la cobertura de fallos con la cobertura térmica. Un patrón determinado puede probar la lógica necesaria sin situar el calor en los mismos lugares a los que se expone el chip durante una carga funcional real, o sin mantenerlo el tiempo suficiente para que aparezcan sus efectos eléctricos y térmicos.

Tampoco basta necesariamente con operar todas las unidades a máxima intensidad. Las pruebas de scan, incluso teniendo en cuenta la potencia, pueden crear una conmutación sincronizada que no representa la operación funcional. En cambio, mission-mode y built-in self-test pueden acercarse más a las condiciones de uso, pero necesitan cargas que reproduzcan el estado que el ingeniero quiere examinar.

El problema es que la cifra de 1.000 vatios describe la potencia a nivel total, pero no determina cómo se distribuye en el dado. La temperatura de la superficie del paquete puede parecer aceptable, mientras que una zona más pequeña puede calentarse lo suficiente como para afectar al sincronismo o a la fiabilidad a largo plazo. Por ello, Lang Lin, de Synopsys, aboga por ejecutar el diseño real con la carga efectiva y medir las temperaturas en todo el dispositivo, en lugar de depender únicamente de tablas o límites máximos generales.

El tiempo forma parte de la cobertura

No todos los mecanismos de fallo aparecen en la misma escala temporal. Bullock señaló que el chip puede entrar en fuga térmica en unos pocos cientos de microsegundos, lo que requiere una supervisión rápida de la caída de tensión o de los indicadores de corriente y detener la prueba antes de que se produzcan daños importantes. Sin embargo, otros problemas necesitan segundos de corriente continua para que aumente la temperatura de los puntos de contacto, se eleve su resistencia y disminuya su capacidad para transportar corriente.

Glenn Cunningham, de Modus Test, explicó que un punto de contacto puede superar la prueba inicial de continuidad y después fallar al aplicar la corriente real. Asimismo, las diferencias de resistencia entre puntos de contacto similares pueden hacer que la corriente se concentre en una sola ruta, elevando la temperatura y pudiendo provocar un exceso de estrés eléctrico (EOS) que dañe el punto de contacto, el zócalo y el dispositivo.

Aquí surge una disyuntiva práctica: las pruebas de cualificación o de burn-in no pueden simular años de funcionamiento, mientras que las empresas de ensamblaje y prueba externalizada (OSAT) están obligadas a mantener la velocidad de producción. Según Brad Booth, de NLM Photonics, estos sistemas no pueden operarse indefinidamente para asegurarse de que vivirán para siempre. Por tanto, la duración de la prueba debe seleccionarse según el mecanismo de fallo objetivo, reconociendo que un único periodo no cubrirá simultáneamente la fuga rápida, el calentamiento de los contactos y el deterioro provocado por ciclos térmicos repetidos.

Del chip al sistema de prueba

A estas potencias, el origen del fallo puede estar en la ruta de prueba y no en el silicio. La placa de carga, el zócalo, el handler o prober, el sistema de refrigeración y los equipos de prueba automatizados cambian tanto eléctrica como térmicamente durante la operación. Bullock considera que separar estos componentes, como se hacía históricamente, ya no es suficiente, y que debe examinarse el «conjunto completo» para conocer el estado que realmente llega al dispositivo.

El propio paquete añade otra complejidad. El calor puede modificar el movimiento de los portadores de carga, el rendimiento de los transistores y el sincronismo, en un ciclo interconectado entre potencia, temperatura, estrés y temporización. Asimismo, los vacíos, la delaminación temprana entre capas y las grietas en las interfaces pueden debilitar la conducción térmica o desarrollarse después de que el dispositivo haya superado la prueba eléctrica inicial. Fenómenos como la deformación del paquete pueden desaparecer al retirar el calor, aunque permanezca el daño causado por el estrés.

Por ello cobra importancia la inspección no destructiva antes y después de la carga, utilizando técnicas como la inspección acústica y los rayos X, y recurriendo al análisis destructivo cuando exista una hipótesis concreta sobre la ubicación o la causa del defecto.

Lectura de certi.news: la verificación pasa de la medición a la interconexión

El cambio real no consiste simplemente en que las pruebas necesiten más corriente o una refrigeración más potente, sino en que el significado de «cobertura» se ha vuelto multidimensional. La cobertura eléctrica debe vincularse con la cobertura térmica, de carga, espacial y temporal. También es necesario relacionar el margen de sincronismo con la caída de tensión causada por la resistencia, la temperatura y el deterioro de los componentes, en lugar de tratar cada medición de forma aislada.

El artículo señala que la detección de estas relaciones no termina en la puerta del laboratorio. Algunas interacciones entre el chip, el sistema y el centro de datos son difíciles de reproducir durante la cualificación y quizá solo aparezcan después de la operación en campo. Por ello, la supervisión del margen de sincronismo, la caída de tensión, la fluctuación del voltaje y el cambio de un ciclo a otro se convierte en una fuente importante para comprender la fiabilidad después del despliegue del dispositivo.

La principal limitación es que esta perspectiva no ofrece una única prueba que determine la fiabilidad. Requiere un mejor modelado, instrumentos de medición más rápidos, una caracterización de la ruta de energía y refrigeración, y una correlación entre los datos de prueba y las condiciones reales de carga. La pregunta abierta sigue siendo cuánto puede recopilarse antes de la producción y qué será necesario seguir aprendiendo de los miles de dispositivos una vez que entren en servicio.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias