Chips e semicondutores

Aceleradores de IA de 1 quilowatt redefinem o significado da verificação da confiabilidade

Operar no nível de 1 quilowatt não representa uma única condição de teste, pois os riscos variam conforme a carga, a localização do calor, a duração da operação e o caminho de fornecimento de energia. Uma análise da Semiconductor Engineering considera que a verificação deve incluir o chip, o encapsulamento, o sistema de teste e os dados de campo, e não apenas a detecção de falhas elétricas.

2026-09-10
7 min de leitura
8 visualizações
فريق تحرير certi.news
Aceleradores de IA de 1 quilowatt redefinem o significado da verificação da confiabilidade

Os aceleradores de IA que se aproximam de 1 quilowatt estão levando os engenheiros de semicondutores a reconsiderar o conceito de cobertura de testes. Alcançar o mesmo valor de potência não prova que o chip foi testado nas condições que enfrentará na prática; duas cargas diferentes podem consumir a mesma potência, enquanto ativam blocos de computação, interfaces de memória e diferentes caminhos de distribuição de energia, gerando pontos quentes distintos dentro do encapsulamento.

Segundo uma análise publicada pela Semiconductor Engineering em 10 de setembro de 2026, a verificação nesses níveis não se limita ao dispositivo sob teste (DUT), mas inclui o encapsulamento, o sistema de refrigeração, a placa de carga, os soquetes e pontos de contato e os equipamentos de teste automatizado. O artigo citou Christopher Rand, da Nordson Test & Inspection, afirmando que as ferramentas desse sistema se tornaram parte do conjunto que deve ser qualificado e verificado, e não apenas meios neutros de medir o chip.

A potência total não revela onde está o risco

Os testes de chips há muito dependem da cobertura de falhas e de padrões de teste que detectam defeitos estruturais e levam o dispositivo aos seus limites de operação. Mas Brent Bullock, da Advantest, considera que a verificação de aceleradores de IA exige associar a cobertura de falhas à cobertura térmica. Um determinado padrão pode testar a lógica necessária sem colocar o calor nos mesmos locais aos quais o chip é exposto durante uma carga funcional real, ou sem mantê-lo por tempo suficiente para que seus efeitos elétricos e térmicos apareçam.

Também não é necessariamente suficiente operar todas as unidades na intensidade máxima. Os testes de scan, mesmo quando levam a potência em consideração, podem criar uma comutação sincronizada que não representa a operação funcional. Já o mission-mode e o built-in self-test podem se aproximar mais das condições de uso, mas precisam de cargas que reproduzam o estado que o engenheiro deseja examinar.

O problema é que o número de 1.000 watts descreve a potência em um nível agregado, mas não determina como ela é distribuída pelo die. A temperatura da superfície do encapsulamento pode parecer aceitável, enquanto uma área menor fica quente o suficiente para afetar o timing ou a confiabilidade de longo prazo. Por isso, Lang Lin, da Synopsys, defende executar o projeto real com a carga efetiva e medir as temperaturas em diferentes partes do dispositivo, em vez de depender apenas de tabelas ou limites máximos gerais.

O tempo é parte da cobertura

Nem todos os mecanismos de falha aparecem na mesma escala de tempo. Bullock observou que o chip pode entrar em fuga térmica em algumas centenas de microssegundos, o que exige monitoramento rápido da queda de tensão ou dos indicadores de corrente e a interrupção do teste antes que ocorram danos significativos. Outros problemas, porém, precisam de segundos de corrente contínua para que a temperatura dos pontos de contato suba, aumentando sua resistência e reduzindo sua capacidade de conduzir corrente.

Glenn Cunningham, da Modus Test, explicou que um ponto de contato pode ser aprovado no teste inicial de continuidade e depois falhar quando a corrente real é aplicada. Além disso, diferenças de resistência entre pontos de contato semelhantes podem fazer a corrente se concentrar em um único caminho, elevando a temperatura e podendo levar a um estresse elétrico excessivo (EOS) que danifica o ponto de contato, o soquete e o dispositivo.

Surge aqui um compromisso prático: os testes de qualificação ou burn-in não conseguem simular anos de operação, enquanto as empresas de montagem e teste terceirizados (OSAT) precisam manter a velocidade de produção. Segundo Brad Booth, da NLM Photonics, não é possível operar esses sistemas indefinidamente para garantir que viverão para sempre. Portanto, a duração do teste deve ser escolhida de acordo com o mecanismo de falha visado, reconhecendo que um único período não cobrirá simultaneamente a fuga rápida, o aquecimento dos contatos e a degradação causada por ciclos térmicos repetidos.

Do chip ao sistema de teste

Nessas potências, a fonte do problema pode estar no caminho de teste, e não no silício. A placa de carga, o soquete, o handler ou prober, o sistema de refrigeração e os equipamentos de teste automatizado mudam elétrica e termicamente durante a operação. Bullock considera que separar esses componentes, como era feito historicamente, já não é suficiente, e que todo o «stack» deve ser examinado para determinar a condição que efetivamente chega ao dispositivo.

O próprio encapsulamento acrescenta outra complexidade. O calor pode alterar o movimento dos portadores de carga, o desempenho dos transistores e o timing, em um ciclo interligado entre potência, calor, estresse e timing. Vazios, delaminação precoce entre camadas e trincas nas interfaces também podem enfraquecer a condução térmica ou evoluir depois que o dispositivo passa no teste elétrico inicial. Fenômenos como o empenamento do encapsulamento podem desaparecer quando o calor é removido, embora permaneça o dano causado pelo estresse.

Por isso, destaca-se o papel da inspeção não destrutiva antes e depois da aplicação da carga, utilizando técnicas como inspeção acústica e raios X, com recurso à análise destrutiva quando houver uma hipótese específica sobre a localização ou a causa do defeito.

Leitura da certi.news: a verificação passa da medição à correlação

A mudança efetiva não é simplesmente que os testes precisam de corrente mais alta ou refrigeração mais forte, mas que o significado de «cobertura» se tornou multidimensional. É necessário associar a cobertura elétrica à cobertura térmica, de carga, espacial e temporal. Também é preciso relacionar a margem de timing à queda de tensão causada pela resistência, à temperatura e à degradação dos componentes, em vez de tratar cada medição isoladamente.

O material indica que a descoberta dessas relações não termina na porta do laboratório. Algumas interações entre o chip, o sistema e o data center são difíceis de reproduzir durante a qualificação e podem aparecer apenas após a operação em campo. Por isso, o monitoramento da margem de timing, da queda de tensão, da oscilação da tensão e da variação de um ciclo para outro torna-se uma fonte importante para compreender a confiabilidade depois que o dispositivo é implantado.

A principal limitação é que essa visão não oferece um único teste capaz de determinar a confiabilidade. Ela exige uma modelagem melhor, instrumentos de medição mais rápidos, caracterização do caminho de energia e de refrigeração e correlação entre os dados de teste e as condições reais de carga. A questão em aberto continua sendo quanto pode ser coletado antes da produção e o que ainda será necessário aprender com milhares de dispositivos depois que entrarem em serviço.

Fonte da notícia
Semiconductor Engineering
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias