功率接近1千瓦的人工智能加速器正推动半导体工程师重新审视测试覆盖率的概念。达到同一功率数值,并不能证明芯片已在其实际将面临的条件下接受测试;因为两个不同的负载可能消耗相同的功率,同时激活不同的计算模块、内存接口和配电路径,并在封装内部产生不同的热点。
根据Semiconductor Engineering于2026年9月10日发布的分析,在这些功率水平下进行验证并不局限于被测器件(DUT),还包括封装、冷却系统、负载板、插座和接触点,以及自动化测试设备。文章援引Nordson Test & Inspection的Christopher Rand的话称,这一系统的工具已成为应当进行鉴定和验证的整体系统的一部分,而不再只是用于测量芯片的中性手段。
总功率无法揭示风险所在
长期以来,芯片测试一直依赖故障覆盖率,以及能够发现结构缺陷并将器件推向运行极限的测试模式。但Advantest的Brent Bullock认为,人工智能加速器的验证需要将故障覆盖率与热覆盖率联系起来。某种模式可能测试了所需的逻辑,却没有让热量出现在芯片执行真实功能负载时相同的位置,或者没有持续足够长的时间,使其电气和热效应显现出来。
也不一定只需将所有单元以最大强度运行。即使考虑功率,扫描测试(scan)也可能产生并不代表功能运行的同步切换。而任务模式(mission-mode)和内置自测试(built-in self-test)可以更接近使用条件,但它们需要能够重现工程师希望检查的状态的负载。
问题在于,1,000瓦这一数值描述的是总功率层面的情况,却没有说明功率如何分布在芯片裸片上。封装表面温度可能看似可以接受,但更小的区域可能已经热到足以影响时序或长期可靠性。因此,Synopsys的Lang Lin主张运行真实设计和实际负载,并测量器件各处的温度,而不是仅依赖表格或一般性的绝对上限。
时间是覆盖率的一部分
并非所有失效机制都发生在相同的时间尺度上。Bullock指出,芯片可能在几百微秒内进入热失控,这要求快速监测电压下降或电流指标,并在发生重大损坏前停止测试。但其他问题需要持续数秒的电流,才能使接触点温度升高,导致其电阻增加并降低载流能力。
Modus Test的Glenn Cunningham解释说,接触点可能通过初始连续性测试,然后在施加实际电流时失效。此外,相似接触点之间的电阻差异可能使电流集中在一条路径上,从而升高温度,并可能导致过度电气应力(EOS),损坏接触点、插座和器件。
这里产生了实际权衡:鉴定或老化测试无法模拟多年的运行,而外包组装和测试公司(OSAT)又必须维持生产速度。NLM Photonics的Brad Booth表示,不可能无限期运行这些系统来确认它们能够永远工作。因此,应根据目标失效机制选择测试时长,同时承认单一时长无法同时覆盖快速热失控、接触点发热,以及反复热循环造成的退化。
从芯片到测试系统
在这些功率水平下,故障源可能位于测试路径,而不是硅本身。负载板、插座、handler或prober、冷却系统以及自动化测试设备,都会在运行过程中发生电气和热变化。Bullock认为,像历史上那样将这些组件分开处理已不再足够,应检查“完整堆栈”,以了解实际到达器件的状态。
封装本身又增加了另一层复杂性。热量可能改变载流子的运动、晶体管性能和时序,形成一个由功率、温度、应力和时序相互关联的回路。此外,空洞、层间早期剥离以及界面处的裂纹,可能削弱热传导,或在器件通过初始电气测试后继续发展。封装弯曲等现象可能在热量移除后消失,但应力造成的损伤仍然存在。
因此,加载前后的无损检测作用日益突出,可采用声学检测和X射线等技术;当已有关于缺陷位置或原因的特定假设时,则可进行破坏性分析。
certi.news解读:验证从测量转向关联
真正的变化并不是测试只需要更高电流或更强冷却,而是“覆盖率”的含义已变得多维化。应将电气覆盖率与热覆盖率、负载覆盖率、空间覆盖率和时间覆盖率联系起来。还应将时序裕量与由电阻导致的电压下降、温度和组件退化联系起来,而不是将每项测量彼此孤立地处理。
文章指出,对这些关系的发现并不会在实验室门口结束。芯片、系统和数据中心之间的一些相互作用难以在鉴定期间重现,可能只有在现场运行后才会出现。因此,时序裕量、电压下降、电压波动以及逐周期变化的监测,成为理解器件部署后的可靠性的重要来源。
基本限制在于,这种视角并未提供一个能够最终判定可靠性的单一测试。它需要更好的建模、更快的测量设备、对供电和冷却路径的表征,以及将测试数据与实际负载条件联系起来。悬而未决的问题仍是:在生产前能够收集多少信息,以及设备投入运行后,从数千台设备中仍有多少内容必须继续学习。