静默数据错误,或称静默数据错误/静默数据损坏(Silent Data Errors/Silent Data Corruption),揭示了芯片通过传统制造测试与其在整个运行期间持续产生正确结果的能力之间日益扩大的鸿沟。处理器可能通过ATPG测试、转换故障和固定故障测试,以及高速结构测试,然后在不记录明显故障的情况下以错误方式执行计算,之后错误结果可能传递给应用程序或人工智能训练任务。
本文基于Semiconductor Engineering于2026年9月10日发布的分析,汇集了Advantest、Siemens EDA、NXP、Synopsys、Intel、Meta、Google和proteanTecs的观点与成果。这并不涉及某一具体产品的发布,而是处理器质量定义、测试覆盖率评估以及处理器进入数据中心后的管理方式发生了转变。
在单个芯片层面罕见,在服务器群层面广泛
按单台设备衡量时,静默数据错误似乎很罕见,但当数百万个处理器以高利用率运行时,它们会变得频繁且代价高昂。Google和Meta的早期分析表明,这类错误可能影响每1,000台服务器中的一台,相当于每百万个设备中有100至1,000个存在缺陷。即使达到10 FIT的比率,即每十亿小时运行时间发生一次故障,当部署1,000万台设备时,也可能意味着大约每四天发生一次错误。
危险在于,错误可能表现为不正确的数值结果或未定义值,随后导致数据库损坏、人工智能模型出现意外行为,或产生相互矛盾的分析结果。由于处理器本身可能不会发出错误信号,问题可能要到一项长时间任务结束时出现不合逻辑的结果后才会被发现。
传统测试为何会失效?
静默错误与边缘性缺陷有关,例如高电阻金属连接、薄弱桥接缺陷、时序和电压变化,以及老化、辐射、温度和负载条件的影响。随着先进制造节点的发展,这类错误出现的可能性增加,因为裕量变小、连接更小且电阻更高;此外,依赖chiplet的封装也增加了验证路径的复杂性。
业界估计,约80%的错误执行错误与逃过零时测试的缺陷有关,剩余20%则以间歇性方式出现,或由老化造成。但要测试电压、频率、温度、寿命和负载类型的所有可能组合并不现实。此外,将系统层面出现的故障与芯片测试中的特定缺陷模式关联起来,可能需要数周时间,并要求设计、测试、故障分析和系统集成团队协作。
Siemens EDA指出,在测试延迟缺陷时仅依赖单个输入切换,可能无法模拟实际功能运行,因为多个输入同时切换可能产生更大的延迟。因此,测试需要针对多个电压、温度和频率维度,而不能仅依靠无法覆盖所有使用条件的结构缺陷模型。
从工厂到数据中心进行更深入的测试
这一问题正在重新定义测试覆盖率的概念。测试覆盖率不再只是计算测试能够发现的已知制造缺陷比例,还与在真实运行和实际负载下发现错误计算答案的概率相关。因此,各家公司正转向系统级功能测试、负载感知测试和任务模式测试,同时改进内建测试设计并监控芯片内部的裕量。
Intel的经验说明了挑战的规模。在对跨越五代Intel Xeon处理器的120万颗处理器进行测试后,该公司需要在DCDiag测试集合中使用超过1,000项功能测试,并使用5,000项合成压力测试来检测静默错误缺陷。这些测试并非平均覆盖所有缺陷;约50%的有缺陷部件可以仅通过5%的测试发现,而要发现90%的错误,则需要超过这1,000项测试的一半。结果还显示,超过70%的缺陷只能通过一项测试发现,而且某一代产品有效的测试配方无法直接移植到下一代产品。
服务器群在实践中发生了哪些变化?
应对措施并不止于工厂关口。数据中心运营商使用多层软件检查和现场测试,以隔离表现异常的服务器或核心。在Meta,Fleetscanner程序会将服务器下线,并使其运行具有已知结果的计算测试;Ripple程序则在正常运行期间执行短测试模式。Hardware Sentinel会在不分配测试负载的情况下分析应用异常和系统行为。Meta表示,与基于测试的方法相比,在不同架构、应用和数据中心中,该方案将检测能力提高了40%。
Google采用了一系列保护措施,包括端到端验证测试集合、重复计算并进行比较、常量检查和断言、数据传输过程中的数据验证,以及对存储数据的定期验证。应用级测量(例如Spanner方法)也可以发现数据损坏,并将疑似设备从服务器群中移除;设备返回时,还会调整检查方法,以便在问题恶化之前确定容易出现问题的核心。
从出货测试转向硅生命周期管理
这些趋势推动了对时序、电压、温度和退化裕量的持续监控,并利用时间序列分析和机器学习在偏差转化为静默错误之前发现它们。参数测量和机器学习模型可能有助于隔离偏离预期特征的设备,而采用多样化指令测试、重复执行以及核心之间的比较,也能够提高发现概率。
但这种方法并不能消除限制。没有一种方法可以捕捉所有错误机制,测试结果也不会自动从一种设计迁移到另一种设计;当影响出现在远离物理缺陷的应用中时,根本原因诊断仍然困难。分析还指出,由于商业和法律方面的考量,制造商、测试工具供应商、数据中心运营商和高校之间的故障数据共享仍然有限。因此,真正的变化并不是增加某一项单独测试,而是建立一条从制造延伸到运行的可视化链路,同时承认处理器的质量并不能在出货时刻被完全确定。