반도체 및 칩

1킬로와트급 AI 가속기가 신뢰성 검증의 의미를 재정의하다

1킬로와트 수준에서의 동작은 하나의 시험 사례를 의미하지 않는다. 부하, 열의 위치, 작동 시간, 전력 전달 경로에 따라 위험이 달라지기 때문이다. Semiconductor Engineering의 분석에 따르면 검증은 전기적 결함 발견에만 국한되지 않고 칩, 패키지, 테스트 시스템 및 현장 데이터를 포함해야 한다.

2026-09-10
5 분 읽기
8 조회수
فريق تحرير certi.news
1킬로와트급 AI 가속기가 신뢰성 검증의 의미를 재정의하다

1킬로와트에 근접하는 전력을 사용하는 AI 가속기는 반도체 엔지니어들에게 테스트 커버리지의 개념을 재검토하도록 만들고 있다. 동일한 전력 수치에 도달했다고 해서 칩이 실제로 맞닥뜨릴 조건에서 테스트되었다는 뜻은 아니다. 서로 다른 두 부하는 동일한 전력을 소비하면서도 서로 다른 연산 블록, 메모리 인터페이스 및 전력 분배 경로를 활성화하고, 패키지 내부에 서로 다른 핫스폿을 만들 수 있다.

2026년 9월 10일 Semiconductor Engineering이 발표한 분석에 따르면, 이러한 수준에서의 검증은 테스트 대상 장치(DUT)에만 국한되지 않고 패키지, 냉각 시스템, 부하 보드, 소켓과 접점, 자동화 테스트 장비까지 포함한다. 이 기사는 Nordson Test & Inspection의 Christopher Rand의 말을 인용해, 이러한 시스템의 도구들이 단순히 칩을 측정하는 중립적 수단이 아니라 적격성 평가와 검증이 필요한 시스템의 일부가 되었다고 전했다.

총 전력은 위험이 어디에 있는지 보여주지 않는다

칩 테스트는 오랫동안 결함 커버리지와 구조적 결함을 드러내고 장치를 작동 한계까지 밀어붙이는 테스트 패턴에 의존해 왔다. 그러나 Advantest의 Brent Bullock은 AI 가속기 검증에는 결함 커버리지와 열 커버리지를 연계하는 작업이 필요하다고 본다. 특정 패턴은 필요한 로직을 테스트할 수 있지만, 실제 기능 부하에서 칩이 노출되는 것과 동일한 위치에 열을 발생시키지 않을 수 있으며, 전기적·열적 영향이 나타날 만큼 충분히 오래 칩을 작동시키지 못할 수도 있다.

모든 유닛을 반드시 최대 강도로 작동시키는 것만으로는 충분하지 않다. 전력을 고려하더라도 scan 테스트는 기능적 동작을 대표하지 않는 동시 스위칭을 만들어낼 수 있다. 반면 mission-mode와 built-in self-test는 사용 조건에 더 가까이 접근할 수 있지만, 엔지니어가 점검하려는 상태를 재현하는 부하가 필요하다.

문제는 1,000와트라는 수치가 전체 수준의 전력을 설명할 뿐, 그 전력이 다이에 어떻게 분배되는지는 규정하지 않는다는 점이다. 패키지 표면 온도는 허용 가능한 것처럼 보여도, 더 작은 영역이 타이밍이나 장기 신뢰성에 영향을 줄 만큼 뜨거울 수 있다. 따라서 Synopsys의 Lang Lin은 일반적인 표나 최대 한도에만 의존하기보다 실제 설계를 실제 부하로 작동시키고 장치 전반의 온도를 측정해야 한다고 촉구한다.

시간은 커버리지의 일부다

모든 고장 메커니즘이 동일한 시간 척도에서 나타나는 것은 아니다. Bullock은 칩이 수백 마이크로초 안에 열 폭주에 들어갈 수 있으므로 전압 강하나 전류 지표를 빠르게 모니터링하고 큰 손상이 발생하기 전에 테스트를 중단해야 한다고 지적했다. 그러나 다른 문제는 접점의 온도가 상승하고 저항이 증가하며 전류를 전달하는 능력이 저하될 때까지 수 초 동안 지속적인 전류가 필요하다.

Modus Test의 Glenn Cunningham은 접점이 초기 연속성 테스트를 통과한 뒤 실제 전류를 인가하면 실패할 수 있다고 설명했다. 또한 유사한 접점 사이의 저항 차이로 인해 전류가 하나의 경로에 집중될 수 있으며, 이로 인해 온도가 상승하고 접점, 소켓 및 장치를 손상시키는 과도한 전기적 스트레스(EOS)가 발생할 수 있다.

여기에는 실질적인 절충이 따른다. 적격성 평가 또는 번인 테스트는 수년간의 작동을 시뮬레이션할 수 없는 반면, 외주 반도체 조립·테스트(OSAT) 업체는 생산 속도를 유지해야 한다. NLM Photonics의 Brad Booth에 따르면, 시스템이 영원히 작동할 것임을 확인하기 위해 시스템을 무한정 가동할 수는 없다. 따라서 테스트 시간은 목표로 하는 고장 메커니즘에 따라 선택해야 하며, 하나의 기간만으로는 빠른 열 폭주, 접점 가열 및 반복적인 열 사이클로 인한 열화를 동시에 모두 다룰 수 없다는 점을 인정해야 한다.

칩에서 테스트 시스템으로

이러한 전력 수준에서는 결함의 원인이 실리콘이 아니라 테스트 경로에 있을 수 있다. 부하 보드, 소켓, handler 또는 prober, 냉각 시스템 및 자동화 테스트 장비는 모두 작동 중 전기적·열적으로 변한다. Bullock은 역사적으로 해왔던 것처럼 이러한 구성 요소를 분리해서 보는 것만으로는 더 이상 충분하지 않으며, 실제로 장치에 도달하는 상태를 파악하기 위해 ‘전체 스택’을 검사해야 한다고 본다.

패키지 자체도 또 다른 복잡성을 더한다. 열은 전하 운반자의 이동, 트랜지스터 성능 및 타이밍을 변화시킬 수 있으며, 전력·열·응력·타이밍 사이에 상호 연결된 고리를 만든다. 또한 보이드, 층 사이의 초기 박리 및 계면의 균열은 열전도를 약화시키거나 장치가 초기 전기 테스트를 통과한 뒤에도 진행될 수 있다. 패키지의 휨과 같은 현상은 열이 제거되면 사라질 수 있지만, 응력이 초래한 손상은 남아 있을 수 있다.

따라서 로딩 전후에 음향 검사와 X선 검사 같은 기법을 사용하는 비파괴 검사의 역할이 중요해진다. 결함의 위치나 원인에 관한 구체적인 가설이 있을 때는 파괴 분석을 활용할 수 있다.

certi.news의 해석: 검증은 측정에서 연계로 이동한다

실질적인 변화는 테스트에 단순히 더 높은 전류나 더 강한 냉각이 필요하다는 것이 아니라, ‘커버리지’의 의미가 다차원적으로 변했다는 점이다. 전기적 커버리지를 열적·부하·공간적·시간적 커버리지와 연계해야 한다. 또한 타이밍 마진을 저항으로 인한 전압 강하, 온도 및 구성 요소의 열화와 연결해야 하며, 각각의 측정을 서로 분리해 다뤄서는 안 된다.

이 자료는 이러한 관계를 발견하는 일이 실험실의 문에서 끝나지 않는다고 지적한다. 칩, 시스템 및 데이터센터 사이의 일부 상호작용은 적격성 평가 중에 재현하기 어렵고, 현장 작동 이후에야 나타날 수 있다. 따라서 타이밍 마진, 전압 강하, 전압 변동 및 사이클 간 변화를 모니터링하는 것은 장치가 배포된 이후 신뢰성을 이해하는 데 중요한 자료가 된다.

가장 큰 제약은 이러한 관점이 신뢰성을 단번에 판정할 수 있는 하나의 테스트를 제시하지 않는다는 점이다. 더 나은 모델링, 더 빠른 측정 장비, 전력 및 냉각 경로의 특성 분석, 테스트 데이터와 실제 부하 조건의 연계가 필요하다. 여전히 열려 있는 질문은 생산 전에 얼마나 많은 정보를 수집할 수 있는지, 그리고 수천 개의 장치가 서비스에 들어간 뒤에도 무엇을 계속 학습해야 하는지다.

뉴스 출처
Semiconductor Engineering
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기