사일런트 데이터 오류 또는 사일런트 데이터 손상(Silent Data Errors/Silent Data Corruption)은 칩이 기존 제조 테스트를 통과하는 것과 작동 기간 내내 올바른 결과를 생성하는 능력 사이의 격차가 커지고 있음을 보여준다. 프로세서는 ATPG 테스트, 전이 결함 및 고착 결함 테스트, 속도 기반 구조 테스트를 통과한 뒤에도 명확한 고장 기록 없이 계산을 잘못 수행할 수 있으며, 그 결과 손상된 값이 애플리케이션이나 인공지능 학습 작업으로 전달될 수 있다.
이 분석은 Semiconductor Engineering이 2026년 9월 10일에 발표한 내용에 기반하며, Advantest, Siemens EDA, NXP, Synopsys, Intel, Meta, Google, proteanTecs의 의견과 결과를 종합한다. 이는 특정 제품의 출시와 관련된 내용이 아니라, 프로세서 품질을 정의하고 테스트 커버리지를 검증하며 데이터센터에 도달한 이후 관리하는 방식의 변화에 관한 것이다.
칩 수준에서는 드물지만 팜 수준에서는 광범위한 문제
사일런트 데이터 오류는 개별 장치에서 측정하면 드물어 보이지만, 수백만 개의 프로세서가 높은 사용률로 작동하면 반복적이고 비용이 큰 문제가 된다. Google과 Meta의 초기 분석에 따르면 이러한 오류는 서버 1,000대당 한 대에 영향을 줄 수 있으며, 이는 100~1,000ppm(백만 개당 결함 부품) 수준에 해당한다. 10 FIT, 즉 10억 작동 시간당 고장 1건의 비율조차도 1,000만 대의 장치를 배포하면 약 4일마다 한 번씩 오류가 발생한다는 의미가 될 수 있다.
위험한 점은 오류가 잘못된 수치 결과나 정의되지 않은 값의 형태로 나타난 뒤 데이터베이스 손상, 인공지능 모델의 예기치 않은 동작 또는 서로 모순되는 분석 결과를 일으킬 수 있다는 것이다. 프로세서 자체가 오류 신호를 보내지 않을 수 있기 때문에, 장시간 작업이 끝난 뒤 비논리적인 결과가 나타나야 결함이 발견될 수도 있다.
기존 테스트는 왜 실패하는가?
사일런트 오류는 저항이 높은 금속 연결부, 약한 브리징 결함, 타이밍 및 전압 변화와 같은 주변부 결함뿐 아니라 노화, 방사선, 온도 및 부하 조건의 영향과도 관련이 있다. 첨단 제조 노드에서는 마진이 줄어들고 연결부가 더 작아지며 저항이 커지기 때문에 이러한 오류의 가능성이 높아진다. 또한 칩렛 기반 패키지는 검증 경로의 복잡성을 높인다.
업계는 손상된 실행 오류의 약 80%가 제로타임 테스트를 빠져나가는 결함과 관련되어 있고, 나머지 20%는 간헐적으로 나타나거나 노화의 결과로 발생한다고 추정한다. 그러나 가능한 전압, 주파수, 온도, 수명, 부하 유형 조합을 모두 테스트하는 것은 현실적이지 않다. 또한 시스템 수준에서 나타난 고장을 칩 테스트의 특정 결함 패턴과 연결하는 데는 수주가 걸릴 수 있으며, 설계, 테스트, 고장 분석, 시스템 통합 팀의 협력이 필요하다.
Siemens EDA는 지연 결함을 테스트할 때 단일 입력 전환에 의존하면 실제 기능적 작동을 제대로 모사하지 못할 수 있다고 지적한다. 여러 입력을 전환하면 더 큰 지연이 발생할 수 있기 때문이다. 따라서 테스트는 모든 사용 조건을 포괄하지 못하는 구조적 결함 모델에만 의존하기보다 전압, 온도, 주파수의 여러 조합을 대상으로 해야 한다.
공장에서 데이터센터까지 더 심층적인 테스트
이 문제는 테스트 커버리지의 개념을 재정의하고 있다. 테스트가 탐지할 수 있는 알려진 제조 결함의 비율을 계산하는 대신, 실제 작동과 실제 부하에서 잘못된 계산 결과를 발견할 가능성도 커버리지에 포함된다. 이에 따라 기업들은 시스템 수준의 기능 테스트, 부하 인식 테스트, 작업 모드 테스트와 함께 내장 테스트 설계를 개선하고 칩 내부의 마진을 모니터링하고 있다.
Intel의 경험은 과제의 규모를 보여준다. Intel Xeon 프로세서 5세대에 걸쳐 120만 개의 프로세서를 테스트한 뒤, 회사는 DCDiag 제품군에서 1,000개 이상의 기능 테스트와 사일런트 오류 결함을 탐지하기 위한 5,000개의 합성 스트레스 테스트를 필요로 했다. 테스트가 결함에 균등하게 배분된 것도 아니었다. 테스트의 단 5%만으로 결함 부품의 약 50%를 탐지할 수 있었지만, 오류의 90%를 발견하려면 1,000개 테스트의 절반 이상이 필요했다. 또한 결과는 결함의 70% 이상이 단 하나의 테스트에서만 발견되었으며, 한 제품 세대에서 효과적이었던 테스트 레시피를 다음 세대에 그대로 이전할 수 없다는 점을 보여주었다.
팜에서 실제로 무엇이 달라지는가?
대응은 공장 출하 단계에서 끝나지 않는다. 데이터센터 운영 기업들은 비정상적인 동작을 보이는 서버나 코어를 격리하기 위해 소프트웨어 검사와 현장 테스트를 여러 계층으로 사용한다. Meta에서는 Fleetscanner 프로그램이 서버를 서비스에서 제외하고 알려진 결과를 내는 계산 테스트를 실행하며, Ripple 프로그램은 정상 작동 중 짧은 패턴을 실행한다. Hardware Sentinel은 테스트 부하를 할당하지 않고 애플리케이션 예외와 시스템 동작을 분석한다. Meta는 서로 다른 아키텍처, 애플리케이션, 데이터센터에서 기존 테스트 기반 방식과 비교했을 때 이 방법이 탐지율을 40% 향상시켰다고 밝혔다.
Google은 종단 간 테스트 집합 검증, 중복 계산 및 결과 비교, 불변식 검사와 어설션, 데이터 전송 중 검증, 저장 데이터의 주기적 검증 등 다양한 보호 수단을 사용한다. Spanner 방식과 같은 애플리케이션 측정은 손상을 발견하고 의심 장치를 팜에서 제거할 수 있으며, 장치가 복귀할 때 검사 방식을 조정해 문제가 악화되기 전에 문제에 취약한 코어를 식별할 수도 있다.
출하 테스트에서 실리콘 수명주기 관리로
이러한 추세는 타이밍, 전압, 온도 마진과 열화를 지속적으로 모니터링하고, 시계열 분석과 머신러닝을 사용해 편차가 사일런트 오류로 전환되기 전에 발견하도록 유도한다. 파라메트릭 측정과 머신러닝 모델은 예상 프로파일에서 벗어나는 장치를 격리하는 데 도움이 될 수 있으며, 명령어와 실행을 다양화한 테스트, 중복 실행, 코어 간 비교는 탐지 가능성을 높일 수 있다.
그러나 이러한 접근 방식에도 한계가 있다. 모든 오류 메커니즘을 포착하는 단일 방법은 없으며, 테스트 결과가 설계에서 다른 설계로 자동으로 이전되지도 않는다. 또한 물리적 결함과 멀리 떨어진 애플리케이션에서 영향이 나타날 경우 근본 원인 진단은 여전히 어렵다. 분석은 제조업체, 테스트 도구 제공업체, 데이터센터 운영자, 대학 간 고장 데이터 공유도 상업적·법적 고려 때문에 여전히 제한적이라고 지적한다. 따라서 실질적인 변화는 단일 테스트를 추가하는 것이 아니라 제조에서 운영까지 이어지는 가시성의 사슬을 구축하는 데 있다. 프로세서의 품질이 출하되는 순간 완전히 결정되는 것은 아니라는 점을 인정해야 한다.