클라우드 컴퓨팅 및 데이터 센터

인공지능 데이터센터가 직면한 정체 전력 문제, 컴퓨팅 용량으로 전환 가능

인공지능 데이터센터는 예비 전력 공급 시스템과 신뢰성 요구 사항 때문에 가용 전력의 일부를 소비하지 못하고 있어 실제로 사용되지 않는 용량이 남는다. 이 분석은 전압 저감 및 부하 관리 기술을 통해 이 용량을 활용하면서 전원 공급원 중 하나가 고장 날 경우 신속하게 후퇴할 수 있는 방안을 검토한다. 그러나 스케줄링, 보안 및 장애 대응에는 여전히 과제가 남아 있다.

2026-09-15
4 분 읽기
3 조회수
فريق تحرير certi.news
인공지능 데이터센터가 직면한 정체 전력 문제, 컴퓨팅 용량으로 전환 가능

인공지능 데이터센터의 전력 문제는 소비되는 전력량뿐 아니라, 장애에 대응하기 위해 비용을 지불하고 확보해 두었지만 사용되지 않는 전력 용량의 크기에도 있다. Semiconductor Engineering이 2026년 9월 15일 발표한 분석은 기본적인 역설을 제시한다. 칩과 서버의 소비 전력을 줄이면 효율성은 향상되지만, 가용 용량과 실제 사용 용량 사이의 격차가 커질 수 있다. 한편 예비 전력 공급 구조 때문에 운영자는 정상적인 사용에서 상당한 용량을 남겨 두어야 한다.

인공지능 부하가 확대되면서 이 문제의 중요성은 더욱 커지고 있다. 새로운 전력을 확보하려면 송전선, 인허가 및 현장 내 추가 발전이 필요할 수 있기 때문이다. Utilidata의 기술 책임자인 마리사 호몬에 따르면, 이미 가용한 전력에 장비를 추가하는 편이 새로운 데이터센터를 건설하거나 공급 증가를 기다리는 것보다 쉬울 수 있다.

왜 용량이 사용되지 않은 채 남는가?

데이터센터는 일반적으로 전원 공급원 중 하나를 잃더라도 서비스가 중단되지 않도록 설계된다. ‘3+1’ 구성에서는 시설에 최대 용량의 전원 공급원 세 개가 필요하고 네 번째 예비 공급원을 추가한다. 이에 따라 네 공급원은 각각 약 75%의 용량으로 작동하며, 하나가 고장 나면 남은 세 공급원이 부하를 감당할 수 있다. 반면 2N 구조에서는 이중 전원 공급이 이뤄지고, 한쪽 전원을 잃는 상황에 대비해 각 전력선의 부하는 약 50%로 유지된다.

호몬은 2N을 적용하면 2기가와트로 설계된 사이트가 실제로는 1기가와트 용량의 사이트로 취급될 수 있으며, 그 용량 안에서도 일반적으로 약 70%에서 80%만 사용된다고 설명한다. 따라서 전체 사이트를 기준으로 보면 컴퓨팅 인프라에 실제로 도달하는 전력은 정격 용량 2기가와트의 약 3분의 1에 이를 수 있다. 이는 장비 결함으로 인한 낭비가 아니라 신뢰성 요구 사항과 운영 여유분이 직접적으로 초래한 결과다.

칩 소비 전력 저감만으로는 문제를 해결할 수 없다

전력 최적화는 회로 설계와 칩에 통합된 지식재산 관리에서 시작된다. Cadence의 아리프 칸은 사용하지 않는 인터페이스와 채널을 끄고, 여러 대기 상태를 사용하며, 현재 작업에 맞춰 클록 주파수와 전압을 조절하는 것이 중요하다고 지적했다. Q 및 P 채널과 같은 저전력 AMBA 인터페이스는 클록 게이팅, 전력 도메인 및 다중 상태 관리를 제어하는 메커니즘을 제공한다.

칩 내부의 통신 네트워크도 핵심적인 역할을 한다. SignatureIP는 온칩 네트워크 노드에 대해 클록 게이팅과 독립적인 전력 상태를 사용한다. 그러나 전력 저감에는 절약되는 전력량과 작동 복귀 시간 사이의 균형이 필요하다. 또한 칩마다 동작 방식이 동일하지 않다. 전압은 일반적으로 최악의 부하, 온도 및 시간 경과에 따른 열화 조건을 기준으로 정해지지만, 이러한 조건이 항상 동시에 발생하는 것은 아니다.

proteanTecs의 노암 브루사르에 따르면 회로 내 모니터링을 통해 실제 안전 여유를 측정하고 최대 여유가 필요하지 않을 때 전압을 낮춘 다음 부하나 조건이 변하면 전압을 높일 수 있다. 다만 부하가 갑자기 변하거나 동적 전압 강하가 발생할 때 전압을 지나치게 낮추면 회로 타이밍이 위협받을 수 있으므로 신속한 보호 메커니즘이 여전히 필요하다. 보호 기능은 전압이 안전한 수준으로 돌아올 때까지 클록 주파수를 낮추거나 성능을 일시적으로 제한하는 방식으로 작동할 수 있다.

데이터센터에서 실제로 무엇이 달라지는가?

더 큰 구상은 정상 작동 중 예비 전력을 사용하고, 전원 공급원을 잃기 전이나 잃는 순간 부하를 낮추는 것이다. Utilidata는 두 개의 제어 루프를 제안한다. 첫 번째는 더 느리며 부하 스케줄링과 연결된다. 이 루프는 각 랙, 행 또는 홀에서 사용할 수 있는 전력을 예측해 스케줄러가 변하는 용량에 따라 그래픽 처리 장치 작업을 분배하도록 한다. 두 번째는 더 빠르며 DVFS와 서버 관리 같은 인터페이스를 사용해 밀리초 단위의 시간 범위에서 전력을 제어한다.

이 기술이 직접 작업을 스케줄링하거나 취소하는 것은 아니며, 전력 데이터를 통해 스케줄러에 영향을 준다. NVIDIA 관리 라이브러리와 베이스보드 관리 컨트롤러 BMC를 활용해 전력 동작과 측정값에 접근하고, 개별 서버의 추정치를 수집하는 대신 랙 수준에서 직접 측정한다. 호몬에 따르면 이 접근법을 사용하면 3+1 구성에서 네 전력선을 정상 조건에서 약 95%에서 98%의 용량으로 작동시킨 뒤 필요할 때 부하를 체계적으로 줄일 수 있다.

제약과 미해결 질문

예비 전력을 활용한다고 해서 서버를 추가하는 일이 무료이거나 제약이 없어지는 것은 아니다. 추가 장비에는 공간, 냉각 및 통신이 필요하다. 또한 인공지능 부하를 이동하려면 진행 중인 요청을 처리하고 모델 가중치를 다른 복제본에 로드해야 할 수 있으며, 이 과정에는 수초가 걸릴 수 있다. 반대로 전원 공급원 장애를 처리하기에는 칩 전압을 낮추는 것만으로 충분하지 않다. 모니터링과 대응은 랙 및 시설 수준에서 이뤄져야 한다.

이 구조는 민감한 보안 영역도 추가한다. BMC가 탑재된 모든 서버와 마찬가지로, 그래픽 처리 장치 호스트는 충분한 권한을 가진 작업에 대해 전력 한도를 설정하는 인터페이스를 노출한다. 따라서 Utilidata는 자사 시스템이 보안 부팅, 하드웨어 신뢰 루트, 서명된 펌웨어 및 인터페이스 간 상호 인증을 사용하며, 인터넷에 의존하지 않고 제어 루프를 로컬에서 실행한다고 말한다. 편집 관점에서 이 발전의 중요성은 예비 전력을 고정된 여유분에서 관리 가능한 자원으로 전환하는 데 있다. 그러나 성공 여부는 운영자가 신속한 대응을 보장하고, 부하에 피해를 주지 않으며, 한 번에 수천 대의 서버에 영향을 줄 수 있는 제어 도구를 보호할 수 있는 능력에 달려 있다.

뉴스 출처
Semiconductor Engineering
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기