인공지능

마이크로소프트: AI 발전의 기준은 인프라 규모가 아니라 ‘유용한 수익률’이어야 한다

마이크로소프트의 라니 부르카르는 AI 인프라의 성공이 칩이나 처리된 토큰의 수가 아니라, 각 에너지·메모리·투자 단위에서 생성되는 유용한 지능의 양으로 측정되어야 한다고 본다. 그녀는 데이터센터와 칩에서 모델·소프트웨어·에이전트에 이르는 통합 설계를 촉구한다.

2026-09-02
5 분 읽기
7 조회수
فريق تحرير certi.news
마이크로소프트: AI 발전의 기준은 인프라 규모가 아니라 ‘유용한 수익률’이어야 한다

Microsoft에서 클라우드 컴퓨팅 플랫폼의 하드웨어와 인프라를 계획·설계·개발·배포하는 조직들을 이끄는 라니 부르카르는 AI 시대의 발전을 측정하는 색다른 관점을 제시한다. 칩의 수, 데이터센터의 규모, 시스템이 생성할 수 있는 토큰 수에 집중하는 대신, 이용 가능한 자원으로 생산할 수 있는 유용한 산출물의 양을 뜻하는 ‘수익률’(Yield) 개념을 도입하자는 것이다.

부르카르는 반도체 산업에서 이 개념을 차용했다. 반도체 산업에서 수익률은 웨이퍼 하나에서 추출할 수 있는 정상 칩의 수를 의미한다. 그녀의 관점에 따르면 이 원칙은 자본, 에너지, 메모리, 통신, 모델, 소프트웨어를 아우르고, 궁극적으로 일과 일상생활에서 AI가 창출하는 가치까지 포함하도록 확장되어야 한다.

왜 더 이상 인프라 확장만으로는 충분하지 않은가?

이 글은 AI의 확산 속도가 인터넷, 개인용 컴퓨터, 스마트폰에서 일어난 것보다 빠르게 진행되었지만, 전 세계적인 사용은 여전히 노동력의 약 18%에만 영향을 미치며 대부분의 사용이 대화에 집중되어 있다고 지적한다. 시스템이 추론, 계획, 도구 사용, 더 긴 에이전트 워크플로 실행으로 이동하면서 인프라 요구사항은 근본적으로 달라진다.

부르카르는 하나의 에이전트 작업이 일반적인 대화형 상호작용에서 소비되는 토큰 수의 3400배 이상을 사용할 수 있다고 말한다. 이러한 증가는 에너지, 랙 밀도, 패키지 규모, 메모리 용량에 압박을 가한다. 그녀는 더 많은 실리콘과 메모리, 에너지, 광섬유를 추가하는 전통적인 대응은 무한정 지속될 수 없다고 본다. 새로운 개선이 있을 때마다 이전 세대보다 더 많은 입력을 요구할 수 있기 때문이다.

이 관점은 두 가지 경로를 병행할 것을 제안한다. 현재 아키텍처를 점진적으로 개선해 효율성, 활용도, 경제성을 높이는 한편, 시스템과 모델 설계에서 새로운 아키텍처·소재·방법을 통해 성능 곡선을 재구성하는 더 심층적인 전환을 추진하는 것이다. 부르카르는 클록 주파수 증가가 전력 장벽에 부딪힌 뒤 프로세서가 멀티코어 설계로 전환한 사례와 NAND 메모리가 평면 설계에서 수직 설계로 전환한 사례를 언급한다.

모든 계층의 협업으로 만들어지는 수익률

이 글은 병목 현상이 반드시 그것이 나타난 계층에서 해결되는 것은 아니라고 강조한다. 개별 구성요소의 성능 측정만으로는 충분하지 않다. 데이터센터, 실리콘, 모델, 에이전트 작업을 조정하는 도구 사이에서 이익과 손실이 누적되기 때문이다. 따라서 부르카르는 먼저 필요한 산출물을 정의한 다음 한 요소의 성능을 극대화하는 대신 전체 시스템을 다시 최적화하는 ‘공동 설계’를 촉구한다.

메모리와 관련해 Microsoft는 문제가 단순히 구성요소 부족에 있는 것이 아니라 시스템 수준의 과제라고 본다. 추론에는 더 큰 모델과 더 긴 컨텍스트를 수용하고 데이터를 신속하게 제공하는 능력이 필요하다. 반면 에이전트는 수분 또는 수시간에 걸칠 수 있는 루프 안에서 생성, 검색, 도구 사용, 지속적 메모리 작업을 추가한다. Azure Maia 플랫폼의 경험은 KV 캐시 메모리 사용량을 줄이려면 모델 공학, 데이터 과학, 압축뿐 아니라 메모리 계층 관리, 실리콘 최적화, 데이터 이동, 컴파일러를 위한 소프트웨어 관리가 결합되어야 한다는 점을 보여준다.

핵심은 새로운 바이트를 단순히 추가하는 것이 아니라, 이용 가능한 각 바이트에서 더 많은 유용한 지능을 끌어내는 데 있다.

네트워크에서 에너지까지

클러스터 수준에서 지능은 하나의 칩에서 나오는 것이 아니라 하나의 시스템처럼 작동하는 수천 개의 칩에서 나온다. 따라서 산출물은 연결 속도만으로 결정되지 않는다. 혼잡 관리, 장애 복구, 작업 부하 분산, 프로그래밍의 복잡성, 실리콘·시스템·소프트웨어 사이의 경계도 영향을 미친다.

부르카르는 Maia 플랫폼의 설계가 미리 정해진 네트워크 설계에서 출발한 것이 아니라, 달성하려는 결과인 대규모 플릿에서의 효율적인 추론에서 시작되었다고 말한다. 여기에는 2단계 확장 네트워크 구축, 네트워크 카드 기능의 칩 내 통합, 전용 전송 계층 개발이 포함되었다. 이 글에 따르면 이러한 접근은 고밀도 추론 클러스터에서 확장 가능한 성능을 구현하고, 프로그래밍을 단순화하며, 작업 부하의 유연성을 높이고, 필요한 네트워크 하드웨어를 줄였다.

에너지는 이제 시스템이 소비하는 자원에서 전력망부터 칩까지 설계에 처음부터 반영해야 하는 제약으로 바뀌었다. 이 글은 랙 전력이 수십 킬로와트에서 수백 킬로와트로 증가하고 있으며, 데이터센터 단지가 기가와트 규모로 운영되고 있다고 지적한다. 또한 배전 손실을 줄이기 위한 솔리드 스테이트 변압기와 800볼트 직류 배전 같은 해법을 언급한다.

Microsoft는 Arm 기반 서버 프로세서 Azure Cobalt 200을 이러한 공동 설계의 사례로 제시한다. 이 프로세서는 각 코어에서 전압과 주파수를 개별적으로 제어할 수 있으며, 각 가상 머신의 전력 소비를 소프트웨어로 지정할 수 있다. 회사는 정밀한 제어를 통해 핵심 작업 부하의 성능을 보호하면서 전력을 조정할 수 있고, 동일한 전력 한도 안에서 더 많은 서버를 운영할 수 있다고 말한다.

실제로 중요한 것은 무엇인가?

이 주장의 중요성은 논의를 원시 용량 경쟁에서 자원을 결과로 전환하는 효율성으로 옮긴다는 데 있다. 클라우드 및 데이터센터 운영자에게 이는 하드웨어 평가가 네트워크, 소프트웨어, 냉각, 부하 관리와 분리될 수 없다는 뜻이다. 모델과 에이전트 개발자에게는 메모리 효율성, 작업 길이, 도구 통합이 모델 규모만큼이나 확장 가능성에 영향을 미치는 요소가 된다.

그러나 이러한 결론은 Microsoft가 제시한 관점이며, 대규모 AI 인프라 구축 및 운영 경험에 부분적으로 기반한 것이지 모든 환경에 적용되는 독립적으로 입증된 기준은 아니다. 또한 이 글은 Maia 또는 Cobalt 200의 이득을 측정하기 위한 상세한 비교 수치를 제시하지 않으며, 언급된 해법을 Azure 외부의 맥락에 적용하는 데 필요한 비용이나 일정도 명시하지 않는다.

그럼에도 ‘수익률의 필요성’은 업계에 실질적인 질문을 던진다. 에너지, 칩, 데이터센터에 대한 증가하는 투자가 적절한 비용으로 접근할 수 있는 지능과 구체적인 생산성 및 가치로 이어지고 있는가? 부르카르의 관점에서 수익률은 토큰을 생산하는 데서 완성되지 않는다. 그 산출물이 더 빠른 과학적 발견, 조기에 포착되는 의료 신호, 더 나은 학습, 또는 소규모 기업을 위한 새로운 기회로 전환될 때 비로소 완성된다.

뉴스 출처
Microsoft Official Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기