Geoff Tate는 제조업체별 기준으로 GPU가 여전히 전 세계 설치된 AI 컴퓨팅 성능의 약 70%를 차지하며, 맞춤형 칩은 30%를 차지한다고 본다. 맞춤형 칩 시장은 주로 Google과 Amazon이 지배하고 있다. 그러나 클라우드 기업과 첨단 모델 개발사들이 특정 워크로드의 운영 비용을 줄이고 전력 소비를 개선하기 위해 자체 하드웨어를 설계하기 시작하면서 이러한 우위는 더 이상 보장되지 않는다.
저자가 근거로 삼은 Epoch.ai 데이터에 따르면, 전 세계 설치된 AI 컴퓨팅 성능은 3년 동안 17배 증가했다. 2023년 Nvidia의 점유율은 90%, Google은 10%였으며, 최근 3년 동안의 증가분 가운데 맞춤형 컴퓨팅이 20%를 차지했다. Tate는 이 데이터에 Meta, Microsoft, Cerebras가 포함되지 않았으며, 이 측정 기준에서 이들의 역량은 상대적으로 작다고 설명한다.
Nvidia의 강점은 처리 장치를 넘어선다
저자의 견해에 따르면 Nvidia의 강점은 단일 GPU에 의존하는 것이 아니라 연결 및 확장 장치, 랙, 중앙처리장치, 네트워크 프로세서를 포함하는 통합 생태계에 있다. Nvidia는 NVL72 생태계, AI 에이전트 워크로드를 겨냥한 Vera 프로세서, BlueField 장치, Spectrum-6 네트워크를 제공하며, 낮은 지연 시간의 추론을 위한 Groq 3 LPX 옵션도 제공한다.
Nvidia는 Vera 프로세서가 기존 프로세서보다 에이전트 워크로드에서 1.8배 높은 성능을 제공한다고 말한다. 또한 회사는 상호작용성 수준에 따라 Vera Rubin 시스템이 DeepSeek-v4-PRO 테스트에서 GB300 대비 2배에서 30배에 이르는 개선을 달성한다고 제시한다. 기사에 따르면 Vera Rubin 시스템은 CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud, Nebius의 랙에서 가동되기 시작했다.
Nvidia는 다음 회계연도에 70%의 성장을 예상하며, 수요가 공급에 의해 제한되고 있다고 언급한다. 실적 발표에서 언급된 공급 확보 약정도 1,190억 달러에서 2,790억 달러로 증가했다. Tate는 TSMC의 제조 물량을 확보하고 HBM 메모리를 공급하는 일이 경쟁에서 계속 결정적인 요소로 남을 것이라고 본다.
맞춤형 칩이 경쟁의 중심에 다가가다
칩을 내부적으로 설계하면 클라우드 기업과 모델 개발사는 자사의 워크로드, 학습과 추론의 구분, 인프라 병목 지점을 직접 파악할 수 있다. 컴퓨팅 규모가 확대되면서 학습용과 추론용으로 각각 특화된 두 개의 칩을 설계하는 방식은 경제성이 더욱 높아졌다. 특히 와트당 처리량을 10%에서 30% 개선하고 실리콘 면적을 비슷한 비율로 줄일 수 있다면 더욱 그렇다.
기사에서 OpenAI는 Jalapeño 칩을 통해 부각된다. Jalapeño는 OpenAI가 자사 워크로드를 위해 설계한 추론 가속기로, prefill과 decode 단계를 지원하고 KV Cache를 로컬에 유지한다. 이 시스템은 Broadcom Tomahawk 6 스위치를 사용해 128개 칩으로 구성된 패브릭과 최대 2048개 칩에 이르는 글로벌 패브릭을 구축한다. OpenAI의 초기 테스트에 따르면 Jalapeño는 GPT-OSS, DeepSeek R1, Kimi K2.5 워크로드에서 Nvidia GB300보다 우수한 성능을 보였다. 그러나 이 테스트는 단일 토큰 예측을 기반으로 했으며, 회사가 성능을 3배에서 5배 높일 것으로 예상하는 다중 토큰 예측은 아직 포함하지 않았다.
Tate는 Jalapeño와 Vera Rubin의 비교가 직접적이고 완전한 테스트가 아니라 공개된 성능 곡선을 외삽한 근사치라고 설명한다. 따라서 그는 결과가 유망하지만, 실제 배포와 더 광범위한 규모 및 워크로드에서 검증이 필요하다고 본다. 또한 Jalapeño는 추론 전용이며, OpenAI의 컴퓨팅 수요 가운데 3분의 1 이상을 차지할 수 있는 학습 요구를 처리하지 않는다.
Google·Meta·AMD가 대안을 확대하다
Google은 8세대 TPU에서 TPU 8t를 학습용으로, TPU 8i를 추론용으로 동시에 출시한다. 기사에 따르면 TPU 8i는 추가 HBM 메모리가 필요하기 때문에 8t보다 약 1.4배 크다. 또한 학습과 추론의 요구 사항이 다르기 때문에 두 버전의 연결 토폴로지도 서로 다르다. Google은 새 세대가 이전 세대 대비 약 2배의 성능을 제공한다고 말한다. Morgan Stanley는 TPU 매출을 2026년 하반기 약 90억 달러, 2027년 840억 달러, 2028년 1,080억 달러로 추정했다.
한편 Meta는 추천 시스템 워크로드를 시작으로 학습과 생성형 AI를 위한 MTIA 시리즈를 개발하고 있다. Cerebras는 CS-3 대비 사용자당 초당 토큰 속도를 2배로 높이고 와트당 처리량을 최대 10배 달성한다고 밝힌 CS-4 칩을 공개했다. AMD는 MI455x 장치와 Helios 시스템을 선보였으며, 기사에 따르면 전 세계 설치된 컴퓨팅 성능에서 AMD의 점유율은 0%에서 6%로 증가했다. 다만 해당 발표에는 특정 AI 테스트에 대한 성능 차트가 없었다.
이것이 GPU 제조업체에 의미하는 것은 무엇인가?
certi.news의 해석: 이 데이터는 GPU의 임박한 종말을 가리키는 것이 아니라, 경쟁의 초점이 범용 칩의 성능에서 전체 시스템의 효율성, 전력·메모리·제조 능력의 가용성, 특정 워크로드를 처리하는 하드웨어의 능력으로 이동하고 있음을 보여준다. 다양한 모델과 워크로드를 운영하는 고객에게 GPU의 유연성은 여전히 중요한 장점이다. 반면 맞춤형 칩은 기업의 워크로드가 자체 설계를 정당화할 만큼 충분히 알려져 있고 안정적일 때 우위를 확보할 수 있다.
Tate는 Nvidia가 하나의 범용 설계에 의존하기보다 학습과 추론을 위한 별도의 칩 개발을 검토해야 하며, 구리 연결이 실용적 한계에 가까워짐에 따라 Nvidia와 AMD가 optical circuit switching 및 co-packaged optics 같은 광 연결 기술을 채택해야 한다고 제안한다. 그러나 그는 이러한 제안 가운데 일부가 분석적 견해이며, 자신이 광 연결 기술을 개발하는 두 회사의 이사회 구성원이라는 점을 밝힌다. 따라서 이는 독립적인 사실이 아니라 글쓴이의 권고로 받아들여야 한다.
저자가 제시하는 결론은 Nvidia가 상당한 방어 장벽을 보유하고 있지만, 막대한 자원과 자체 하드웨어에서 자사 모델을 실행하려는 직접적인 동기를 가진 고객들과 맞서고 있다는 것이다. Jalapeño가 실제 배포에서 Vera Rubin과 비슷하거나 더 나은 성능을 입증한다면, 이는 GPU의 지배력이 단순한 이론적 가능성이 아니라 실제 경쟁에 직면했다는 강력한 신호가 될 것이다.