화웨이는 HUAWEI CONNECT 2026 행사에서 인공지능 모델과 추론 및 학습 작업의 빠른 확장에 대응할 수 있는 인프라 개발 구상을 제시했다. 화웨이의 이사회 부회장이자 순환 회장인 데이비드 왕이 진행한 기조연설에서 화웨이는 인공지능 애플리케이션 확장의 기반으로서 컴퓨팅 및 연결 역량 강화에 초점을 맞췄다.
회사의 비전은 SuperPoD와 SuperCluster 기술을 기반으로 하며, 이는 많은 수의 컴퓨팅 노드를 고속의 통합 환경 안에서 연결하는 것을 목표로 한다. 화웨이는 이러한 접근 방식이 대규모 작업 부하를 더욱 효율적으로 처리하는 동시에 고객 구내와 클라우드를 통한 컴퓨팅 옵션을 제공한다고 설명했다.
전문 인프라의 필요성이 커지는 이유
화웨이는 모델 규모와 인공지능 에이전트 역량의 증가를 자사의 방향성과 연결했다. 회사가 제시한 수치에 따르면 대규모 모델의 매개변수 수는 10조 개에 가까워지고 있으며, 2030년에는 100조 개를 넘어설 것으로 예상된다. 또한 스마트폰 모델의 규모는 2024년 30억 개 매개변수에서 현재 300억 개로 증가했으며, 1000억 개 매개변수를 포함하는 모델도 등장할 시점에 가까워지고 있다.
추론 측면에서 중국의 일일 규모는 약 500조 토큰에 이르렀으며, 화웨이는 2030년까지 이를 1천조 수준으로 예상한다. 이러한 증가는 시스템의 성능과 신뢰성에 더 큰 부담을 주며, 특히 수만 개의 신경망처리장치를 결합하는 환경에서 두드러진다.
시뮬레이션 결과와 실제 의미
화웨이는 기존 인프라 구성 요소 간 통신 작업이 모델 전체 학습 시간의 40% 이상을 소모할 수 있어 컴퓨팅 역량 활용 효율을 제한한다고 설명했다. 화웨이 산하 Markov Lab이 수행한 시뮬레이션에서 각각 4000개의 NPU를 포함하는 SuperPoD를 사용해 구축한 10만 개 NPU 그룹은, 각각 8개의 NPU를 포함하는 서버에 기반한 유사한 그룹과 비교해 컴퓨팅 역량 활용 효율이 최대 2.75배 향상됐다.
이 결과는 대규모 모델 학습 시 장치 간 통신 시간을 줄이는 것이 중요한 이유를 설명하지만, 실제 운영 환경에 대해 독립적으로 공개된 측정 결과가 아니라 시뮬레이션 결과에 해당한다. 따라서 해당 자료만으로는 발표된 차이를 만들어낸 작업 부하, 소프트웨어 또는 테스트 조건의 세부 사항을 확인할 수 없다.
Atlas 확산과 생태계 지원
화웨이는 현재까지 Atlas 900 A3 SuperPoD 1000대 이상을 배포했으며, Atlas 950 SuperPoD도 광범위한 상업적 보급을 보이고 있다고 밝혔다. 또한 자사 시스템에서 기반 모델 학습을 지원하는 한편, 개방형 컴퓨팅 생태계 안에서 폭넓은 모델과 애플리케이션을 운영하고 있다고 설명했다.
회사의 전략은 제한적·중간 규모·대규모 컴퓨팅 역량을 아우르며, 차세대 통신 네트워크 개발과 병행해 기기와 차량에서의 인공지능 활용을 확대하는 것을 포함한다. 이는 화웨이가 SuperPoD를 단독 제품으로만 제시하는 것이 아니라 처리, 네트워크, 클라우드 및 장치를 연결하는 더욱 광범위한 구상의 일부로 제시하고 있음을 보여준다.