华为在 HUAWEI CONNECT 2026 活动期间介绍了其发展基础设施的构想,以应对人工智能模型以及推理和训练负载的快速扩展。在公司副董事长兼轮值董事长 David Wang 发表的主题演讲中,华为重点强调提升计算与连接能力,并将其视为扩大人工智能应用的基础。
公司的愿景建立在 SuperPoD 和 SuperCluster 技术之上,旨在将大量计算节点连接到统一的高速环境中。华为表示,这种方式能够更高效地处理大规模工作负载,同时为客户提供本地部署和云端计算选项。
为什么对专用基础设施的需求不断增加?
华为将这一趋势与模型规模以及人工智能代理能力的增长联系起来。根据公司展示的数据,大型模型的参数量已接近 10 万亿,预计到 2030 年将超过 100 万亿。智能手机模型的规模也从 2024 年的 30 亿参数增长至目前的 300 亿参数,同时包含 1000 亿参数的模型也已渐行渐近。
在推理方面,中国的日均规模已达到约 500 万亿个 token,华为预计到 2030 年将达到千 trillion 级别。这一增长给系统性能和可靠性带来了更大压力,尤其是在包含数万个神经处理单元的环境中。
模拟结果及其实际意义
华为表示,传统基础设施组件之间的通信可能占模型训练总时间的 40% 以上,从而限制计算能力的利用效率。在该公司旗下 Markov Lab 进行的一项模拟中,一个包含 10 万个 NPU 的集群由多个 SuperPoD 构成,每个 SuperPoD 包含 4000 个 NPU;与由每台服务器包含 8 个 NPU 的同等集群相比,该集群的计算能力利用效率最高提升了 2.75 倍。
这一结果说明,在训练大规模模型时,减少单元之间的通信时间具有重要意义,但它仍然是模拟结果,并非针对实际运行环境发布的独立测量数据。因此,仅凭该材料无法说明产生这一差异的工作负载、软件或测试条件的具体细节。
Atlas 的部署与生态支持
华为表示,截至目前已部署超过 1000 台 Atlas 900 A3 SuperPoD,而 Atlas 950 SuperPoD 正在实现广泛的商业部署。华为还指出,公司支持在其系统上训练基础模型,并在开放计算生态中运行广泛的模型和应用。
公司的战略涵盖有限、中等和大规模计算能力,同时扩大人工智能在设备和车辆中的应用,并同步发展下一代通信网络。这表明,华为并非仅将 SuperPoD 作为独立产品推出,而是将其视为连接计算、网络、云和设备的更广泛构想的一部分。