Geoff Tate 认为,根据制造商划分,GPU 仍约占全球已部署人工智能计算能力的 70%,定制芯片则占 30%,其中主要由 Google 和 Amazon 主导。但这一优势已不再稳固,因为云计算公司和先进模型开发商开始设计自己的硬件,以降低特定工作负载的运行成本并改善能耗。
作者引用的 Epoch.ai 数据显示,全球已部署的人工智能计算能力在三年内增长了 17 倍。2023 年,Nvidia 的份额为 90%,Google 为 10%;而在过去三年中,定制计算占增长的 20%。Tate 指出,这些数据不包括 Meta、Microsoft 和 Cerebras;在这一衡量标准下,他认为这些公司的能力相对较小。
Nvidia 的优势不止于处理器
在作者看来,Nvidia 的实力并不依赖单个 GPU,而是依赖一个完整生态系统,包括互连与扩展单元、机架、中央处理器和网络处理器。该公司提供 NVL72 系统、面向人工智能代理工作负载的 Vera 处理器、BlueField 单元、Spectrum-6 网络,以及用于低延迟推理的 Groq 3 LPX 选项。
Nvidia 表示,与传统处理器相比,Vera 处理器在代理工作负载中的性能高出 1.8 倍;同时,公司展示的 Vera Rubin 系统称,在 DeepSeek-v4-PRO 测试中,根据交互性水平,其性能较 GB300 提升 2 倍至 30 倍。文章还提到,Vera Rubin 系统已开始在 CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud 和 Nebius 的机架中运行。
Nvidia 预计其下一财年的增长率将达到 70%,并指出需求受到供应限制。根据财报电话会议内容,其供应保障承诺也从 1190 亿美元增至 2790 亿美元。Tate 认为,从 TSMC 获得制造产能份额以及提供 HBM 内存,仍将是竞争中的关键因素。
定制芯片正逼近竞争核心
内部设计芯片能让云计算公司和模型开发商直接了解自身工作负载,区分训练与推理需求,并掌握基础设施中的瓶颈。随着计算规模扩大,设计两种专用芯片——一种用于训练,另一种用于推理——在经济上变得更可行,尤其是在能够将每瓦吞吐量提高 10% 至 30%,并将硅片面积相应减少的情况下。
文章重点介绍了 OpenAI 的 Jalapeño 芯片。这是一款由该公司为自身工作负载设计的推理加速器,支持 prefill 和 decode 两个阶段,并保持 KV Cache 内存本地化。该系统使用 Broadcom Tomahawk 6 交换机,构建包含 128 个芯片的域,以及包含 2048 个芯片的全球域。根据 OpenAI 的初步测试,在 GPT-OSS、DeepSeek R1 和 Kimi K2.5 工作负载中,Jalapeño 的表现优于 Nvidia GB300;但测试采用的是单令牌预测,尚未包含多令牌预测,而公司预计多令牌预测将使性能提升三至五倍。
Tate 将 Jalapeño 与 Vera Rubin 的比较描述为粗略估算,依据是对已公布性能曲线的推算,而不是完整的直接测试。因此,他认为这些结果很有希望,但仍需在生产部署以及更广泛的规模和工作负载上进行验证。此外,Jalapeño 专用于推理,并不能满足训练需求;训练需求可能占 OpenAI 计算需求的三分之一或更多。
Google、Meta 和 AMD 扩大替代方案
Google 在第八代 TPU 中同步推出两个版本:用于训练的 TPU 8t 和用于推理的 TPU 8i。文章指出,由于需要额外的 HBM 内存,TPU 8i 的尺寸约为 8t 的 1.4 倍;两者的互连拓扑也有所不同,以适应训练和推理需求的差异。Google 表示,新一代产品的性能约为前几代的两倍;Morgan Stanley 则估计,TPU 销售额将在 2026 年下半年达到约 90 亿美元,2027 年达到 840 亿美元,2028 年达到 1080 亿美元。
至于 Meta,该公司正在开发 MTIA 系列,应用于推荐系统工作负载,随后扩展到训练和生成式人工智能;Cerebras 则推出 CS-4 芯片,称其每用户令牌速度较 CS-3 提高一倍,且每瓦吞吐量最高可达后者的十倍。AMD 还展示了 MI455x 单元和 Helios 系统。根据文章,AMD 在全球已部署计算能力中的份额已从零升至 6%;不过,在所提及的演示中,并未公布针对特定人工智能测试的性能图表。
这对 GPU 制造商意味着什么?
certi.news 的解读是:这些数据并不意味着 GPU 即将终结,而是表明竞争正从通用芯片性能转向完整系统的效率、电力与内存的可用性、制造能力,以及硬件服务特定工作负载的能力。对于运行多种模型和工作负载的客户而言,GPU 的灵活性仍将是一项重要优势;而当公司的工作负载足够明确且稳定、足以证明专门设计的合理性时,定制芯片则能够取得领先。
Tate 建议 Nvidia 开发用于训练和推理的独立芯片,而不是依赖单一的通用设计;同时,他建议 Nvidia 和 AMD 在铜互连逐渐接近实际极限之际,采用 optical circuit switching 和 co-packaged optics 等光互连技术。但他说明,其中一些建议属于分析性观点;此外,他还是两家从事光互连技术公司的董事会成员,因此应将这些内容视为本文作者的建议,而不是独立事实。
作者给出的结论是,Nvidia 拥有巨大的防御性壁垒,但它正面临拥有雄厚资源、并有直接动力让自身模型运行在自有硬件上的客户。如果 Jalapeño 在生产部署中证明其性能与 Vera Rubin 相当或更好,那么这将有力表明 GPU 的主导地位已面临实际竞争,而不只是理论上的可能性。