人工智能数据中心的电力问题不仅在于消耗了多少电力,还在于有多少电力容量需要付费并预留用于应对故障,随后却处于未使用状态。Semiconductor Engineering于2026年9月15日发布的一项分析展示了一个基本矛盾:降低芯片和服务器的能耗可以提高效率,但可能扩大可用容量与实际使用容量之间的差距;与此同时,备用供电架构要求运营商将相当大一部分容量置于正常使用范围之外。
随着人工智能负载扩大,这一问题变得更加重要,因为获取新的电力容量可能需要输电线路、许可,以及现场新增发电设施。据Utilidata技术总监Marisa Homon介绍,在已有可用容量的基础上增加设备,可能比建设新的数据中心或等待供电增加更容易。
为什么容量会处于闲置状态?
数据中心通常被设计为能够承受一个供电源丢失而不中断服务。在“3+1”配置中,设施需要三个满容量供电源,并增加第四个备用供电源,使四个供电源以约75%的容量运行;当其中一个发生故障时,剩余三个供电源可以覆盖负载。而在2N架构中,采用双路供电,并将每条线路的负载维持在约50%,以防另一条线路丢失。
Homon解释说,一个按2吉瓦设计的站点,在采用2N时,实际可能被视为一个容量为1吉瓦的站点;而在这1吉瓦容量中,通常只有约70%至80%会被使用。因此,从整个站点来看,实际到达计算基础设施的容量可能只有名义2吉瓦容量的约三分之一。这并非设备故障造成的浪费,而是可靠性要求和运行余量的直接结果。
仅降低芯片功耗无法单独解决问题
能源优化始于电路设计以及对芯片中集成的知识产权进行管理。Cadence的Arif Khan指出,关闭未使用的接口和通道、采用多种待机状态,并根据当前工作调整时钟频率和电压十分重要。低功耗AMBA接口(例如Q通道和P通道)提供了控制时钟关闭、电源域和多种状态管理的机制。
芯片内部的互连网络也发挥着关键作用,因为SignatureIP为片上网络节点采用了可关闭的时钟和独立的电源状态。然而,降低功耗需要在节能幅度与恢复运行所需时间之间进行权衡。芯片的行为也并不完全相同:电压通常根据最差负载、温度和随时间推移的老化条件确定,尽管这些条件未必总会同时出现。
据proteanTecs的Noam Broussard介绍,电路内监控可以测量实际安全裕量,并在不需要最大裕量时降低电压,然后在负载或环境条件发生变化时提高电压。但仍需要快速保护机制,因为过度降压可能在负载突然变化或发生动态电压下降时威胁电路时序。保护机制可以通过降低时钟频率或暂时限制性能来实现,直到电压恢复到安全水平。
数据中心的实际变化是什么?
更广泛的理念是在正常运行期间使用备用容量,并在供电源丢失之前或发生丢失时降低负载。Utilidata提出了两层控制环:第一层速度较慢,与负载调度相连接,为每个机柜、机架或机房提供可用容量预测,使调度器能够根据容量变化分配图形处理器任务。第二层速度更快,利用DVFS等接口和服务器管理,在毫秒级时间范围内控制功率。
该技术不会直接负责调度或取消工作,而是通过功率数据影响调度器。它利用NVIDIA管理库和基板管理控制器BMC访问功耗行为及测量数据,并在机架级别进行直接测量,而不是汇总各台服务器的单独估算值。据Homon介绍,这种方法可能允许“3+1”配置中的四条线路在正常条件下以其95%至98%的容量运行,并在需要时以有序方式降低负载。
限制与开放问题
利用备用容量并不意味着增加服务器会变得免费或不受限制。额外设备需要空间、冷却和连接;此外,迁移人工智能负载可能需要排空正在处理的请求,并将模型权重加载到另一份副本中,这些操作可能需要数秒。另一方面,仅降低芯片电压不足以应对供电源故障;监控和响应必须覆盖机架和设施层级。
这种架构还增加了一个敏感的安全攻击面。每台服务器都配备BMC,而图形处理器主机还会向拥有足够权限的操作提供用于设定功率上限的接口。因此,Utilidata表示,其系统采用安全启动、硬件信任根、经过签名的固件以及接口上的双向认证,并在本地运行控制环,而不依赖互联网。从编辑角度看,这一发展的重要性在于将备用电力从固定余量转变为可管理资源;但其成功取决于运营商能否确保快速响应、不损害负载,并保护那些可能同时影响数千台服务器的控制工具。