云计算与数据中心

Meta 解释闭环液冷如何支持人工智能基础设施运行

Meta 在其大多数面向人工智能优化的新数据中心中采用闭环液冷,旨在应对不断增加的热量并减少用水量和占地面积。该公司表示,在其一座数据中心进行的一项基于强化学习的试验中,冷却风扇的能源消耗降低了20%,用水量降低了4%。

2026-08-27
1 分钟阅读
8 浏览量
فريق تحرير certi.news
Meta 解释闭环液冷如何支持人工智能基础设施运行

Meta 在2026年8月27日发布的一篇文章中说明,其大多数面向人工智能优化的新数据中心都采用闭环液冷,并利用强化学习优化冷却系统的运行。随着人工智能服务器的温度升高,伴随硬件能力和图形处理单元密度增加,仅依靠空气冷却的效率变得越来越低。

该文章由 Tom Shaw 撰写。Meta 介绍他是 Software Developer and Content Creator,此前他参观了该公司位于德克萨斯州的人工智能基础设施。文章将这一设计与此前在艾奥瓦州 Altoona 一座数据中心进行的试验进行了比较:当时,装有16个 Nvidia H100 单元的机架采用空气冷却并有限用水,但水不会直接输送至硬件。

闭环冷却如何工作?

水与乙二醇的混合液流经硬件,从服务器机架中带走热量,随后进入热交换器,将热量传递出去。液体冷却后会返回机架,形成持续循环,而不是被排放到设施外。Meta 表示,预计这些液体可以使用长达十年而无需更换。

散热方式取决于数据中心的位置及其环境。当液冷设备安装在不具备集成液体基础设施的设施中时,Meta 会采用名为 Air-Assisted Liquid Cooling 的系统,其中包括配有泵和热交换器的机架,以更小型且更加分散的方式执行相同功能。

节水与节省空间

Meta 表示,一座采用闭环液冷和干式冷却器的典型人工智能数据中心,每年的用水量可能低于两家提供全套服务的餐厅的用水量。该公司还认为,这种设计的优势不只是减少资源消耗;按其估算,如果采用空气冷却服务器,将需要接近服务器托盘体积两倍的空间来增加所需的冷却设备。

而通过封闭液体回路直接冷却芯片,可以在同一个机架中放置更多图形处理单元,从而可能减少容纳同等计算能力所需的机架数量。这意味着,在面积固定的设施中,可以提高计算密度,而无需按同等幅度扩大空间。

开放生态与强化学习控制

Meta 表示,它通过 Open Compute Project 与业界分享部分基础设施设计。Open Compute Project 是一个于2011年成立的开源硬件与软件倡议。2025年,该公司宣布推出面向液冷网络机架的 IcePack 平台,并通过该项目免费提供其设计。

工程团队还构建了一个基于物理的模拟器,用于在数据中心实际部署前测试冷却决策。该系统模拟天气、服务器负载和冷却设备的行为,然后由强化学习模型测试在保持服务器处于最佳运行条件的同时减少冷却的方法。在 Meta 一座数据中心进行的初步试验中,这种方法使空气冷却供给风扇的能源消耗平均降低了20%,并在不同天气条件下将用水量降低了4%。

为什么这则消息重要?

这里的实际进展并不只是用液体替代空气,而是将高密度直接冷却、液体循环利用以及通过软件优化运行结合起来。这对面临能源、水资源和空间限制的数据中心运营商具有重要意义,但它并不能消除与设施所在地差异相关的工程限制;Meta 自身也指出,冷却设计取决于环境和现有基础设施。同样,能源和用水量下降的结果是该公司针对特定试验提供的数据,单凭这些数据并不能证明其适用于所有数据中心。

新闻来源
Meta Newsroom
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻