Проблема энергопотребления в центрах обработки данных для искусственного интеллекта заключается не только в количестве потребляемой электроэнергии, но и в объёме мощности, за которую платят и которую резервируют для устранения сбоев, после чего она остаётся неиспользованной. В анализе, опубликованном Semiconductor Engineering 15 сентября 2026 года, описывается ключевой парадокс: снижение энергопотребления микросхем и серверов повышает эффективность, но может увеличить разрыв между доступной и фактически используемой мощностью, тогда как резервная архитектура питания вынуждает операторов оставлять значительную часть ёмкости вне обычного использования.
Эта проблема становится всё более важной по мере расширения нагрузок искусственного интеллекта, поскольку получение новых электрических мощностей может потребовать линий электропередачи, разрешений и дополнительной генерации на площадке. По словам Мариссы Хомон, технического директора Utilidata, добавление оборудования к уже доступной мощности может оказаться проще, чем строительство нового центра обработки данных или ожидание увеличения энергоснабжения.
Почему мощность остаётся неиспользованной?
Центры обработки данных обычно проектируются с расчётом на потерю одного из источников питания без прекращения обслуживания. В конфигурации «3+1» объекту требуются три полноценных источника, к которым добавляется четвёртый резервный, поэтому все четыре источника работают примерно на 75% мощности, а оставшиеся три могут покрыть нагрузку при отказе одного из них. В архитектуре 2N питание подаётся по двум независимым линиям, а нагрузка каждой линии поддерживается примерно на уровне 50% с учётом возможной потери другой.
Хомон объясняет, что площадка, рассчитанная на 2 ГВт, при использовании 2N фактически может рассматриваться как площадка мощностью 1 ГВт, а внутри этой мощности обычно используется лишь около 70–80%. Таким образом, мощность, фактически поступающая к вычислительной инфраструктуре при рассмотрении всей площадки, может составлять примерно треть от номинальной мощности в 2 ГВт. Это не потери из-за неисправности оборудования, а прямое следствие требований к надёжности и эксплуатационных резервов.
Снижение энергопотребления микросхемы само по себе не решает проблему
Оптимизация энергопотребления начинается с проектирования схем и управления интеллектуальной собственностью, интегрированной в микросхему. Ариф Хан из Cadence указал на важность отключения неиспользуемых интерфейсов и каналов, применения нескольких режимов ожидания, а также настройки тактовой частоты и напряжения в соответствии с выполняемой работой. Энергоэффективные интерфейсы AMBA, такие как каналы Q и P, предоставляют механизмы управления отключением тактового сигнала, доменами питания и несколькими режимами.
Ключевую роль играет и внутренняя сеть связи микросхемы: SignatureIP использует отключаемые тактовые сигналы и независимые режимы питания для узлов сети на кристалле. Однако снижение энергопотребления требует баланса между величиной экономии и временем возврата к рабочему режиму. Кроме того, микросхемы ведут себя неодинаково: напряжение обычно задаётся исходя из наихудших условий нагрузки, температуры и износа с течением времени, хотя эти условия не всегда возникают одновременно.
По словам Ноама Броссара из proteanTecs, встроенный мониторинг способен измерять фактический запас надёжности и снижать напряжение, когда максимальные запасы не требуются, а затем повышать его при изменении нагрузки или условий. При этом по-прежнему необходим быстрый механизм защиты, поскольку чрезмерное снижение напряжения может нарушить временные параметры схем при внезапном изменении нагрузки или динамическом падении напряжения. Защита может использовать снижение тактовой частоты или временное ограничение производительности до возвращения напряжения к безопасному уровню.
Что практически меняется в центре обработки данных?
Более широкая идея заключается в использовании резервной мощности при нормальной работе с последующим снижением нагрузки до или в момент потери источника питания. Utilidata предлагает две петли управления: первая, более медленная, связана с планированием нагрузки и предоставляет прогнозы доступной мощности для каждой стойки, ряда или зала, чтобы планировщик распределял задания графических процессоров в соответствии с изменяющейся ёмкостью. Вторая работает быстрее и использует такие интерфейсы, как DVFS, и управление сервером для регулирования мощности в миллисекундном диапазоне.
Технология не планирует и не отменяет задания напрямую, а воздействует на планировщик посредством данных о мощности. Она использует библиотеку управления NVIDIA и контроллер базовой платы BMC для доступа к параметрам энергопотребления и измерениям, выполняя прямые измерения на уровне стойки вместо сбора оценок отдельных серверов. По словам Хомон, такой подход может позволить четырём линиям в конфигурации 3+1 работать примерно на 95–98% мощности в обычных условиях, а затем организованно снижать нагрузку при необходимости.
Ограничения и открытые вопросы
Использование резервной мощности не означает, что добавление серверов становится бесплатным или неограниченным. Дополнительному оборудованию требуются пространство, охлаждение и сетевые соединения, а перенос нагрузок искусственного интеллекта может потребовать завершения текущих запросов и загрузки весов моделей в другую копию; такие операции могут занимать секунды. При этом одного лишь снижения напряжения микросхем недостаточно для устранения сбоя источника питания: мониторинг и реагирование должны осуществляться на уровне стойки и объекта.
Такая архитектура также увеличивает чувствительную поверхность атаки. Каждый сервер оснащён BMC, а хосты графических процессоров предоставляют интерфейсы для задания ограничений мощности для операций, выполняемых процессами с достаточными привилегиями. Поэтому Utilidata заявляет, что её система использует безопасную загрузку, аппаратный корень доверия, подписанную прошивку и взаимную аутентификацию интерфейсов, а петля управления работает локально и не зависит от интернета. С редакционной точки зрения важность этой разработки заключается в превращении резервной энергии из жёсткого запаса в управляемый ресурс, однако успех зависит от способности оператора обеспечить быстрое реагирование, не навредить нагрузкам и защитить инструменты управления, способные одновременно влиять на тысячи серверов.