Computación en la nube y centros de datos

Los centros de datos de inteligencia artificial afrontan un problema de energía varada que puede convertirse en capacidad de cómputo

Los centros de datos de inteligencia artificial consumen parte de su capacidad eléctrica disponible debido a los sistemas de alimentación de respaldo y a los requisitos de fiabilidad, lo que deja capacidad que no se utiliza realmente. El análisis examina técnicas de reducción de voltaje y gestión de cargas que podrían permitir aprovechar esa capacidad con una reducción rápida cuando falla una de las fuentes de alimentación, aunque persisten desafíos de programación, seguridad y respuesta ante fallos.

2026-09-15
7 min de lectura
3 visitas
فريق تحرير certi.news
Los centros de datos de inteligencia artificial afrontan un problema de energía varada que puede convertirse en capacidad de cómputo

El problema energético de los centros de datos de inteligencia artificial no se limita a la cantidad de electricidad consumida, sino también a la cantidad de capacidad por la que se paga y que se reserva para afrontar fallos, pero que permanece sin utilizar. Un análisis publicado por Semiconductor Engineering el 15 de septiembre de 2026 presenta una paradoja fundamental: reducir el consumo de los chips y servidores mejora la eficiencia, pero puede aumentar la diferencia entre la capacidad disponible y la capacidad utilizada efectivamente, mientras que la arquitectura de alimentación de respaldo obliga a los operadores a mantener una parte considerable de la capacidad fuera del uso normal.

Este problema cobra mayor importancia con la expansión de las cargas de inteligencia artificial, porque obtener nueva capacidad eléctrica puede requerir líneas de transmisión, permisos y generación adicional en el propio emplazamiento. Según Marisa Hummon, directora técnica de Utilidata, añadir equipos a una capacidad ya disponible puede ser más fácil que construir un nuevo centro de datos o esperar a que aumente el suministro.

¿Por qué permanece sin utilizar la capacidad?

Los centros de datos suelen diseñarse para soportar la pérdida de una de las fuentes de alimentación sin interrumpir el servicio. En una configuración «3+1», la instalación necesita tres fuentes de capacidad completa y añade una cuarta de respaldo, de modo que las cuatro fuentes operan aproximadamente al 75% de su capacidad y las tres restantes pueden cubrir la carga si una de ellas falla. En una arquitectura 2N, hay una alimentación duplicada y la carga de cada línea se mantiene aproximadamente al 50% para afrontar la posible pérdida de la otra.

Hummon explica que un emplazamiento preparado para 2 gigavatios puede considerarse en la práctica un emplazamiento de 1 gigavatio cuando se adopta 2N, y que normalmente solo se utiliza dentro de esa capacidad entre aproximadamente el 70% y el 80%. Así, la capacidad que llega efectivamente a la infraestructura informática, al considerar todo el emplazamiento, puede alcanzar alrededor de un tercio de la capacidad nominal de 2 gigavatios. No se trata de un desperdicio causado por un fallo del equipo, sino de una consecuencia directa de los requisitos de fiabilidad y los márgenes operativos.

Reducir el consumo del chip no resuelve por sí solo el problema

La optimización energética comienza con el diseño de los circuitos y con la gestión de la propiedad intelectual integrada en el chip. Arif Khan, de Cadence, señaló la importancia de apagar las interfaces y los canales que no se utilizan, emplear múltiples estados de espera y ajustar la frecuencia de reloj y el voltaje según el trabajo en curso. Las interfaces AMBA de bajo consumo, como los canales Q y P, ofrecen mecanismos para controlar la desactivación del reloj, los dominios de energía y la gestión de múltiples estados.

La red de interconexión dentro del chip desempeña un papel fundamental, ya que SignatureIP utiliza relojes desactivables y estados de energía independientes para los nodos de la red en el chip. Sin embargo, reducir la energía exige equilibrar el ahorro obtenido con el tiempo de recuperación del funcionamiento. Además, los chips no se comportan todos de la misma manera: el voltaje suele determinarse según las peores condiciones de carga, temperatura y degradación con el paso del tiempo, aunque esas condiciones no siempre se presenten simultáneamente.

Según Noam Broussard, de proteanTecs, la monitorización integrada en el circuito puede medir el margen de seguridad real y reducir el voltaje cuando no se requieren los márgenes máximos, para luego aumentarlo cuando cambian la carga o las condiciones. Sigue siendo necesario un mecanismo de protección rápida, porque reducir demasiado el voltaje puede poner en riesgo la temporización de los circuitos cuando se produce un cambio repentino de carga o una caída dinámica del voltaje. La protección puede utilizar una reducción de la frecuencia de reloj o limitar temporalmente el rendimiento hasta que el voltaje vuelva a un nivel seguro.

¿Qué cambia en la práctica en el centro de datos?

La idea más amplia consiste en utilizar la capacidad de respaldo durante el funcionamiento normal, reduciendo las cargas antes de que se pierda una fuente de alimentación o en el momento de esa pérdida. Utilidata propone dos bucles de control: el primero es más lento y se conecta con la programación de las cargas; ofrece previsiones de la capacidad disponible para cada rack, fila o sala, de modo que el programador distribuya las tareas de las unidades de procesamiento gráfico según la capacidad variable. El segundo es más rápido y utiliza interfaces como DVFS y la gestión del servidor para controlar la potencia en una escala temporal de milisegundos.

La tecnología no programa ni cancela directamente el trabajo, sino que influye en el programador mediante datos de potencia. Aprovecha la biblioteca de gestión de NVIDIA y el controlador de gestión de la placa base BMC para acceder al comportamiento energético y a las mediciones, con mediciones directas a nivel del rack en lugar de recopilar estimaciones de servidores individuales. Según Hummon, este enfoque podría permitir operar las cuatro líneas de una configuración 3+1 aproximadamente al 95% o 98% de su capacidad en condiciones normales y, después, reducir la carga de forma ordenada cuando sea necesario.

Limitaciones y preguntas abiertas

Aprovechar la capacidad de respaldo no significa que añadir servidores pase a ser gratuito o carezca de limitaciones. Los equipos adicionales necesitan espacio, refrigeración y conectividad, y trasladar cargas de inteligencia artificial puede requerir vaciar las solicitudes en curso y cargar los pesos de los modelos en otra réplica, procesos que pueden tardar segundos. Por otra parte, reducir únicamente el voltaje de los chips no basta para afrontar un fallo en una fuente de alimentación; la monitorización y la respuesta deben situarse al nivel del rack y de la instalación.

Esta arquitectura también añade una superficie de seguridad sensible. Cada servidor está equipado con un BMC, mientras que los hosts de las unidades de procesamiento gráfico exponen interfaces para establecer límites de potencia para procesos con privilegios suficientes. Por ello, Utilidata afirma que su sistema se basa en arranque seguro, una raíz de confianza de hardware, firmware firmado y autenticación mutua en las interfaces, con el bucle de control ejecutándose localmente y sin depender de internet. Desde el punto de vista editorial, la importancia de este avance reside en transformar la energía de respaldo de un margen rígido en un recurso gestionable, pero su éxito depende de la capacidad del operador para garantizar una respuesta rápida, no perjudicar las cargas y proteger las herramientas de control que pueden afectar simultáneamente a miles de servidores.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias