O problema energético nos centros de dados de inteligência artificial não está apenas na quantidade de eletricidade consumida, mas também na quantidade de capacidade cuja disponibilidade é paga e reservada para lidar com falhas, permanecendo depois sem utilização. Uma análise publicada pela Semiconductor Engineering em 15 de setembro de 2026 apresenta um paradoxo fundamental: reduzir o consumo dos chips e servidores melhora a eficiência, mas pode aumentar a diferença entre a capacidade disponível e a capacidade efetivamente utilizada, enquanto a arquitetura de alimentação de reserva obriga os operadores a manter uma parte significativa da capacidade fora do uso normal.
Esse problema se torna mais importante com a expansão das cargas de inteligência artificial, porque obter nova capacidade elétrica pode exigir linhas de transmissão, licenças e geração adicional no local. Segundo Marisa Hummon, diretora técnica da Utilidata, adicionar equipamentos a uma capacidade já disponível pode ser mais fácil do que construir um novo centro de dados ou esperar pelo aumento do fornecimento.
Por que a capacidade permanece sem utilização?
Os centros de dados normalmente são projetados para suportar a perda de uma das fontes de alimentação sem interromper o serviço. Em uma configuração «3+1», a instalação precisa de três fontes com capacidade total e acrescenta uma quarta como reserva, de modo que as quatro fontes operem com cerca de 75% da sua capacidade e as três fontes restantes possam cobrir a carga quando uma delas falhar. Já em uma arquitetura 2N, há alimentação dupla e a carga de cada linha é mantida em cerca de 50%, na eventualidade de perda da outra.
Hummon explica que um local preparado para 2 gigawatts pode ser tratado na prática como um local com capacidade de 1 gigawatt quando se adota 2N, e que, dentro dessa capacidade, normalmente apenas cerca de 70% a 80% é utilizada. Assim, a capacidade que efetivamente chega à infraestrutura computacional, considerando o local como um todo, pode chegar a aproximadamente um terço da capacidade nominal de 2 gigawatts. Isso não é desperdício causado por uma falha nos equipamentos, mas uma consequência direta dos requisitos de confiabilidade e das margens operacionais.
Reduzir o consumo do chip não resolve o problema por si só
A otimização energética começa no projeto dos circuitos e no gerenciamento da propriedade intelectual integrada ao chip. Arif Khan, da Cadence, destacou a importância de desligar interfaces e canais não utilizados, usar vários estados de espera e ajustar a frequência do clock e a tensão de acordo com o trabalho em andamento. Interfaces AMBA de baixo consumo, como os canais Q e P, oferecem mecanismos para controlar o desligamento do clock, os domínios de energia e o gerenciamento de vários estados.
A rede de comunicação dentro do chip também desempenha um papel central, já que a SignatureIP utiliza clocks que podem ser desligados e estados de energia independentes para os nós da rede em chip. Porém, reduzir a energia exige equilibrar o nível de economia com o tempo de retorno à operação. Além disso, os chips não se comportam da mesma maneira: a tensão normalmente é definida de acordo com as piores condições de carga, temperatura e degradação ao longo do tempo, embora essas condições nem sempre ocorram simultaneamente.
O monitoramento no circuito, segundo Noam Broussard, da proteanTecs, pode medir a margem de segurança efetiva e reduzir a tensão quando as margens máximas não forem necessárias, elevando-a novamente quando a carga ou as condições mudarem. Ainda é necessário um mecanismo de proteção rápida, porque reduzir demais a tensão pode ameaçar o tempo de propagação dos circuitos quando ocorre uma mudança súbita na carga ou uma queda dinâmica de tensão. A proteção pode reduzir a frequência do clock ou limitar temporariamente o desempenho até que a tensão retorne a um nível seguro.
O que muda, na prática, no centro de dados?
A ideia mais ampla é utilizar a capacidade de reserva durante a operação normal, reduzindo as cargas antes ou no momento da perda de uma fonte de alimentação. A Utilidata propõe dois loops de controle: o primeiro é mais lento e se conecta ao agendamento das cargas, fornecendo previsões da capacidade disponível para cada rack, fileira ou sala, para que o escalonador distribua as tarefas das unidades de processamento gráfico de acordo com a capacidade variável. O segundo é mais rápido e utiliza interfaces como DVFS e o gerenciamento do servidor para controlar a capacidade em uma escala de tempo de milissegundos.
A tecnologia não agenda nem cancela diretamente o trabalho; ela influencia o escalonador por meio de dados de capacidade. Ela utiliza a biblioteca de gerenciamento da NVIDIA e o controlador de gerenciamento da placa-mãe BMC para acessar o comportamento energético e as medições, com medição direta no nível do rack em vez de reunir estimativas de servidores individuais. Segundo Hummon, essa abordagem pode permitir que as quatro linhas da configuração 3+1 operem com cerca de 95% a 98% da sua capacidade em condições normais, reduzindo a carga de maneira organizada quando necessário.
Limitações e questões em aberto
Aproveitar a capacidade de reserva não significa que adicionar servidores se torne gratuito ou sem limitações. Os equipamentos adicionais precisam de espaço, refrigeração e conectividade, e transferir cargas de inteligência artificial pode exigir escoar as solicitações em andamento e carregar os pesos dos modelos em outra cópia, operações que podem levar segundos. Por outro lado, reduzir apenas a tensão dos chips não basta para lidar com uma falha em uma fonte de alimentação; o monitoramento e a resposta precisam ocorrer no nível do rack e da instalação.
Essa arquitetura também amplia uma superfície de segurança sensível. Cada servidor é equipado com um BMC, enquanto os hosts das unidades de processamento gráfico expõem interfaces para definir limites de capacidade para operações com privilégios suficientes. Por isso, a Utilidata afirma que seu sistema utiliza inicialização segura, uma raiz de confiança de hardware, firmware assinado e autenticação mútua nas interfaces, mantendo o loop de controle local e sem depender da internet. Editorialmente, a importância do desenvolvimento está em transformar a energia de reserva de uma margem rígida em um recurso gerenciável, mas seu sucesso depende da capacidade do operador de garantir uma resposta rápida, não prejudicar as cargas e proteger as ferramentas de controle que podem afetar milhares de servidores simultaneamente.