Computação em nuvem e centros de dados

Os centros de dados de inteligência artificial enfrentam um problema de energia ociosa que pode ser convertido em capacidade computacional

Os centros de dados de inteligência artificial consomem parte da sua capacidade elétrica disponível devido aos sistemas de alimentação de reserva e aos requisitos de confiabilidade, deixando uma capacidade que não é efetivamente utilizada. A análise examina técnicas de redução de tensão e gerenciamento de cargas que podem permitir o aproveitamento dessa capacidade, com redução rápida quando uma das fontes de alimentação falha, embora persistam desafios de programação, segurança e resposta a falhas.

2026-09-15
6 min de leitura
3 visualizações
فريق تحرير certi.news
Os centros de dados de inteligência artificial enfrentam um problema de energia ociosa que pode ser convertido em capacidade computacional

O problema energético nos centros de dados de inteligência artificial não está apenas na quantidade de eletricidade consumida, mas também na quantidade de capacidade cuja disponibilidade é paga e reservada para lidar com falhas, permanecendo depois sem utilização. Uma análise publicada pela Semiconductor Engineering em 15 de setembro de 2026 apresenta um paradoxo fundamental: reduzir o consumo dos chips e servidores melhora a eficiência, mas pode aumentar a diferença entre a capacidade disponível e a capacidade efetivamente utilizada, enquanto a arquitetura de alimentação de reserva obriga os operadores a manter uma parte significativa da capacidade fora do uso normal.

Esse problema se torna mais importante com a expansão das cargas de inteligência artificial, porque obter nova capacidade elétrica pode exigir linhas de transmissão, licenças e geração adicional no local. Segundo Marisa Hummon, diretora técnica da Utilidata, adicionar equipamentos a uma capacidade já disponível pode ser mais fácil do que construir um novo centro de dados ou esperar pelo aumento do fornecimento.

Por que a capacidade permanece sem utilização?

Os centros de dados normalmente são projetados para suportar a perda de uma das fontes de alimentação sem interromper o serviço. Em uma configuração «3+1», a instalação precisa de três fontes com capacidade total e acrescenta uma quarta como reserva, de modo que as quatro fontes operem com cerca de 75% da sua capacidade e as três fontes restantes possam cobrir a carga quando uma delas falhar. Já em uma arquitetura 2N, há alimentação dupla e a carga de cada linha é mantida em cerca de 50%, na eventualidade de perda da outra.

Hummon explica que um local preparado para 2 gigawatts pode ser tratado na prática como um local com capacidade de 1 gigawatt quando se adota 2N, e que, dentro dessa capacidade, normalmente apenas cerca de 70% a 80% é utilizada. Assim, a capacidade que efetivamente chega à infraestrutura computacional, considerando o local como um todo, pode chegar a aproximadamente um terço da capacidade nominal de 2 gigawatts. Isso não é desperdício causado por uma falha nos equipamentos, mas uma consequência direta dos requisitos de confiabilidade e das margens operacionais.

Reduzir o consumo do chip não resolve o problema por si só

A otimização energética começa no projeto dos circuitos e no gerenciamento da propriedade intelectual integrada ao chip. Arif Khan, da Cadence, destacou a importância de desligar interfaces e canais não utilizados, usar vários estados de espera e ajustar a frequência do clock e a tensão de acordo com o trabalho em andamento. Interfaces AMBA de baixo consumo, como os canais Q e P, oferecem mecanismos para controlar o desligamento do clock, os domínios de energia e o gerenciamento de vários estados.

A rede de comunicação dentro do chip também desempenha um papel central, já que a SignatureIP utiliza clocks que podem ser desligados e estados de energia independentes para os nós da rede em chip. Porém, reduzir a energia exige equilibrar o nível de economia com o tempo de retorno à operação. Além disso, os chips não se comportam da mesma maneira: a tensão normalmente é definida de acordo com as piores condições de carga, temperatura e degradação ao longo do tempo, embora essas condições nem sempre ocorram simultaneamente.

O monitoramento no circuito, segundo Noam Broussard, da proteanTecs, pode medir a margem de segurança efetiva e reduzir a tensão quando as margens máximas não forem necessárias, elevando-a novamente quando a carga ou as condições mudarem. Ainda é necessário um mecanismo de proteção rápida, porque reduzir demais a tensão pode ameaçar o tempo de propagação dos circuitos quando ocorre uma mudança súbita na carga ou uma queda dinâmica de tensão. A proteção pode reduzir a frequência do clock ou limitar temporariamente o desempenho até que a tensão retorne a um nível seguro.

O que muda, na prática, no centro de dados?

A ideia mais ampla é utilizar a capacidade de reserva durante a operação normal, reduzindo as cargas antes ou no momento da perda de uma fonte de alimentação. A Utilidata propõe dois loops de controle: o primeiro é mais lento e se conecta ao agendamento das cargas, fornecendo previsões da capacidade disponível para cada rack, fileira ou sala, para que o escalonador distribua as tarefas das unidades de processamento gráfico de acordo com a capacidade variável. O segundo é mais rápido e utiliza interfaces como DVFS e o gerenciamento do servidor para controlar a capacidade em uma escala de tempo de milissegundos.

A tecnologia não agenda nem cancela diretamente o trabalho; ela influencia o escalonador por meio de dados de capacidade. Ela utiliza a biblioteca de gerenciamento da NVIDIA e o controlador de gerenciamento da placa-mãe BMC para acessar o comportamento energético e as medições, com medição direta no nível do rack em vez de reunir estimativas de servidores individuais. Segundo Hummon, essa abordagem pode permitir que as quatro linhas da configuração 3+1 operem com cerca de 95% a 98% da sua capacidade em condições normais, reduzindo a carga de maneira organizada quando necessário.

Limitações e questões em aberto

Aproveitar a capacidade de reserva não significa que adicionar servidores se torne gratuito ou sem limitações. Os equipamentos adicionais precisam de espaço, refrigeração e conectividade, e transferir cargas de inteligência artificial pode exigir escoar as solicitações em andamento e carregar os pesos dos modelos em outra cópia, operações que podem levar segundos. Por outro lado, reduzir apenas a tensão dos chips não basta para lidar com uma falha em uma fonte de alimentação; o monitoramento e a resposta precisam ocorrer no nível do rack e da instalação.

Essa arquitetura também amplia uma superfície de segurança sensível. Cada servidor é equipado com um BMC, enquanto os hosts das unidades de processamento gráfico expõem interfaces para definir limites de capacidade para operações com privilégios suficientes. Por isso, a Utilidata afirma que seu sistema utiliza inicialização segura, uma raiz de confiança de hardware, firmware assinado e autenticação mútua nas interfaces, mantendo o loop de controle local e sem depender da internet. Editorialmente, a importância do desenvolvimento está em transformar a energia de reserva de uma margem rígida em um recurso gerenciável, mas seu sucesso depende da capacidade do operador de garantir uma resposta rápida, não prejudicar as cargas e proteger as ferramentas de controle que podem afetar milhares de servidores simultaneamente.

Fonte da notícia
Semiconductor Engineering
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias