Rani Borkar, que lidera na Microsoft as organizações responsáveis pelo planejamento, engenharia, desenvolvimento e implantação do hardware e da infraestrutura da plataforma de computação em nuvem, apresenta uma perspectiva diferente para medir o progresso na era da inteligência artificial. Em vez de se concentrar no número de chips, no tamanho dos centros de dados ou na quantidade de tokens que o sistema pode gerar, ela propõe adotar o conceito de «rendimento» (Yield): isto é, a quantidade de resultado útil que pode ser produzida a partir dos recursos disponíveis.
Borkar toma o conceito emprestado da indústria de semicondutores, onde rendimento se refere ao número de chips funcionais que podem ser extraídos de cada wafer. Segundo sua visão, esse princípio deveria ser ampliado para incluir capital, energia, memória, comunicações, modelos e software, até chegar ao valor que a inteligência artificial gera no trabalho e na vida cotidiana.
Por que ampliar a infraestrutura já não é suficiente?
O artigo indica que a disseminação da inteligência artificial acelerou a uma taxa superior à observada com a internet, os computadores pessoais e os smartphones, mas seu uso global ainda alcança apenas cerca de 18% da força de trabalho, enquanto a maior parte do uso se concentra em conversas. À medida que os sistemas passam a realizar tarefas de inferência, planejamento, uso de ferramentas e execução de fluxos de trabalho agentivos mais longos, os requisitos de infraestrutura mudam radicalmente.
Borkar afirma que uma única tarefa agentiva pode usar mais de 3.400 vezes o número de tokens consumidos por interações conversacionais comuns. Essa escalada pressiona a energia, a densidade dos racks, o tamanho dos pacotes e a capacidade de memória. Ela considera que a resposta tradicional de adicionar mais silício, memória, energia e fibra não pode continuar indefinidamente, pois cada novo avanço pode exigir entradas maiores que as da geração anterior.
A visão propõe dois caminhos paralelos: melhorias graduais nas arquiteturas atuais para aumentar a eficiência, a utilização e a viabilidade econômica, e transformações mais profundas que remodelam a curva de desempenho por meio de novas arquiteturas, materiais e métodos de design de sistemas e modelos. Borkar cita a transição dos processadores para o design multinúcleo depois que o aumento da frequência de clock atingiu uma barreira energética, bem como a transição da memória NAND do design planar para o design vertical.
O rendimento é resultado da colaboração entre todas as camadas
O artigo enfatiza que o gargalo não é necessariamente resolvido na camada em que aparece. Medir o desempenho de um componente isolado não é suficiente, pois ganhos e perdas se acumulam entre o centro de dados, o silício, os modelos e as ferramentas que coordenam as tarefas dos agentes. Por isso, Borkar defende um «design conjunto» que defina primeiro o resultado desejado e, em seguida, otimize novamente todo o sistema, em vez de maximizar o desempenho de um único elemento.
Na memória, a Microsoft considera que o problema não é apenas a falta de componentes, mas um desafio no nível do sistema. A inferência precisa acomodar modelos maiores e contextos mais longos e fornecer dados rapidamente, enquanto os agentes acrescentam geração, recuperação, uso de ferramentas e memória persistente em ciclos que podem durar minutos ou horas. A experiência da plataforma Azure Maia mostra que reduzir o consumo de memória do cache KV pode combinar engenharia de modelos, ciência de dados e compressão, além do gerenciamento de software dos níveis de memória, da otimização do silício, da movimentação de dados e dos compiladores.
A ideia aqui não é apenas adicionar novos bytes, mas extrair uma quantidade maior de inteligência útil de cada byte disponível.
Das redes à energia
No nível dos clusters, a inteligência não vem de um único chip, mas de milhares de chips que funcionam como um sistema único. Por isso, o resultado não depende apenas da velocidade das conexões, mas também do gerenciamento de congestionamentos, da recuperação de falhas, da distribuição das cargas de trabalho, da complexidade da programação e dos limites entre o silício, o sistema e o software.
Borkar afirma que o design da plataforma Maia começou pelo resultado a ser alcançado — uma inferência eficiente em escala de frota — e não por um design de rede previamente estabelecido. Isso incluiu a construção de uma rede de expansão de dois níveis, a integração de funções da placa de rede no chip e o desenvolvimento de uma camada de transporte dedicada. Segundo o artigo, essa abordagem resultou em desempenho escalável em clusters de inferência densos, simplificação da programação, maior flexibilidade das cargas de trabalho e redução do hardware de rede necessário.
Quanto à energia, ela deixou de ser um recurso consumido pelo sistema para se tornar uma restrição que deve entrar no design desde a rede elétrica até o chip. O artigo aponta o aumento da capacidade dos racks de dezenas para centenas de quilowatts e menciona que complexos de centros de dados operam em escala de gigawatts. Também cita soluções como transformadores de estado sólido e distribuição de corrente contínua a 800 volts para reduzir as perdas de distribuição.
A Microsoft apresenta o processador de servidores Azure Cobalt 200, baseado em Arm, como um exemplo desse design conjunto; ele permite que cada núcleo tenha controle próprio de tensão e frequência, com a definição programática do consumo de energia de cada máquina virtual. A empresa afirma que o controle preciso permite ajustar a energia protegendo o desempenho das cargas de trabalho críticas, possibilitando operar um número maior de servidores dentro dos mesmos limites de energia.
O que importa na prática?
A importância da proposta está em deslocar o debate da corrida pela capacidade bruta para a eficiência na conversão de recursos em resultados. Para operadores de nuvens e centros de dados, isso significa que a avaliação do hardware não pode ser dissociada das redes, do software, do resfriamento e do gerenciamento das cargas. Para desenvolvedores de modelos e agentes, a eficiência da memória, a duração das tarefas e a integração das ferramentas tornam-se fatores que afetam a escalabilidade tanto quanto o tamanho do modelo.
Entretanto, essa conclusão continua sendo uma visão da Microsoft, baseada parcialmente em sua experiência na construção e operação de infraestrutura de inteligência artificial em grande escala, e não um padrão independente comprovado para todos os ambientes. Além disso, o artigo não apresenta números comparativos detalhados para medir os ganhos do Maia ou do Cobalt 200, nem especifica o custo ou o cronograma para aplicar as soluções mencionadas fora do contexto do Azure.
Ainda assim, a «necessidade de rendimento» coloca uma questão prática diante da indústria: os investimentos crescentes em energia, chips e centros de dados estão levando a uma inteligência acessível a um custo adequado e a ganhos concretos de produtividade e valor? Na visão de Borkar, o rendimento não se completa na produção de tokens, mas quando essas saídas se transformam em uma descoberta científica mais rápida, um sinal médico detectado precocemente, uma aprendizagem melhor ou novas oportunidades para pequenas empresas.