Geoff Tate considera que as unidades de processamento gráfico (GPU) ainda representam cerca de 70% da capacidade instalada mundial de computação de inteligência artificial, segundo o fabricante, contra 30% dos chips personalizados, dominados principalmente por Google e Amazon. No entanto, essa vantagem já não é garantida, depois que empresas de computação em nuvem e desenvolvedores de modelos avançados começaram a projetar seu próprio hardware para reduzir o custo de execução de cargas de trabalho específicas e melhorar o consumo de energia.
Os dados da Epoch.ai nos quais o autor se baseia indicam que a capacidade mundial instalada de computação de inteligência artificial cresceu 17 vezes em três anos. Em 2023, a participação da Nvidia era de 90%, contra 10% da Google, enquanto a computação personalizada representou 20% do crescimento nos últimos três anos. Tate observa que os dados não incluem Meta, Microsoft e Cerebras, cujas capacidades ele descreve como relativamente pequenas dentro dessa medição.
As vantagens da Nvidia vão além da unidade de processamento
Segundo o autor, a força da Nvidia não depende de uma GPU isolada, mas de um ecossistema integrado que inclui unidades de interconexão e expansão, racks, unidades centrais de processamento e processadores de rede. A empresa oferece o sistema NVL72, o processador Vera voltado para cargas de trabalho de agentes de inteligência artificial, a unidade BlueField e as redes Spectrum-6, além da opção Groq 3 LPX para inferência de baixa latência.
A Nvidia afirma que o processador Vera oferece desempenho 1,8 vez maior em cargas de trabalho de agentes em comparação com um processador tradicional, enquanto a empresa apresenta os sistemas Vera Rubin como capazes de obter uma melhoria entre duas e 30 vezes em comparação com o GB300 no teste DeepSeek-v4-PRO, dependendo do nível de interatividade. O artigo também menciona que os sistemas Vera Rubin começaram a operar em racks da CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud e Nebius.
A Nvidia prevê um crescimento de 70% em seu próximo ano fiscal, observando que a demanda é limitada pela oferta. Seus compromissos para garantir o fornecimento também aumentaram, segundo o que foi informado na teleconferência de resultados, de 119 bilhões de dólares para 279 bilhões de dólares. Tate considera que obter capacidade de fabricação da TSMC e disponibilizar memória HBM continuarão sendo fatores decisivos na competição.
Os chips personalizados se aproximam do centro da competição
Projetar chips internamente proporciona às empresas de computação em nuvem e aos desenvolvedores de modelos conhecimento direto sobre suas cargas de trabalho, sobre a separação entre as necessidades de treinamento e inferência e sobre os pontos de estrangulamento da infraestrutura. Com a expansão das escalas de computação, tornou-se economicamente mais viável projetar dois chips especializados, um para treinamento e outro para inferência, especialmente se isso resultar em uma melhoria de 10% a 30% no throughput por watt e em uma redução equivalente na área de silício.
A OpenAI se destaca no artigo por meio do chip Jalapeño, um acelerador de inferência projetado pela empresa para suas cargas de trabalho, com suporte às etapas de prefill e decode e manutenção do KV Cache localmente. O sistema utiliza switches Broadcom Tomahawk 6 para construir um domínio com 128 chips e um domínio global com até 2048 chips. Segundo os testes iniciais da OpenAI, o Jalapeño superou o Nvidia GB300 em cargas de trabalho de GPT-OSS, DeepSeek R1 e Kimi K2.5, mas os testes se basearam na previsão de um único token e ainda não incluíram a previsão de múltiplos tokens, que a empresa espera que aumente o desempenho entre três e cinco vezes.
Tate descreve a comparação entre Jalapeño e Vera Rubin como uma estimativa aproximada, baseada na projeção de curvas de desempenho publicadas, e não como um teste direto completo. Por isso, considera que os resultados são promissores, mas precisam ser verificados na implantação em produção e em escalas e cargas de trabalho mais amplas. Além disso, o Jalapeño é voltado para inferência e não atende às necessidades de treinamento, que podem representar um terço ou mais das necessidades computacionais da OpenAI.
Google, Meta e AMD ampliam as alternativas
A Google lança, na oitava geração de TPU, duas versões simultâneas: TPU 8t para treinamento e TPU 8i para inferência. O artigo indica que o TPU 8i é cerca de 1,4 vez maior que o 8t devido à necessidade de memória HBM adicional, enquanto a topologia de interconexão difere entre as duas versões em função das diferentes exigências de treinamento e inferência. A Google afirma que a nova geração oferece aproximadamente o dobro do desempenho das gerações anteriores, enquanto a Morgan Stanley estimou as vendas de TPU em cerca de 9 bilhões de dólares no segundo semestre de 2026, 84 bilhões de dólares em 2027 e 108 bilhões de dólares em 2028.
A Meta, por sua vez, desenvolve a série MTIA para cargas de trabalho de sistemas de recomendação e, posteriormente, de treinamento e inteligência generativa, enquanto a Cerebras apresentou o chip CS-4, que, segundo a empresa, duplica a velocidade de tokens por usuário em comparação com o CS-3 e alcança até dez vezes mais throughput por watt. A AMD também apresentou a unidade MI455x e o sistema Helios, e sua participação na capacidade instalada mundial, segundo o artigo, aumentou de zero para 6%, sem a apresentação de um gráfico de desempenho para um teste específico de inteligência artificial na exposição mencionada.
O que isso significa para os fabricantes de GPU?
Leitura da certi.news: os dados não apontam para o fim iminente das unidades GPU, mas para uma mudança da competição, que passa do desempenho do chip geral para a eficiência do sistema completo, a disponibilidade de energia, memória e fabricação e a capacidade do hardware de atender a cargas de trabalho específicas. A flexibilidade das GPU continuará sendo uma vantagem importante para clientes que executam modelos e cargas de trabalho variados, enquanto os chips personalizados poderão superar as GPU quando as cargas de trabalho da empresa forem conhecidas e estáveis o suficiente para justificar um projeto próprio.
Tate sugere que a Nvidia considere desenvolver chips separados para treinamento e inferência, em vez de depender de um único projeto geral, e que Nvidia e AMD adotem tecnologias de interconexão óptica, como optical circuit switching e co-packaged optics, à medida que o cobre se aproxima de seus limites práticos. No entanto, ele esclarece que algumas dessas propostas são opiniões analíticas e que é membro do conselho de administração de duas empresas que atuam em tecnologias de interconexão óptica, o que exige que sejam tratadas como recomendações do autor do material, e não como fatos independentes.
A conclusão apresentada pelo autor é que a Nvidia possui grandes barreiras defensivas, mas enfrenta clientes com recursos significativos e um incentivo direto para executar seus modelos em hardware próprio. Se o Jalapeño comprovar, na implantação em produção, desempenho semelhante ou superior ao do Vera Rubin, isso será um forte indicador de que o domínio das GPU passou a enfrentar uma concorrência real, e não apenas uma possibilidade teórica.