Computação em nuvem e centros de dados

A NVIDIA e a CoreWeave impulsionam a infraestrutura de IA agêntica para a produção

A CoreWeave anunciou a disponibilização dos sistemas NVIDIA Vera Rubin NVL72 e das redes Spectrum-X, além de novos serviços que conectam o treinamento, a avaliação e a execução de modelos em produção. Testes da Cognition mostraram um aumento de até 4,8 vezes na taxa total de geração de tokens em comparação com a plataforma GB200 NVL72 para cargas de engenharia de software.

2026-09-30
4 min de leitura
81 visualizações
certi.news Editorial Team
A NVIDIA e a CoreWeave impulsionam a infraestrutura de IA agêntica para a produção

A CoreWeave anunciou a disponibilização dos sistemas NVIDIA Vera Rubin NVL72 em sua plataforma de nuvem, apoiados pelas redes Spectrum-X 102.4T Ethernet, em uma iniciativa voltada a transferir cargas de IA agêntica do treinamento e dos experimentos para a operação em produção. A empresa afirma que a Cognition, desenvolvedora do engenheiro de software agêntico Devin, se tornou o primeiro cliente a executar cargas de produção no Vera Rubin.

O anúncio ocorre durante o evento CoreWeave Fully Connected, em São Francisco, e também inclui planos para disponibilizar o processador NVIDIA Vera, projetado para cargas de agentes de IA, além do lançamento do ambiente CoreWeave Forge para conectar o treinamento, a avaliação e a otimização contínua de modelos e agentes.

Maior desempenho para cargas do Devin

A Cognition utiliza a infraestrutura da CoreWeave para treinar o Devin, realizar aprendizado por reforço e executar inferência em produção. Depois que a CoreWeave recebeu os primeiros racks de produção do Vera Rubin NVL72, a Cognition comparou o desempenho usando um conjunto de tarefas de engenharia de software provenientes do FrontierCode e implantou agentes para resolvê-las.

Os testes iniciais mostraram um aumento de até 4,8 vezes na taxa total de geração de tokens para cargas de inferência SWE-2 em comparação com uma linha de base GB200 NVL72. Na prática, segundo a fonte, o resultado significa uma geração de código mais rápida e uma resposta melhor nas múltiplas etapas de raciocínio do Devin. O texto não forneceu detalhes suficientes sobre a metodologia completa de medição nem sobre as condições de teste que determinam até que ponto o número é comparável entre diferentes ambientes.

Uma única plataforma para o ciclo de vida da IA

A CoreWeave permite executar a capacidade do Vera por meio do CoreWeave Kubernetes Service, do SUNK, do CoreWeave Mission Control, do CoreWeave Sandboxes e do CoreWeave Inference. A empresa também anunciou que o CoreWeave Forge reunirá ferramentas da Weights & Biases, conhecimentos de pós-treinamento da OpenPipe e o projeto de código aberto marimo em um único ambiente, mantendo-se aberto a diferentes modelos, frameworks e nuvens.

O Forge inclui o serviço CoreWeave ARIA, disponível para o público em geral, para analisar experimentos, sugerir alterações e salvá-las no GitHub, além do novo serviço CoreWeave Agent Lens, que transforma dados de monitoramento de agentes em produção em insumos para otimização. A CoreWeave afirma que o Agent Lens melhorou a detecção de falhas em 20% e reduziu pela metade o custo de corrigi-las, sem apresentar detalhes independentes sobre como esses percentuais foram calculados.

O CoreWeave Sandboxes também passou a estar disponível para o público em geral para executar agentes, chamadas de ferramentas, aprendizado por reforço e avaliação em ambientes isolados sobre unidades de CPU ou GPU. A empresa afirma que o aprendizado por reforço sem servidor funciona 1,4 vez mais rápido e com custo 40% menor do que uma configuração gerenciada pelo próprio usuário.

O que muda na prática?

A mudança mais importante não é apenas a adição de novo hardware, mas a tentativa de reduzir o intervalo entre a execução do agente, a coleta de seus sinais e sua reutilização no treinamento. A NVIDIA Dynamo, um framework de inferência de código aberto, apoia o serviço de inferência gerenciado e o recurso RL Rollouts, disponível em prévia privada, que pode carregar novos pontos de verificação em uma implantação ativa sem uma nova implantação.

A CoreWeave afirma que o processador Vera pode acomodar 128 unidades de CPU e 11.264 núcleos em um único rack, o suficiente para mais de 11 mil ambientes simultâneos quando um núcleo é alocado para cada ambiente. Nos testes, o processo de inicialização dos ambientes dos agentes acelerou mais de três vezes, enquanto o processador obteve um ganho de 1,7 vez nas tarefas bem-sucedidas do Terminal-Bench.

A Canva, a Capital One e a MasterClass utilizam o Forge, enquanto a Ennoble Care escolheu capacidade reservada de NVIDIA RTX PRO 6000 para executar inferência de IA clínica. No entanto, a maioria dos números de desempenho e custo apresentados aqui foi fornecida pela CoreWeave ou por seus clientes e, portanto, precisa de revisão independente antes de ser considerada um indicador geral para todas as cargas de IA agêntica.

Fonte da notícia
NVIDIA AI Blog
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias