CoreWeave a annoncé la disponibilité des systèmes NVIDIA Vera Rubin NVL72 sur sa plateforme cloud, soutenus par des réseaux Spectrum-X 102.4T Ethernet, dans le but de faire passer les charges d’IA agentique de l’entraînement et de l’expérimentation à l’exploitation en production. L’entreprise affirme que Cognition, développeuse de l’ingénieur logiciel agentique Devin, est devenue le premier client à exécuter des charges de production sur Vera Rubin.
L’annonce intervient dans le cadre de l’événement CoreWeave Fully Connected à San Francisco. Elle comprend également des projets de mise à disposition du processeur NVIDIA Vera, conçu pour les charges des agents d’IA, ainsi que le lancement de l’environnement CoreWeave Forge, destiné à relier l’entraînement, l’évaluation et l’amélioration continue des modèles et des agents.
Des performances supérieures pour les charges de Devin
Cognition utilise l’infrastructure de CoreWeave pour entraîner Devin, effectuer l’apprentissage par renforcement et exécuter l’inférence en production. Après la réception par CoreWeave des premiers racks de production Vera Rubin NVL72, Cognition a comparé les performances à l’aide d’un ensemble de tâches d’ingénierie logicielle issues de FrontierCode et a déployé des agents pour les résoudre.
Les premiers tests ont montré une multiplication pouvant atteindre 4,8 fois le taux global de génération de tokens pour les charges d’inférence SWE-2, par rapport à une référence GB200 NVL72. En pratique, selon la source, ce résultat signifie une génération de code plus rapide et une meilleure réactivité lors des étapes de raisonnement multiples de Devin. Le texte n’a pas fourni suffisamment de détails sur la méthodologie complète de mesure ni sur les conditions de test permettant de déterminer dans quelle mesure ce chiffre peut être comparé entre différents environnements.
Une plateforme unique pour le cycle de l’IA
CoreWeave permet d’exécuter la capacité Vera via CoreWeave Kubernetes Service, SUNK, CoreWeave Mission Control, CoreWeave Sandboxes et CoreWeave Inference. L’entreprise a également annoncé que CoreWeave Forge réunirait les outils de Weights & Biases, l’expertise en post-entraînement d’OpenPipe et le projet open source marimo dans un même environnement, tout en restant ouvert aux différents modèles, frameworks et clouds.
Forge comprend le service CoreWeave ARIA, désormais disponible de manière générale, pour analyser les expériences, proposer des modifications et les enregistrer dans GitHub, ainsi que le nouveau service CoreWeave Agent Lens, destiné à transformer les données de surveillance des agents en production en données d’entrée pour l’amélioration. CoreWeave affirme qu’Agent Lens a amélioré la détection des échecs de 20 % et réduit de moitié le coût de leur correction, sans fournir de détails indépendants sur la manière dont ces pourcentages ont été calculés.
CoreWeave Sandboxes est également désormais disponible de manière générale pour exécuter des agents, des appels d’outils, de l’apprentissage par renforcement et des évaluations dans des environnements isolés sur des unités CPU ou GPU. L’entreprise affirme que l’apprentissage par renforcement sans serveur fonctionne 1,4 fois plus vite et coûte 40 % moins cher qu’une configuration autogérée.
Qu’est-ce qui change concrètement ?
Le changement le plus important ne consiste pas seulement à ajouter du matériel, mais à tenter de réduire l’écart entre l’exécution de l’agent, la collecte de ses signaux, puis leur réutilisation pour l’entraînement. NVIDIA Dynamo, un framework d’inférence open source, prend en charge le service d’inférence géré ainsi que la fonctionnalité RL Rollouts actuellement disponible en préversion privée, qui peut charger de nouveaux points de contrôle dans un déploiement actif sans redéploiement.
CoreWeave affirme que le processeur Vera peut réunir 128 unités CPU et 11 264 cœurs dans un seul rack, ce qui suffit à plus de 11 000 environnements simultanés lorsqu’un seul cœur est attribué à chaque environnement. Lors des tests, le démarrage des environnements d’agents a été accéléré de plus de trois fois, tandis que le processeur a obtenu un gain de 1,7 fois sur l’ensemble des tâches réussies dans Terminal-Bench.
Canva, Capital One et MasterClass utilisent Forge, tandis qu’Ennoble Care a choisi une capacité réservée de NVIDIA RTX PRO 6000 pour exécuter l’inférence d’IA clinique. Cependant, la plupart des chiffres de performance et de coût présentés ici proviennent de CoreWeave ou de ses clients et nécessitent donc un examen indépendant avant d’être considérés comme des indicateurs généraux pour l’ensemble des charges d’IA agentique.