Intelligence artificielle

Une étude de NVIDIA : les outils d’exécution des agents pourraient être plus importants que le modèle d’IA lui-même

Des recherches de NVIDIA indiquent que les performances des agents d’intelligence artificielle dans les tâches à long horizon ne dépendent pas uniquement du modèle, mais aussi, dans une large mesure, de la couche d’exécution qui l’entoure, appelée « harness ». Lors du test ARC-AGI-3, un harness personnalisé a fait passer les performances de Claude Opus 5 de 30 % à 100 % grâce à la gestion de la mémoire et à l’ajout d’un agent superviseur.

2026-08-21
6 min de lecture
9 vues
فريق تحرير certi.news
Une étude de NVIDIA : les outils d’exécution des agents pourraient être plus importants que le modèle d’IA lui-même

Une étude publiée par NVIDIA a conclu que la couche logicielle entourant un modèle d’intelligence artificielle pouvait influencer les performances de l’agent davantage que le modèle de base lui-même, en particulier lorsque la tâche est étendue et exige une longue série de décisions. Cette couche comprend les outils, la gestion de la mémoire, les règles d’utilisation du contexte, les mécanismes de rétroaction, ainsi que l’environnement d’exécution, les compétences et les bibliothèques accessibles au modèle.

L’expérience a montré que l’utilisation d’un harness personnalisé, conçu pour gérer la mémoire et doté d’un composant superviseur, a permis à Claude Opus 5 d’obtenir un résultat parfait de 100 % au test de raisonnement interactif ARC-AGI-3. Le test comprend des jeux en deux dimensions dépourvus d’instructions directes, et le modèle doit en déduire la manière de jouer et de gagner, dans une tâche qui ressemble à la tentative d’un être humain de comprendre un nouveau jeu. Avant l’utilisation du harness, le modèle avait obtenu 30 %, soit le meilleur résultat parmi les modèles testés sans celui-ci.

Qu’ajoute le harness au modèle ?

Le modèle de langage joue le rôle du « cerveau » qui prend les décisions, mais il ne fonctionne pas seul au sein du système agentique. Le harness détermine la manière dont les informations sont conservées et récupérées, les outils que le modèle peut utiliser, ainsi que la façon d’organiser les étapes et de vérifier les résultats. Selon Adel El Hallack, vice-président des produits au sein de l’unité d’intelligence artificielle de NVIDIA, l’agent ne se limite pas à une interface de programmation du modèle, mais se compose du modèle, des échafaudages qui l’entourent, des outils, de l’environnement d’exécution, des compétences et des bibliothèques qui lui sont associés.

Ces éléments revêtent une importance particulière dans les tâches à long horizon, c’est-à-dire les tâches qui nécessitent de relier de nombreuses décisions sur plusieurs heures ou plusieurs jours pour parvenir à un résultat complet, plutôt que de fournir une seule réponse à une courte demande. Plus le parcours est long, plus les risques de perdre le contexte, de répéter des étapes ou de dévier vers une trajectoire inutile augmentent.

Le rôle du « superviseur » pour prévenir les déviations

L’élément le plus remarquable de la conception de NVIDIA était l’ajout d’un agent superviseur aux côtés de l’agent principal qui exécute la tâche. Ce composant, selon la description d’El Hallack, joue un rôle proche de celui d’un directeur général : il pousse l’agent dans la bonne direction lorsqu’il rencontre un obstacle, l’avertit s’il entame une trajectoire susceptible de le conduire dans une impasse, ou lui demande de réexaminer une trajectoire qu’il a déjà testée.

L’idée d’un agent superviseur n’est pas nouvelle, mais de nombreux outils agentiques actuels ne reposent que sur une seule couche dans le harness, comme Claude Code, Codex et Hermes. L’article indique que les chercheurs de NVIDIA ont créé pour ce test un harness étendu baptisé Agentic Variation Operators (AVO), ce qui leur a permis d’expérimenter la gestion de la mémoire et la supervision de manière plus avancée.

Qu’est-ce que cela signifie pour les utilisateurs d’agents ?

Les résultats montrent que choisir le modèle le plus puissant ou le plus récent ne suffit pas à lui seul pour construire un agent fiable. Un même modèle peut obtenir des résultats radicalement différents lorsqu’il est exécuté dans des harnesses différents, car la conception de la mémoire, la gestion du contexte et la vérification des décisions modifient sa manière pratique de fonctionner. Cela concerne les équipes qui développent des agents pour la programmation, la modification de documents ou l’exécution d’actions en plusieurs étapes, car l’architecture du système entourant le modèle peut constituer un facteur déterminant de précision et de stabilité.

Ce résultat intervient après d’autres signes de la difficulté des tâches à long horizon. En avril, Microsoft a testé 19 grands modèles de langage dans des tâches liées à la modification de documents et a constaté que tous les modèles, y compris les modèles avancés, avaient introduit des erreurs dans les fichiers. Des cas ont également été observés dans lesquels des modèles prenant des décisions successives ont supprimé des fichiers d’utilisateurs ou des bases de données entières, ou ont eu recours à des comportements criminels tels que la collusion et le piratage pour atteindre leurs objectifs.

Le test ARC-AGI-3 revêt une importance supplémentaire, car les modèles d’OpenAI y ont obtenu des résultats inférieurs à 10 %, ce qui a conduit l’entreprise à mener ses propres recherches le mois précédent. OpenAI a constaté que la modification de seulement deux paramètres du harness avait triplé les résultats de ses modèles, mais ceux-ci n’ont pas atteint le score de 100 % obtenu par la conception de NVIDIA lors du test cité.

L’impact sur les coûts et l’ouverture

NVIDIA ne présente pas ce résultat comme un nouveau produit. L’entreprise propose sous la marque Nemo des composants open source et d’autres commerciaux pouvant être utilisés pour construire des harnesses d’agents, mais la recherche AVO elle-même n’est pas une annonce de nouveau produit. Ces résultats concordent avec une étude publiée par Databricks en juillet, qui indiquait que le harness pouvait avoir un impact considérable sur le coût d’exécution de l’intelligence artificielle. Selon une déclaration d’Ali Ghodsi, directeur général de Databricks, l’utilisation d’un harness inadapté peut multiplier les coûts, même lorsque le même modèle est exécuté.

Le message plus large de l’étude de NVIDIA est que les harnesses ouverts donnent aux utilisateurs une plus grande capacité à régler le système, tout comme les modèles ouverts leur offrent une marge de contrôle accrue. L’entreprise estime qu’un contrôle du harness, de l’infrastructure et de l’environnement d’exécution est nécessaire pour faire progresser les systèmes agentiques de manière plus sûre. Toutefois, les résultats ne diminuent pas l’importance du modèle ; ils indiquent plutôt que les performances finales de l’agent résultent du modèle et de la couche qui organise sa mémoire, ses outils et ses décisions, et non du modèle pris isolément.

Source de l’actualité
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités