Lorsque les entreprises passent de l’expérimentation avec un nombre limité d’agents d’intelligence artificielle à l’exécution de dizaines ou de centaines d’agents 24 heures sur 24, la qualité du modèle à elle seule ne constitue plus le facteur déterminant. Dans la deuxième partie du dialogue Leaders of Code publié par Stack Overflow, Andy Gutmann de Google a discuté avec Peter O’Connor, directeur de l’ingénierie des plateformes chez Stack Overflow, de l’économie de cette transition : quantité de contexte nécessaire, coût des tokens, mesure du rendement et éléments que les équipes d’ingénierie des plateformes devraient construire afin de pouvoir gérer concrètement les agents.
La thèse centrale du dialogue est que le problème est devenu celui d’un système intégré, et non celui d’un modèle isolé. La performance finale dépend du modèle, de son mode d’exécution, du contexte qui lui est fourni, de son degré de personnalisation et des outils qu’il appelle. Selon Gutmann, l’objectif n’est pas d’utiliser le modèle le plus avancé pour chaque tâche, mais de choisir le modèle le moins complexe qui permette d’obtenir le résultat souhaité au coût le plus faible. Des modèles légers comme Gemini 3.5 Flash peuvent suffire pour certains usages, tandis que d’autres cas nécessitent un modèle Gemini Pro.
Le contexte approprié compte davantage que le nombre de tokens
Gutmann critique ce qu’il appelle la « maximisation des tokens » : augmenter la taille des entrées ou prolonger les boucles de raisonnement ne signifie pas nécessairement obtenir un meilleur résultat. L’orientation pratique, selon son exposé, consiste à réduire le contexte aux informations qui influencent réellement le résultat et à améliorer la précision des parcours d’exécution afin que l’agent ait besoin d’un nombre moindre de cycles de réflexion. Cela relie directement le coût à la qualité de la recherche et de la récupération des données, et pas seulement au prix du modèle.
Mais déterminer le « contexte minimal utilisable » n’est pas une tâche simple. Gutmann affirme que l’évaluation des données et du modèle doit être menée conjointement afin de savoir quelle partie du contexte améliore effectivement le résultat. Il s’est donc montré sceptique à l’égard des organisations qui prétendent avoir entièrement résolu le problème du contexte, soulignant que Google elle-même ne l’a pas complètement résolu et qu’elle s’appuie sur des évaluations, le suivi des trajectoires des agents, l’amélioration de la recherche et l’enrichissement des données pour déterminer ce qui mérite d’être intégré à chaque tâche.
Ce point intéresse les équipes d’intelligence artificielle, car il met en garde contre le fait de transformer les connaissances organisées ou les schémas de données en une fin en soi. Le fait que les humains considèrent une information comme utile ne prouve pas qu’elle produira un meilleur résultat pour l’agent. La mesure doit partir des résultats et des trajectoires réelles, tout en maintenant l’humain dans la boucle lorsque l’autorité décisionnelle ou le jugement humain sont nécessaires.
L’échelle modifie l’équation des coûts et du rendement
Dans l’environnement de travail traditionnel, il est possible d’estimer approximativement le volume d’utilisation à partir du nombre d’employés et de leurs heures de travail. Les agents, eux, fonctionnent plus rapidement et 24 heures sur 24 ; un seul employé peut disposer de dizaines d’agents, ou l’entreprise peut en avoir des millions, selon le scénario évoqué par Gutmann. L’utilisation et les coûts peuvent donc croître de manière non linéaire, ce qui impose une gouvernance claire de la consommation et une connaissance du rendement produit par chaque utilisation.
Gutmann ne pense pas que le rendement doive être mesuré au nombre de tokens traités. Le critère est de savoir si l’entreprise obtient un résultat différent ou meilleur par rapport à ce qu’elle obtenait auparavant. Il a cité des usages tels que le service client, l’amélioration des opérations de site et de la fiabilité, ainsi que la gestion autonome des réseaux chez Deutsche Telekom, y compris la maintenance proactive. Ces exemples ont été mentionnés dans le dialogue ; ils ne constituent pas des résultats quantitatifs ni une étude comparative publiée dans le cadre de cet article.
Parmi les aspects pratiques abordés par le dialogue figure la réduction du coût de l’expérimentation. Gutmann a indiqué avoir construit, pendant un week-end, un prototype d’une idée qui aurait auparavant pu nécessiter trois à quatre mois de travail d’un ingénieur. Il a précisé que le modèle n’était pas du code prêt pour la production, mais qu’il avait contribué à révéler rapidement les risques de conception et à réduire la probabilité d’investir pendant plusieurs mois dans une mauvaise direction. La valeur ne réside pas dans le remplacement du développement destiné à la production, mais dans l’accélération du test des hypothèses avant l’engagement de ressources plus importantes.
L’agent, une nouvelle personnalité pour la plateforme
Gutmann propose que les équipes chargées des plateformes considèrent l’agent comme une personnalité à servir, aux côtés des développeurs, des scientifiques des données, des ingénieurs des données et des utilisateurs des secteurs opérationnels. Cela signifie que les outils actuels ne seront pas nécessairement transférés tels quels à l’ère des agents, mais que certains de leurs axes resteront essentiels : sécurité et gouvernance, coûts, disponibilité et évolutivité, ainsi que surveillance opérationnelle propre aux agents.
Concrètement, l’entreprise doit savoir ce que fait l’agent dans l’environnement de production, quels outils et quelles données il appelle, combien cela coûte et s’il progresse vers le résultat souhaité. Elle doit également disposer des compétences et des contrôles qui empêchent une utilisation non maîtrisée. Le dialogue indique que l’infrastructure doit transférer une part plus importante de la responsabilité de la prévention des erreurs vers la plateforme, plutôt que de laisser chaque décision opérationnelle à l’utilisateur ou à l’agent.
Gutmann estime que l’intégration de scientifiques des données et d’ingénieurs des données aux équipes chargées des plateformes peut être utile, même si leurs effectifs ne sont pas importants. L’ingénierie des données reste nécessaire pour garantir que des données correctes, gouvernées et exploitables parviennent au bon endroit, tandis que des applications comme la détection des fraudes et la prévision continuent de tirer parti de l’apprentissage automatique traditionnel. Cela confirme que l’approche « l’intelligence artificielle d’abord » n’élimine ni le besoin de qualité des données ni celui d’une expertise spécialisée.
Que devraient apprendre les nouveaux spécialistes ?
À la fin du dialogue, Gutmann a insisté sur l’importance persistante des fondamentaux de l’informatique, notamment les mathématiques, l’architecture des systèmes et la compréhension de la manière dont les technologies sont construites, tout en évoquant également le retour en importance du matériel après des années de concentration sur les logiciels. Il a toutefois ajouté que la maîtrise de la programmation à l’aide d’agents et l’obtention de résultats grâce à eux deviendraient des compétences recherchées, au même titre que la compréhension des problèmes d’entreprise.
Lecture éditoriale de certi.news : le changement réel décrit par l’article n’est pas le lancement d’une nouvelle plateforme ou d’un nouveau modèle, mais le déplacement du goulot d’étranglement, qui passe de « le modèle est-il capable ? » à « comment concevons-nous, contrôlons-nous et mesurons-nous le système ? ». Toutefois, l’entretien ne fournit pas de chiffres indépendants sur les économies de coûts ni de mesures de performance comparables ; ses exemples proviennent également de l’expérience et des représentations des intervenants. Il convient donc de le considérer comme une analyse pratique et une orientation de conception, et non comme une preuve quantitative que toute entreprise réduira ses coûts simplement en augmentant l’utilisation des agents.