Intelligence artificielle

Un laboratoire britannique fondé par des anciens de DeepMind affirme que son agent Faraday a surpassé les modèles d’Anthropic et d’OpenAI dans la reproduction de recherches

La société britannique Inherent affirme que son agent Faraday a réussi à reproduire les résultats d’articles scientifiques publiés, obtenant de meilleures performances lors de son test que Claude Opus 4.8 et GPT-5.5, bien qu’il fonctionne sur un modèle beaucoup plus petit. L’entreprise estime que l’entraînement de l’agent par apprentissage par renforcement pourrait constituer une étape vers des systèmes capables de contribuer à la découverte de nouvelles connaissances scientifiques.

2026-08-22
5 min de lecture
12 vues
فريق تحرير certi.news
Un laboratoire britannique fondé par des anciens de DeepMind affirme que son agent Faraday a surpassé les modèles d’Anthropic et d’OpenAI dans la reproduction de recherches

La société Inherent, un laboratoire d’intelligence artificielle basé à Londres et fondé par d’anciens employés de Google DeepMind, a déclaré que son nouvel agent Faraday avait surpassé des modèles plus grands d’Anthropic et d’OpenAI dans une tâche de reproduction des résultats d’articles scientifiques publiés, sans lui fournir la réponse à l’avance.

Faraday est apparu quelques semaines seulement après la sortie d’Inherent de sa phase furtive, parallèlement à l’annonce par l’entreprise d’une levée de fonds d’amorçage de 50 millions de dollars. La société affirme que l’agent a été comparé à Claude Opus 4.8 d’Anthropic et à GPT-5.5 d’OpenAI, deux systèmes décrits dans l’article comme plus grands et appartenant à la catégorie des modèles avancés.

Un test qui va au-delà de la simple correspondance des résultats

Selon le cofondateur et scientifique en chef Edward Hughes, Inherent ne s’est pas limitée à mesurer la capacité de Faraday à reproduire les résultats. Elle souhaitait également tester ce qu’elle appelle le « goût de la recherche », c’est-à-dire la capacité à estimer quelles expériences méritent d’être réalisées et à les concevoir de manière appropriée. L’entreprise considère la reproduction des résultats d’une recherche publiée comme un exercice pratique courant pour les scientifiques, puisque de nombreux doctorants commencent par cette tâche.

Faraday fonctionne sur un modèle Qwen 3.6 qui ne compte que 27 milliards de paramètres, selon l’article, tandis que la comparaison portait sur des modèles beaucoup plus grands. Le nombre de paramètres est généralement utilisé comme indicateur approximatif de la taille du modèle et des coûts de son entraînement, mais ce chiffre seul ne suffit pas à prouver la supériorité d’un système sur un autre, en particulier en l’absence de détails complets sur le test, ses données ou la méthode de calcul des résultats.

L’apprentissage par renforcement plutôt que l’enseignement détaillé des étapes de recherche

Inherent s’appuie largement sur l’apprentissage par renforcement, dans lequel le système reçoit des récompenses pour les bons résultats plutôt que de se voir fournir un ensemble de règles détaillées sur la manière de mener une recherche scientifique. L’entreprise mise sur le fait que cette approche pourrait aider ses agents à se généraliser à plusieurs domaines scientifiques, au lieu de les cantonner à l’imitation de ce qu’ils ont appris sur les méthodes de recherche précédentes.

L’entreprise affirme que son objectif à long terme est de construire un agent fonctionnant comme un scientifique en intelligence artificielle et contribuant à la découverte de nouvelles connaissances, plutôt que de simplement vérifier des résultats connus. C’est pourquoi elle n’a pas développé son propre outil de programmation, mais a fait utiliser à Faraday GPT-5.5 Codex, afin de simuler la dépendance des chercheurs à l’égard des logiciels existants plutôt que de construire chaque outil à partir de zéro.

Pourquoi cette information est-elle importante ?

Si les résultats du test sont confirmés selon une méthodologie reproductible, ils pourraient indiquer que des agents spécialisés peuvent obtenir de solides performances avec des modèles plus petits, lorsqu’ils bénéficient d’un entraînement adapté ainsi que de capacités de sélection et d’évaluation des expériences. Cela déplace l’attention au-delà de la seule taille du modèle, vers la conception de l’agent, la manière dont il est récompensé et l’environnement de travail dans lequel il évolue.

Mais la source rapporte l’affirmation de l’entreprise sans fournir suffisamment de détails pour permettre une évaluation indépendante de la comparaison, et elle ne précise pas non plus l’étendue des articles scientifiques ou les domaines couverts par le test. La portée de la « supériorité » reste donc liée au test spécifique utilisé et ne démontre pas encore la capacité de Faraday à découvrir de nouvelles connaissances ou à travailler efficacement dans toutes les disciplines.

Inherent compte environ 12 employés travaillant en présentiel dans son bureau du quartier de King’s Cross à Londres, et prévoit de porter cet effectif à environ 20 ou 25 personnes d’ici la fin de l’année. Hughes a également évoqué, à titre personnel, l’impact des restrictions liées au « congé obligatoire » au Royaume-Uni sur le transfert des employés vers des entreprises concurrentes, ce qui pourrait affecter la capacité du laboratoire à recruter des chercheurs chez DeepMind et ailleurs.

Source de l’actualité
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités