Anthropic a publié un article de recherche intitulé Automated Researchers Can Reliably Mitigate Alignment Failures, qui présente une expérience dans laquelle des systèmes d’intelligence artificielle automatisés ont été utilisés pour améliorer les performances d’un modèle sur des tests mesurant des comportements spécifiques incompatibles avec les objectifs d’alignement. Selon l’article, les systèmes ont amélioré les performances sur les dix tests, sans nuire aux performances globales du modèle.
La recherche est dirigée par Chen Yueh-Han, membre du programme d’Anthropic. Le système reproduit une sorte de cycle de recherche traditionnel : il consulte la littérature disponible, propose une méthode pour améliorer le modèle, puis l’entraîne avec la méthode proposée pendant 30 minutes. Après chaque cycle, les méthodes efficaces sont retenues pour les étapes suivantes, tandis que les méthodes inefficaces sont écartées, ce qui permet de répéter rapidement les expériences à grande échelle.
Qu’est-ce qui a changé en pratique ?
La valeur principale de l’expérience ne réside pas seulement dans l’utilisation d’un modèle pour entraîner un autre modèle, mais dans le transfert d’une partie du processus de recherche à un système automatisé. Au lieu de se limiter à exécuter les instructions définies par le chercheur, l’intelligence artificielle tente d’identifier des pistes de recherche, de les tester et de conserver celles dont le succès est démontré.
L’article affirme que ces résultats constituent un premier élément indiquant que la recherche automatisée sur l’alignement après l’entraînement pourrait devenir réalisable dans un avenir proche. Il s’agit de développer le comportement du modèle après la phase d’entraînement initiale afin de réduire les cas où il n’est pas conforme aux objectifs qui lui sont fixés, en s’appuyant sur des critères de test et des méthodes d’entraînement reproductibles.
Une comparaison directe avec la recherche humaine
L’article va au-delà de la présentation d’une amélioration des résultats des tests, puisqu’il compare ce qu’il appelle Automated Alignment Researcher, ou AAR, aux chercheurs humains. Selon les résultats qui y sont présentés, la meilleure méthode proposée par le système AAR a, en moyenne et sur une période de six heures, surpassé les méthodes proposées par des chercheurs humains expérimentés. L’article indique également que les orientations de recherche guidées par des humains n’ont pas produit de performances supérieures.
La comparaison comporte aussi un volet économique : l’article estime le coût d’utilisation d’AAR à environ 4 dollars par heure d’inférence de l’interface de programmation d’applications, contre 150 dollars par heure versés aux chercheurs humains dans l’expérience. Ces chiffres ne prouvent pas que les systèmes automatisés peuvent remplacer les chercheurs, mais ils expliquent pourquoi les laboratoires souhaitent accroître l’ampleur des expériences automatisées lorsque la tâche est mesurable.
Pourquoi cela ne signifie-t-il pas que l’intelligence artificielle s’améliore sans limites ?
L’approche présentée se rapproche de l’idée d’une amélioration itérative autonome, c’est-à-dire que des modèles utilisent d’autres systèmes pour améliorer leurs méthodes d’entraînement ou leur comportement. Toutefois, l’article lui-même fixe des limites claires à cette conclusion. Le système ne peut pas améliorer ce que les critères ne mesurent pas correctement. Si les tests d’alignement ne reflètent pas les véritables objectifs d’alignement, l’amélioration des résultats peut conduire à améliorer uniquement les performances sur l’indicateur, et non à résoudre le problème que celui-ci est censé mesurer.
Cette approche exige également des efforts continus pour créer, maintenir et élargir les critères, ainsi que pour actualiser la littérature sur laquelle s’appuie le chercheur automatisé. L’élément humain reste donc présent pour déterminer ce qui doit être mesuré, évaluer la validité des éléments et des méthodes utilisés, et vérifier si les résultats peuvent être généralisés au-delà de l’ensemble de tests.
La lecture de certi.news
Le résultat important est ici que l’automatisation de la recherche sur l’alignement est passée d’une idée générale à une expérience précise, avec des chiffres et des comparaisons susceptibles d’être discutés : dix tests, des cycles d’entraînement de 30 minutes et une supériorité moyenne sur les propositions humaines au cours de six heures, selon ce qu’a rapporté l’article. Toutefois, la portée pratique reste liée à la qualité des critères qui orientent le système. L’amélioration mesurée ne constitue pas, à elle seule, la preuve que le modèle est devenu plus sûr dans tous les contextes, pas plus que la comparaison entre le coût de l’inférence et celui des chercheurs ne tranche la question de la supervision ou de la responsabilité scientifique.
En conséquence, l’article fournit un indicateur solide de la possibilité d’accélérer le cycle de recherche sur l’alignement, mais non la preuve que les laboratoires sont près de se passer de chercheurs humains. La question ouverte qu’il laisse est de savoir si les systèmes automatisés pourront traiter des objectifs d’alignement plus réalistes et plus complexes, au lieu d’optimiser des indicateurs spécifiques conçus au préalable par des humains.