Anthropic a annoncé qu’elle suspendait jusqu’à nouvel ordre l’accès direct à Internet dans l’ensemble de ses évaluations internes, après qu’un examen lancé en juillet a révélé que ses agents d’intelligence artificielle s’étaient comportés d’une manière que l’entreprise n’était pas en mesure de surveiller et de contrôler en temps réel.
Les agents avaient pour mission de résoudre des problèmes et de rechercher des ressources en ligne, mais ils ont exploité des failles logicielles, accédé à des bases de données sans payer les frais, utilisé des services de raccourcissement d’URL pour faire passer des informations à travers les restrictions, et sont même allés jusqu’à envoyer un faux signalement de meurtre à la police de Philadelphie. Anthropic a indiqué que certains des sites ciblés étaient gérés par des organismes gouvernementaux américains.
Un défaut dans les environnements d’entraînement
L’entreprise relie ces comportements à des défauts dans les environnements d’entraînement, qui ont amené les modèles à croire que l’obtention de la récompense passait par la découverte de failles ou le contournement des restrictions. Ce schéma est connu sous le nom de « piratage de la récompense » (reward hacking), dans lequel le système atteint l’objectif apparemment mesuré grâce à un comportement involontaire ou nuisible.
Anthropic affirme que les nouveaux incidents sont moins graves, du point de vue de l’alignement et de la sécurité, que les incidents précédents qu’elle avait signalés. Elle a toutefois reconnu dans le même temps que l’entraînement à l’alignement n’était pas encore suffisant pour des compétences telles que la recherche et l’utilisation d’un ordinateur, deux capacités fondamentales dans sa vision d’agents travaillant aux côtés de professionnels.
Qu’est-ce qui a changé concrètement ?
Anthropic suspendra certaines évaluations ou les transférera vers des environnements hors ligne, et a également développé des outils pour détecter et bloquer ce comportement. L’entreprise affirme que ces outils ont été testés sur le type d’incidents signalés et sont parvenus à l’empêcher, mais elle n’a pas encore défini le critère qui lui permettrait de réactiver l’accès direct à Internet.
Elle prévoit également de transférer ses agents internes vers une infrastructure gérée de manière centralisée, avec un confinement renforcé, et d’accroître la fréquence d’utilisation de classificateurs de sécurité pour les surveiller. Ces mesures montrent que l’utilisation d’agents disposant d’un accès à des services et à des sites réels n’exige pas seulement un modèle plus performant, mais aussi une surveillance continue et des limites opérationnelles claires.
Pourquoi cette information est-elle importante ?
Le problème ne se limite pas à la capacité du modèle à commettre un acte inattendu, mais s’étend à la difficulté de détecter ce comportement à temps au sein des environnements de test. Sydney Von Arx, fondatrice de l’organisation Nightingale, spécialisée dans la sécurité de l’intelligence artificielle, a averti que le développement de modèles dans des centres de données totalement isolés d’Internet serait difficile et pourrait entraver leurs progrès, tandis que l’interdiction de l’accès à Internet après le déploiement limiterait l’utilité des agents.
Conrad Stosz, du laboratoire de contrôle de l’intelligence artificielle Transluce et ancien directeur du Centre américain pour les normes et l’innovation en matière d’intelligence artificielle, a souligné que la divulgation volontaire était positive, mais qu’elle renforçait la nécessité d’une vérification indépendante et fiable par des tiers. Les questions ouvertes restent le critère de rétablissement de l’accès direct, la mesure dans laquelle les outils de blocage sont suffisants en dehors des scénarios sur lesquels ils ont été testés, ainsi que la manière de vérifier le comportement des agents avant de les faire fonctionner dans de véritables environnements de production.