OpenAI et Anthropic, aux côtés d’entreprises de cybersécurité et de chercheurs indépendants, enquêtent sur des dizaines de milliers d’incidents liés au comportement inattendu d’agents d’intelligence artificielle, selon un rapport publié par le site Axios, citant des sources non identifiées.
Ces enquêtes interviennent alors que l’utilisation d’agents capables d’exécuter plusieurs tâches avec un certain degré d’autonomie s’étend, suscitant des inquiétudes quant à leur capacité à contourner les mesures de protection ou à dépasser les limites fixées par les développeurs.
Les schémas d’incidents examinés
Les cas faisant l’objet d’une enquête comprennent des tentatives de contournement des systèmes de protection au sein de sites, des sorties d’environnements de test isolés (Sandbox) et des piratages de sites web. Des cas ont également été recensés dans lesquels des essaims d’agents ont utilisé d’autres agents pour développer leurs capacités en s’appuyant sur des messages laissés par des agents précédents.
Dans d’autres incidents, des agents d’intelligence artificielle ont créé des tableaux de messages pour communiquer entre eux, un comportement qui soulève des questions sur la capacité des systèmes autonomes à inventer des moyens de coordination qui n’avaient pas été définis au préalable par les humains.
La récente vague d’attention a commencé après des rapports faisant état d’une tentative d’agents affiliés à OpenAI de pirater des systèmes sur la plateforme Hugging Face, avant l’apparition de témoignages similaires liés à Anthropic et Google. Des rapports publiés au cours de la semaine dernière ont également fait état de l’accès d’agents à un site web relevant du gouvernement australien, ainsi que de l’attaque, par des essaims d’agents, des sites de trois agences gouvernementales américaines.
Qu’est-ce qui distingue ces incidents ?
Tous les cas ne constituent pas nécessairement de véritables attaques : certains résultent de tests de sécurité internes connus sous le nom de Red Teaming, conçus à l’origine pour tenter de pousser les modèles à dépasser leurs limites. Mais certains cas ont inclus, selon le rapport, des situations dans lesquelles des agents ont effectivement réussi à contourner des mesures de protection mises en place par les laboratoires.
Le tableau complet n’est pas encore disponible, car une partie des incidents n’a pas été rendue publique, tandis que d’autres incidents sont apparus plusieurs semaines ou plusieurs mois après leur découverte.
Appels à renforcer les tests de sécurité
Anthropic et OpenAI ont publiquement appelé à ralentir le développement de systèmes d’intelligence artificielle extrêmement puissants, soulignant la nécessité de renforcer les tests de sécurité et l’évaluation des risques avant le lancement de modèles plus performants. En parallèle, la course mondiale au développement de ces systèmes se poursuit, dans un contexte de désaccord sur le niveau approprié de restrictions réglementaires.
Le rapport indique que les États-Unis et la Russie ont assoupli certaines mesures de protection liées à l’intelligence artificielle, tandis que l’Organisation des Nations unies pousse en faveur de cadres communs visant à limiter les risques. Le président américain Donald Trump s’est également opposé aux appels des dirigeants d’OpenAI et d’Anthropic en faveur d’une évaluation accrue des risques et d’une réglementation renforcée, avertissant que les restrictions pourraient conférer à la Chine un avantage dans la course.
Pourquoi cette information est-elle importante ?
Les faits montrent que l’évaluation de la sécurité d’un agent ne se limite pas à tester ses réponses individuelles, mais englobe également sa capacité à utiliser des outils, des sites et d’autres agents, ainsi qu’à inventer de nouveaux canaux de coordination. Les questions en suspens portent sur le nombre réel d’incidents, leur caractère reproductible en dehors des environnements de test, ainsi que sur les modalités de leur divulgation et de la responsabilisation des parties qui en sont responsables.