La suppression des garde-fous de sécurité des modèles d’intelligence artificielle à poids ouverts est désormais disponible via un service commercial direct, après le lancement par Abliteration.ai d’une plateforme hébergeant des versions modifiées de modèles avancés et permettant de les utiliser depuis un navigateur ou via une interface de programmation d’application. La plateforme comprend notamment une version du modèle GLM-5.3, récemment lancé par Z.ai, après suppression de sa tendance à refuser l’exécution de demandes malveillantes.
Le service repose sur une technique connue sous le nom d’« abliteration », une pratique répandue depuis plusieurs années parmi les chercheurs et développeurs travaillant sur les modèles à poids ouverts. Des milliers de modèles modifiés de cette manière existent sur Hugging Face, mais Abliteration.ai fait passer cette pratique d’un environnement qui exige de télécharger le modèle et de fournir l’infrastructure informatique nécessaire à son fonctionnement à un service prêt à l’emploi qui réduit les obstacles pour les utilisateurs.
Justification sécuritaire et risques parallèles
L’entreprise affirme que son objectif est de permettre des activités autorisées de cybersécurité offensive, des tests en équipe rouge et l’évaluation d’agents, c’est-à-dire des tâches que d’autres modèles peuvent refuser d’exécuter. La logique sur laquelle elle s’appuie est claire dans le domaine de la défense : il est impossible de tester un comportement que l’équipe ne peut pas reproduire, et un modèle qui refuse de produire un code d’exploitation efficace peut être moins utile pour simuler un véritable attaquant.
Mais la suppression du refus ne permet pas automatiquement de distinguer le chercheur en sécurité de l’utilisateur animé d’intentions malveillantes. Lors d’un test réalisé par TechCrunch, le modèle modifié a répondu à des demandes concernant le vol de mots de passe enregistrés dans Chrome et la production d’informations sur la culture d’un agent pathogène humain dangereux. Ce résultat ne publie pas de description opérationnelle des demandes, mais il montre concrètement que la barrière supprimée n’était pas purement formelle.
Une start-up et des contrôles encore incomplets
Abliteration.ai a été fondée à la fin de l’année dernière et officiellement constituée en mars. Le cofondateur Devon a déclaré que l’entreprise avait conclu plusieurs accords avec des fournisseurs de services cloud et finançait ses activités grâce aux revenus de ses clients, sans avoir encore levé de fonds en capital-risque, malgré l’ouverture de discussions à ce sujet. La source a refusé de publier le nom complet de Devon, car celui-ci travaille encore pour une autre entreprise.
La plateforme propose une couche de modération optionnelle grâce à laquelle les clients peuvent ajouter les garde-fous de leur choix, tandis que la plateforme elle-même comprend certaines restrictions limitées. Devon a déclaré travailler à l’ajout de contrôles destinés à empêcher la violence, mais l’entreprise n’applique actuellement aucune procédure de vérification de l’identité du client (KYC) allant au-delà de l’enregistrement de la carte bancaire utilisée pour le paiement.
Qu’est-ce qui change concrètement ?
Devon affirme que les clients de l’entreprise comprennent des start-up britanniques et européennes spécialisées dans les tests en équipe rouge, qui aident des banques, des compagnies aériennes et d’autres organisations liées aux infrastructures critiques. Il estime que fournir aux défenseurs des outils similaires à ceux que pourraient utiliser les attaquants peut accélérer l’évaluation des agents et des systèmes défensifs.
Cette évaluation ne fait toutefois pas consensus. Ahmed Aly, directeur général de Fabraix, a déclaré que son entreprise s’appuyait davantage sur l’affinage des modèles ouverts et que la suppression des garde-fous pouvait réduire certaines connaissances et capacités. Alessio Lomuscio, de Safe Intelligence, estime que les modèles modifiés peuvent être utiles pour susciter certains comportements lors de tests de résistance, tandis que David Slater, d’Armadin, a déclaré que son entreprise ne les utilisait pas actuellement, tout en continuant à étudier la technique.
La question ouverte de la gouvernance
Le service révèle un paradoxe difficile à résoudre par la seule technique : la mise à disposition de modèles sans restrictions peut aider les défenseurs à comprendre les dommages, mais elle réduit également le coût d’accès à des capacités susceptibles d’être détournées. Andrew Yoon, de l’organisation CivAI, a proposé que les gouvernements obligent les fournisseurs de services à utiliser des classificateurs pour détecter les activités malveillantes dans les domaines de la cybersécurité et des armes biologiques, et qu’ils imposent aux locataires d’unités de traitement graphique avancées de vérifier l’identité des clients et de refuser l’accès en présence d’indices d’utilisation abusive.
L’information la plus importante ici n’est pas que la suppression des garde-fous soit possible ; cela est connu dans la communauté des modèles ouverts. La nouveauté réside dans sa transformation en un service hébergé et facile à utiliser avant l’achèvement des règles définissant la responsabilité, la vérification des clients et les limites de l’usage défensif. Son impact réel sur les tests de sécurité restera discuté, notamment en raison de l’existence d’alternatives telles que l’affinage et de la possibilité que le processus lui-même réduise certaines capacités du modèle.