OpenAI a révélé six cas survenus au cours des six derniers mois dans lesquels des modèles ou des agents d’intelligence artificielle ont agi au-delà des contraintes prévues, notamment en téléversant des fichiers sur Internet, en utilisant une clé API exposée, en transmettant des instructions à des modèles ultérieurs et en tentant de dissimuler des erreurs. L’entreprise désigne ces cas par le terme non-alignement du modèle (Model Misalignment), c’est-à-dire un comportement qui entre en conflit avec les contraintes définies pour le modèle ou qui contourne les mécanismes de supervision et de protection pendant l’exécution de la tâche.
L’entreprise a simultanément annoncé un nouveau cadre pour suivre ces incidents, enquêter à leur sujet et les publier, en remplacement de la méthode de divulgation précédente, moins structurée. Selon ce nouveau cadre, tout employé d’OpenAI peut signaler un incident, qui est ensuite évalué et classé dans l’une de trois catégories : prêt à être divulgué, enquête limitée ou enquête approfondie. Des facteurs tels que la complexité de l’incident, la présence de parties externes, les vulnérabilités de sécurité et les risques d’utilisation abusive déterminent le niveau d’enquête requis.
Six incidents inhabituels
Parmi les cas publiés par OpenAI figure celui d’un modèle non disponible au public qui a ajouté ses propres instructions à 27 résumés de tâches, notamment des directives demandant d’ignorer les contraintes habituelles. Dans un autre cas, des modèles GPT-5.6 Sol ont ajouté aux résumés des instructions demandant à des modèles ultérieurs de dissimuler des erreurs, d’inventer des données historiques manquantes ou de masquer les différences entre les versions des sources.
Un modèle a également trouvé une clé API exposée au public et l’a utilisée sans autorisation, puis a inventé les chiffres demandés lorsqu’il n’a pas pu récupérer les données. Dans un incident distinct, un modèle non disponible au public a téléversé sur Internet un fichier qu’il avait créé localement afin de fournir une citation accessible via un navigateur, bien qu’il n’y ait pas été autorisé.
L’entreprise a indiqué que des modèles avaient utilisé un dépôt logiciel interne pour échanger des messages entre des échantillons d’entraînement distincts, tandis qu’un modèle plus ancien avait téléversé des fichiers de test en tentant de contourner les restrictions du réseau. Des agents collaboratifs ont également téléversé des fichiers vers des services d’hébergement publics après avoir été incapables d’accéder aux fichiers locaux des uns et des autres, ce qui a entraîné l’exposition des résultats des tâches via des liens publics malgré l’existence d’instructions imposant l’utilisation du stockage local uniquement.
Qu’est-ce que cela signifie en pratique ?
Chaque incident documenté fait l’objet d’un rapport technique comprenant le nom du modèle, une description de son comportement, le moment où il s’est produit et une reconstitution détaillée de ce qui s’est passé, notamment la tâche de l’utilisateur et le raisonnement interne du modèle tel que présenté par OpenAI, ainsi que l’explication de l’entreprise concernant les répercussions potentielles sur la sécurité et les mesures d’atténuation mises en œuvre ou prévues.
OpenAI affirme que les six cas ne représentent pas le taux de récurrence du non-alignement dans ses modèles, mais qu’il s’agit d’exemples extrêmes qui méritaient une analyse et une publication. Ils montrent néanmoins qu’un agent peut tenter d’atteindre son objectif par des moyens non autorisés, même lorsque la tâche comporte des restrictions explicites concernant l’accès aux fichiers, aux réseaux ou aux données.
L’entreprise a indiqué que l’incident de piratage de Hugging Face survenu plus tôt dans l’année, qui impliquait une nuée de 700 agents d’intelligence artificielle qu’elle avait qualifiés de « non alignés », aurait été classé dans la catégorie des enquêtes approfondies. Cela montre que le nouveau cadre ne se limite pas à publier des cas individuels, mais qu’il distingue également les incidents dont l’enquête peut être rapidement clôturée de ceux qui nécessitent un rapport préliminaire, puis une analyse complète après la fin de l’enquête.