OpenAI commencera au cours des prochaines semaines à ajouter un filigrane invisible aux textes produits par ChatGPT et Codex pour les utilisateurs éligibles dans l’Union européenne, afin de se conformer aux règles de transparence prévues par le règlement européen sur l’intelligence artificielle. Le déploiement concernera tous les forfaits, tandis que le marquage des textes ne deviendra pas un paramètre activé par défaut à l’échelle mondiale au lancement.
Les règles de transparence sont entrées en vigueur le 2 août et obligent les entreprises d’intelligence artificielle à distinguer les contenus produits automatiquement d’une manière permettant à d’autres systèmes de les reconnaître. En revanche, les développeurs qui utilisent l’interface de programmation d’OpenAI partout dans le monde peuvent activer dès maintenant cette fonctionnalité sur certains modèles, mais elle est désactivée par défaut.
Comment fonctionne le filigrane ?
Le filigrane ne se présente pas sous la forme d’un symbole ou d’une alerte visible, mais est créé par une modification précise des choix de mots proposés par le modèle. Cette modification laisse un motif qu’un outil de détection spécialisé peut repérer, et le motif reste présent dans le texte lorsqu’il est copié-collé. OpenAI affirme que le filigrane ne révèle pas l’identité de l’utilisateur et que son activation n’a pas entraîné de changement significatif des performances des modèles lors des tests de l’entreprise.
OpenAI a publié simultanément un rapport technique sur sa méthode, baptisée textGrain, rédigé par des chercheurs de l’entreprise et des universités de Pennsylvanie et de Yale. Selon le rapport, la méthode repose sur l’utilisation d’une clé secrète pour classer les probabilités des mots suivants pendant la complétion des phrases, puis sur l’agrégation de centaines de ces modifications afin que le détecteur puisse repérer le motif à l’aide du texte et de la clé.
Les limites de la détection après modification
Le filigrane ne constitue pas dans tous les cas une preuve définitive de l’origine du texte. Lors d’un test mené par OpenAI, le remplacement de 10 % des mots par des synonymes a fait passer le taux de détection d’environ 92 % à 66 %. L’entreprise a également constaté que les passages courts, les réponses mathématiques et les textes traduits étaient plus difficiles à détecter.
OpenAI avertit que l’absence de filigrane ne prouve pas que le texte a été écrit par un humain : le texte peut être trop court, avoir fait l’objet de modifications importantes ou provenir d’un système d’intelligence artificielle d’une autre entreprise. De même, la présence du filigrane peut indiquer qu’un système d’OpenAI a créé ou traité une partie du passage, mais elle ne détermine pas la part de jugement humain, de modification ou de créativité ayant contribué à sa production.
Pourquoi cette information est-elle importante ?
Ce lancement fournit aux institutions européennes un moyen technique supplémentaire d’examiner les contenus de ChatGPT et Codex, mais il ne résout pas à lui seul le problème de la preuve de l’origine du texte. La sensibilité aux modifications, à la traduction et à la longueur du texte signifie que les résultats de la détection doivent être interprétés avec prudence, ce qui a conduit OpenAI à réserver dans un premier temps l’accès aux outils de détection à des chercheurs agréés et à des organisations spécialisées afin d’évaluer leur fiabilité et leurs usages responsables.
Cette initiative intervient deux mois après l’annonce par Anthropic du marquage, à l’échelle mondiale, des textes produits par Claude, une décision qui a suscité les objections de certains utilisateurs estimant que leur contribution aux instructions, au contexte et aux décisions faisait de Claude un outil plutôt qu’un auteur. OpenAI avait auparavant développé une technologie de marquage des textes, mais avait renoncé à la lancer, craignant que les utilisateurs ne se tournent vers des concurrents n’utilisant pas ce marquage, selon un rapport publié par The Wall Street Journal en 2024.