Anthropic prévoit d’équiper les futurs modèles Claude d’un mécanisme de filigrane pour les textes, permettant à toute personne disposant de la clé appropriée d’estimer la probabilité que Claude ait participé à la création du texte. L’entreprise a expliqué dans une publication datée du 14 août 2026 que le filigrane ne serait pas visible pour les lecteurs, qu’il n’ajouterait ni caractères cachés ni données d’identification, et qu’il ne nécessiterait pas de jetons supplémentaires ni n’augmenterait le coût d’exécution du modèle.
Cette mesure s’inscrit dans le cadre de la mise en conformité d’Anthropic avec la législation de l’Union européenne sur l’intelligence artificielle. En juillet 2026, l’entreprise, ainsi que d’autres grands fournisseurs de modèles et environ 190 entités signataires au total, avait signé le code de bonnes pratiques européen sur la transparence des contenus générés par l’intelligence artificielle. Selon Anthropic, l’Union européenne impose depuis le 2 août aux fournisseurs d’intelligence artificielle qui desservent son marché d’étiqueter les contenus générés automatiquement.
Comment fonctionne le filigrane ?
Les modèles de langage génèrent le texte mot après mot et choisissent à chaque étape parmi plusieurs mots possibles. Lorsque plusieurs options sont proches en termes de sens et de qualité, le filigrane utilise une clé et un ensemble de mots précédents pour déterminer la source d’aléa qui tranche le choix. Le choix reste ainsi pratiquement aléatoire, mais la séquence de mots laisse un motif qui peut être détecté ultérieurement à l’aide de la clé.
Anthropic affirme que ce mécanisme ne pousse pas Claude à choisir des mots qu’il n’aurait normalement pas utilisés et ne le rend pas systématiquement partial en faveur d’un mot particulier. L’entreprise compare cela à l’utilisation d’une suite de chiffres provenant de la valeur de pi plutôt qu’au lancer de dés : le résultat semble aléatoire, mais l’analyse de la série de résultats peut révéler la source de l’aléa.
Pratiquement aucun effet sur la qualité du texte
Selon des tests internes, Anthropic n’a observé aucun effet sur le contenu, la créativité ou la lisibilité des textes de Claude. L’entreprise fait également référence à l’étude SynthID-Text, qui a testé la technologie sur une partie du trafic de Gemini et n’a trouvé aucune différence statistiquement significative entre les évaluations des textes filigranés et non filigranés. Dans une étude contrôlée, des évaluateurs humains n’ont pas pu observer de différence de qualité en comparant les réponses côte à côte.
L’entreprise confirme que le filigrane ne ralentit les modèles que de manière négligeable et ne rend pas le service plus coûteux, puisqu’il ne génère pas de jetons supplémentaires. Il ne contient pas non plus d’informations susceptibles de révéler l’identité de l’utilisateur, son organisation ou ses conversations.
Limites de la détection et cas de l’édition et de la programmation
L’efficacité de la détection dépend de la longueur du texte et du nombre de décisions pour lesquelles le modèle dispose de plusieurs options appropriées. La détection est donc moins efficace sur les échantillons courts et dans les passages factuels qui n’admettent qu’une seule réponse exacte, comme la mention du nom correct d’une œuvre d’Isaac Newton. Il en va de même pour la simple correction linguistique, car la plupart des mots restent écrits par l’utilisateur et le filigrane ne trouve pas suffisamment d’éléments sur lesquels s’appuyer.
En programmation, le filigrane n’est généralement pas appliqué lorsque la sortie exacte est essentielle, car la modification d’un mot ou d’un symbole peut rendre le code inutilisable. Il peut toutefois apparaître dans des sections comportant des choix arbitraires, comme les commentaires de code, avec un effet négligeable sur le code lui-même. En revanche, les traductions générées par Claude portent le filigrane, car le modèle en choisit tous les mots.
Disponibilité et portée de ce que prouve le filigrane
Anthropic travaille à fournir une interface de programmation permettant de détecter le filigrane, mais n’a pas encore précisé les détails de sa mise en œuvre. Le filigrane sera appliqué dans le monde entier lors de son lancement, car l’entreprise ne dispose actuellement d’aucune méthode durable pour le limiter par région. Elle travaille également à l’ajouter aux modèles Claude lancés avant le 2 août 2026, en tirant parti de la période de transition prévue par la législation européenne, et prévoit de le faire au cours des prochains mois.
Le filigrane ne prouve pas que Claude a entièrement écrit le texte : il indique seulement la probabilité qu’il ait participé à sa production ou à son traitement et ne distingue pas l’écriture originale de la révision approfondie. La réécriture complète du texte peut supprimer le filigrane, tandis qu’une modification légère peut ne pas le supprimer. Le filigrane ne modifie ni les droits de l’utilisateur, ni la propriété du contenu, ni la responsabilité juridique qui s’y rapporte.
Pour les fichiers pris en charge, tels que PNG, JPG et SVG, Claude ajoutera des informations d’authenticité du contenu sous la forme d’une note signée cryptographiquement dans les métadonnées du fichier, conformément à la norme ouverte C2PA. Anthropic affirme que ces données ne modifient pas le fichier et ne contiennent aucune information d’identification. Elles peuvent être lues par les outils compatibles avec C2PA.