Anthropic a déclaré dans un nouveau rapport que des laboratoires chinois d’intelligence artificielle avaient mené au cours des derniers mois des campagnes de plus en plus sophistiquées visant à extraire les capacités de modèles américains avancés, indiquant avoir détecté près de 200 millions d’interactions liées à cinq campagnes distinctes. Selon l’entreprise, les tentatives visaient les capacités de Claude en matière d’utilisation d’agents et d’outils, de programmation et d’analyse de données, ainsi que de raisonnement logique.
Anthropic décrit ces opérations comme des « attaques par distillation » (Distillation), une méthode utilisée pour recueillir les sorties d’un grand modèle, puis les employer afin d’entraîner un modèle plus petit à des tâches de raisonnement. L’entreprise affirme que les attaquants ont tenté de contourner ses défenses pour extraire ce qu’elle appelle les traces du raisonnement interne du modèle, bien que Claude n’affiche généralement pas ces traces aux utilisateurs, mais fournisse des blocs de « raisonnement résumé » donnant un aperçu général de la manière dont la réponse a été obtenue.
Une méthode pour contourner la protection des traces de raisonnement
Selon le rapport, certaines campagnes sont parvenues à pousser le modèle à révéler ses traces de raisonnement en formulant les requêtes de manière indirecte. Anthropic cite l’exemple d’une requête présentée comme une tâche de traduction, dans laquelle il était demandé à Claude de traduire la « mémoire de travail précédente » en japonais, en utilisant uniquement les katakana. L’entreprise affirme que de telles méthodes ont permis d’obtenir des détails qui n’étaient pas censés apparaître dans une réponse normale.
La plus grande campagne attribuée à Alibaba
Anthropic a déclaré que la campagne attribuée à Alibaba était la plus importante opération de distillation en masse qu’elle ait détectée à ce jour. Entre mai et juillet 2026, l’entreprise a enregistré 151 millions d’interactions, l’activité atteignant un pic d’environ trois millions d’interactions par jour. Les requêtes étaient réparties entre 3 500 comptes, mais l’utilisation d’une requête constante pour extraire les traces de raisonnement a conduit Anthropic à considérer l’ensemble comme un effort unique visant, selon son évaluation, à produire des données d’entraînement pour la famille de modèles Qwen d’Alibaba.
Des requêtes liées à Moonshot AI
Quant à une autre campagne attribuée à Moonshot AI, l’entreprise qui développe le modèle Kimi, Anthropic a déclaré qu’elle semblait envoyer directement les requêtes depuis l’armée chinoise. Le rapport mentionne une requête visant à analyser un ensemble d’enregistrements de caméras de surveillance en circuit fermé afin de déterminer si une personne « se comportait de manière anormale ». Sur une période de dix jours, Anthropic a détecté près de 300 000 requêtes transmises à Claude par l’intermédiaire d’un réseau de 5 000 comptes, ciblant pour la plupart le modèle Opus.
Pourquoi cette information est-elle importante ?
Si les estimations d’Anthropic sont exactes, l’affaire dépasse le simple abus de comptes isolés et relève d’une tentative organisée de recueillir à grande échelle les sorties de modèles avancés, ce qui pourrait réduire le coût du développement de modèles concurrents. Les chiffres montrent également que la protection des capacités ne consiste pas seulement à empêcher l’accès direct aux poids des modèles, mais aussi à contrôler les modes d’utilisation et à détecter les comptes et les requêtes similaires. Toutefois, les résultats restent des accusations formulées par Anthropic : l’article ne présente aucune vérification indépendante de l’attribution des campagnes à Alibaba ou à Moonshot AI et ne fournit aucun détail sur les trois autres campagnes, hormis le nombre total d’interactions qui leur sont attribuées.