Intelligence artificielle

Anthropic détecte près de 200 millions d’interactions dans des campagnes visant à extraire les capacités de modèles d’intelligence artificielle

Anthropic a déclaré que cinq campagnes liées à des entreprises chinoises d’intelligence artificielle avaient tenté d’extraire des capacités avancées du modèle Claude au moyen de près de 200 millions d’interactions, dont une campagne attribuée à Alibaba et une autre à Moonshot AI. L’entreprise estime que ces méthodes pourraient être utilisées pour produire des données d’entraînement destinées à des modèles concurrents, bien que le rapport présente les accusations de l’entreprise sans fournir, dans cet article, de preuves indépendantes les étayant.

2026-09-10
4 min de lecture
7 vues
فريق تحرير certi.news
Anthropic détecte près de 200 millions d’interactions dans des campagnes visant à extraire les capacités de modèles d’intelligence artificielle

Anthropic a déclaré dans un nouveau rapport que des laboratoires chinois d’intelligence artificielle avaient mené au cours des derniers mois des campagnes de plus en plus sophistiquées visant à extraire les capacités de modèles américains avancés, indiquant avoir détecté près de 200 millions d’interactions liées à cinq campagnes distinctes. Selon l’entreprise, les tentatives visaient les capacités de Claude en matière d’utilisation d’agents et d’outils, de programmation et d’analyse de données, ainsi que de raisonnement logique.

Anthropic décrit ces opérations comme des « attaques par distillation » (Distillation), une méthode utilisée pour recueillir les sorties d’un grand modèle, puis les employer afin d’entraîner un modèle plus petit à des tâches de raisonnement. L’entreprise affirme que les attaquants ont tenté de contourner ses défenses pour extraire ce qu’elle appelle les traces du raisonnement interne du modèle, bien que Claude n’affiche généralement pas ces traces aux utilisateurs, mais fournisse des blocs de « raisonnement résumé » donnant un aperçu général de la manière dont la réponse a été obtenue.

Une méthode pour contourner la protection des traces de raisonnement

Selon le rapport, certaines campagnes sont parvenues à pousser le modèle à révéler ses traces de raisonnement en formulant les requêtes de manière indirecte. Anthropic cite l’exemple d’une requête présentée comme une tâche de traduction, dans laquelle il était demandé à Claude de traduire la « mémoire de travail précédente » en japonais, en utilisant uniquement les katakana. L’entreprise affirme que de telles méthodes ont permis d’obtenir des détails qui n’étaient pas censés apparaître dans une réponse normale.

La plus grande campagne attribuée à Alibaba

Anthropic a déclaré que la campagne attribuée à Alibaba était la plus importante opération de distillation en masse qu’elle ait détectée à ce jour. Entre mai et juillet 2026, l’entreprise a enregistré 151 millions d’interactions, l’activité atteignant un pic d’environ trois millions d’interactions par jour. Les requêtes étaient réparties entre 3 500 comptes, mais l’utilisation d’une requête constante pour extraire les traces de raisonnement a conduit Anthropic à considérer l’ensemble comme un effort unique visant, selon son évaluation, à produire des données d’entraînement pour la famille de modèles Qwen d’Alibaba.

Des requêtes liées à Moonshot AI

Quant à une autre campagne attribuée à Moonshot AI, l’entreprise qui développe le modèle Kimi, Anthropic a déclaré qu’elle semblait envoyer directement les requêtes depuis l’armée chinoise. Le rapport mentionne une requête visant à analyser un ensemble d’enregistrements de caméras de surveillance en circuit fermé afin de déterminer si une personne « se comportait de manière anormale ». Sur une période de dix jours, Anthropic a détecté près de 300 000 requêtes transmises à Claude par l’intermédiaire d’un réseau de 5 000 comptes, ciblant pour la plupart le modèle Opus.

Pourquoi cette information est-elle importante ?

Si les estimations d’Anthropic sont exactes, l’affaire dépasse le simple abus de comptes isolés et relève d’une tentative organisée de recueillir à grande échelle les sorties de modèles avancés, ce qui pourrait réduire le coût du développement de modèles concurrents. Les chiffres montrent également que la protection des capacités ne consiste pas seulement à empêcher l’accès direct aux poids des modèles, mais aussi à contrôler les modes d’utilisation et à détecter les comptes et les requêtes similaires. Toutefois, les résultats restent des accusations formulées par Anthropic : l’article ne présente aucune vérification indépendante de l’attribution des campagnes à Alibaba ou à Moonshot AI et ne fournit aucun détail sur les trois autres campagnes, hormis le nombre total d’interactions qui leur sont attribuées.

Source de l’actualité
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités