A Anthropic afirmou em um novo relatório que laboratórios chineses de inteligência artificial realizaram nos últimos meses campanhas cada vez mais sofisticadas para extrair capacidades de modelos americanos avançados, indicando que detectou cerca de 200 milhões de interações relacionadas a cinco campanhas separadas. Segundo a empresa, as tentativas tinham como alvo as capacidades do Claude de operar agentes e usar ferramentas, além de programação, análise de dados e raciocínio lógico.
A Anthropic descreve essas operações como «ataques de destilação» (Distillation), uma técnica usada para coletar as saídas de um modelo grande e depois empregá-las no treinamento de um modelo menor para tarefas de raciocínio. A empresa afirma que os atacantes tentaram contornar suas defesas para extrair o que chama de vestígios do raciocínio interno do modelo, embora o Claude normalmente não exiba esses vestígios aos usuários, mas apresente blocos de «raciocínio resumido» que oferecem uma visão geral de como a resposta foi alcançada.
Uma técnica para contornar a proteção dos vestígios de raciocínio
Segundo o relatório, algumas campanhas conseguiram induzir o modelo a revelar vestígios do raciocínio ao formular os pedidos de maneira indireta. A Anthropic cita como exemplo um pedido apresentado como uma tarefa de tradução, no qual se solicitava ao Claude que traduzisse a «memória de trabalho anterior» para o japonês escrito apenas em katakana. A empresa afirma que técnicas desse tipo permitiram obter detalhes que supostamente não deveriam aparecer em uma resposta normal.
A maior campanha foi atribuída à Alibaba
A Anthropic afirmou que a campanha atribuída à Alibaba foi a maior operação de destilação em massa que detectou até o momento. Entre maio e julho de 2026, a empresa registrou 151 milhões de interações, e a atividade atingiu o pico de cerca de três milhões de interações por dia. Os pedidos foram distribuídos por 3.500 contas, mas o uso de um pedido fixo para extrair vestígios do raciocínio levou a Anthropic a considerá-los um único esforço destinado, segundo sua avaliação, a produzir materiais de treinamento para a família de modelos Qwen da Alibaba.
Pedidos ligados à Moonshot AI
Quanto a outra campanha atribuída à Moonshot AI, empresa desenvolvedora do modelo Kimi, a Anthropic afirmou que ela parecia direcionar os pedidos diretamente do exército chinês. O relatório menciona um pedido para analisar um conjunto de gravações de câmeras de vigilância fechadas a fim de determinar se alguém estava «se comportando de maneira anormal». Durante um período de dez dias, a Anthropic detectou cerca de 300 mil pedidos encaminhados ao Claude por meio de uma rede de cinco mil contas, tendo como alvo, em sua maioria, o modelo Opus.
Por que esta notícia é importante?
Se as estimativas da Anthropic estiverem corretas, a questão vai além do uso indevido de contas isoladas e chega a uma tentativa organizada de coletar, em grande escala, as saídas de modelos avançados, o que poderia reduzir o custo do desenvolvimento de modelos concorrentes. Os números também revelam que a proteção das capacidades não envolve apenas impedir o acesso direto aos pesos do software, mas também controlar os padrões de uso e detectar contas e pedidos semelhantes. Ainda assim, os resultados continuam sendo acusações feitas pela Anthropic; o material não apresenta uma verificação independente da atribuição das campanhas à Alibaba ou à Moonshot AI, nem fornece detalhes sobre as outras três campanhas além do total de interações atribuído a elas.