Inteligencia artificial

Anthropic detecta casi 200 millones de interacciones en campañas para extraer capacidades de modelos de inteligencia artificial

Anthropic afirmó que cinco campañas vinculadas a empresas chinas de inteligencia artificial intentaron extraer capacidades avanzadas del modelo Claude mediante casi 200 millones de interacciones, incluida una campaña atribuida a Alibaba y otra a Moonshot AI. La empresa considera que estas técnicas podrían utilizarse para producir datos de entrenamiento para modelos competidores, aunque el informe presenta las acusaciones de la compañía y el material no aporta pruebas independientes al respecto.

2026-09-10
4 min de lectura
7 visitas
فريق تحرير certi.news
Anthropic detecta casi 200 millones de interacciones en campañas para extraer capacidades de modelos de inteligencia artificial

Anthropic afirmó en un nuevo informe que laboratorios chinos de inteligencia artificial llevaron a cabo durante los últimos meses campañas cada vez más complejas para extraer capacidades de modelos estadounidenses avanzados, y señaló que detectó casi 200 millones de interacciones relacionadas con cinco campañas distintas. Según la empresa, los intentos tenían como objetivo las capacidades de Claude para operar agentes y utilizar herramientas, así como la programación, el análisis de datos y el razonamiento lógico.

Anthropic describe estas operaciones como «ataques de destilación» (Distillation), una técnica utilizada para recopilar las salidas de un modelo grande y emplearlas después para entrenar un modelo más pequeño en tareas de razonamiento. La empresa afirma que los atacantes intentaron sortear sus defensas para extraer lo que denomina rastros del razonamiento interno del modelo, aunque Claude normalmente no muestra estos rastros a los usuarios, sino que ofrece bloques de «razonamiento resumido» que proporcionan una visión general del proceso seguido para llegar a la respuesta.

Un método para eludir la protección de los rastros del razonamiento

Según el informe, algunas campañas lograron que el modelo revelara rastros del razonamiento mediante la formulación indirecta de las solicitudes. Anthropic presenta como ejemplo una solicitud planteada como una tarea de traducción, en la que se pidió a Claude traducir la «memoria de trabajo previa» al japonés escrito únicamente en katakana. La empresa afirma que estas técnicas permitieron obtener detalles que no deberían haber aparecido en una respuesta normal.

La mayor campaña fue atribuida a Alibaba

Anthropic afirmó que la campaña atribuida a Alibaba fue la mayor operación de destilación masiva que ha detectado hasta ahora. Entre mayo y julio de 2026, la empresa registró 151 millones de interacciones, y la actividad alcanzó un máximo de aproximadamente tres millones de interacciones diarias. Las solicitudes se distribuyeron entre 3500 cuentas, pero el uso de una solicitud fija para extraer rastros del razonamiento llevó a Anthropic a considerarlo un único esfuerzo dirigido, según su evaluación, a producir materiales de entrenamiento para la familia de modelos Qwen de Alibaba.

Solicitudes vinculadas a Moonshot AI

En cuanto a otra campaña atribuida a Moonshot AI, la empresa desarrolladora del modelo Kimi, Anthropic afirmó que parecía dirigir las solicitudes directamente desde el ejército chino. El informe menciona una solicitud para analizar un conjunto de grabaciones de cámaras de vigilancia cerradas y determinar si una persona «se comportaba de manera anormal». Durante un periodo de diez días, Anthropic detectó cerca de 300.000 solicitudes enviadas a Claude a través de una red de 5000 cuentas, dirigidas en su mayoría al modelo Opus.

¿Por qué es importante esta noticia?

Si las estimaciones de Anthropic son correctas, el caso va más allá del uso indebido de cuentas aisladas y apunta a un intento organizado de recopilar a gran escala las salidas de modelos avanzados, lo que podría reducir el coste de desarrollar modelos competidores. Las cifras también revelan que la protección de las capacidades no consiste únicamente en impedir el acceso directo a los pesos del software, sino también en controlar los patrones de uso y detectar cuentas y solicitudes similares. No obstante, las conclusiones siguen siendo acusaciones de Anthropic; el material no presenta una verificación independiente de la atribución de las campañas a Alibaba o Moonshot AI, ni ofrece detalles sobre las otras tres campañas, aparte del total de interacciones que se les atribuye.

Fuente de la noticia
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias