Anthropic заявила в новом отчёте, что китайские лаборатории искусственного интеллекта в последние месяцы проводили всё более сложные кампании по извлечению возможностей из передовых американских моделей, отметив, что компания обнаружила около 200 миллионов взаимодействий, связанных с пятью отдельными кампаниями. По словам компании, попытки были направлены на возможности Claude в области работы агентов и использования инструментов, программирования и анализа данных, а также логического рассуждения.
Anthropic описывает эти операции как «атаки дистилляции» (Distillation) — метод, используемый для сбора результатов работы большой модели и последующего применения их при обучении меньшей модели задачам рассуждения. Компания утверждает, что злоумышленники пытались обойти её защитные механизмы, чтобы извлечь то, что она называет следами внутреннего рассуждения модели, хотя Claude обычно не показывает пользователям эти следы, а предоставляет блоки «обобщённого рассуждения», дающие общий обзор пути к ответу.
Метод обхода защиты следов рассуждения
Согласно отчёту, некоторым кампаниям удалось побудить модель раскрывать следы рассуждения с помощью косвенной формулировки запросов. Anthropic приводит пример запроса, представленного как задание на перевод, в котором Claude предлагалось перевести «предыдущую рабочую память» только на японский язык, записанный катаканой. Компания утверждает, что такие методы позволяли получать детали, которые не должны были появляться в обычном ответе.
Крупнейшая кампания приписывается Alibaba
Anthropic заявила, что кампания, приписываемая Alibaba, была крупнейшей массовой операцией по дистилляции из всех обнаруженных компанией на данный момент. С мая по июль 2026 года компания зарегистрировала 151 миллион взаимодействий, а активность достигала пика примерно в три миллиона взаимодействий в день. Запросы распределялись между 3500 аккаунтами, однако использование фиксированного запроса для извлечения следов рассуждения побудило Anthropic считать их одной операцией, направленной, согласно её оценке, на создание обучающих материалов для семейства моделей Qwen, принадлежащего Alibaba.
Запросы, связанные с Moonshot AI
Что касается другой кампании, приписываемой Moonshot AI — разработчику модели Kimi, — Anthropic заявила, что она, по-видимому, направляла запросы непосредственно от китайских военных. В отчёте упоминается запрос на анализ набора записей с закрытых камер наблюдения, чтобы определить, «ведёт ли себя человек ненормально». В течение десяти дней Anthropic обнаружила около 300 тысяч запросов, переданных Claude через сеть из пяти тысяч аккаунтов; большинство из них были направлены на модель Opus.
Почему эта новость важна?
Если оценки Anthropic верны, речь идёт не просто о злоупотреблении отдельными аккаунтами, а об организованной попытке в больших масштабах собирать результаты работы передовых моделей, что может снизить стоимость разработки конкурирующих моделей. Кроме того, эти цифры показывают, что защита возможностей связана не только с предотвращением прямого доступа к программным весам, но и с контролем моделей использования, выявлением аккаунтов и схожих запросов. Тем не менее результаты остаются обвинениями со стороны Anthropic: материал не содержит независимой проверки того, что кампании действительно были связаны с Alibaba или Moonshot AI, и не приводит подробностей о трёх других кампаниях, кроме общего числа приписываемых им взаимодействий.