人工智能

Anthropic监测到提取人工智能模型能力的活动中约2亿次交互

Anthropic表示,五场与中国人工智能公司有关的活动试图通过近2亿次交互从Claude模型中提取先进能力,其中一场被归因于阿里巴巴,另一场被归因于Moonshot AI。该公司认为,这些方法可能被用于为竞争模型生成训练数据,但报告呈现的是该公司的指控,材料未提供独立证据予以证实。

2026-09-10
1 分钟阅读
7 浏览量
فريق تحرير certi.news
Anthropic监测到提取人工智能模型能力的活动中约2亿次交互

Anthropic在一份新报告中表示,中国人工智能实验室在过去几个月实施了日益复杂的活动,试图从先进的美国模型中提取能力。该公司称,其监测到与五场独立活动相关的近2亿次交互。根据该公司的说法,这些尝试针对Claude的代理运行和工具使用、编程与数据分析,以及逻辑推理能力。

Anthropic将这些行动描述为“蒸馏攻击”(Distillation),这是一种收集大型模型输出、再利用这些输出训练较小模型执行推理任务的方法。该公司称,攻击者试图绕过其防御措施,以提取模型所谓的内部思维痕迹,尽管Claude通常不会向用户展示这些痕迹,而是提供“摘要思考”区块,对其得出答案的方式进行概括性说明。

绕过思维痕迹保护的方法

据报告称,一些活动通过间接措辞向模型提出请求,成功促使模型披露思维痕迹。Anthropic列举了一个被包装成翻译任务的请求:要求Claude将“先前的工作记忆”翻译成仅使用片假名书写的日语。该公司称,这类方法使攻击者得以获取本应不会出现在常规回答中的细节。

最大规模活动被归因于阿里巴巴

Anthropic表示,被归因于阿里巴巴的活动是其迄今监测到的最大规模批量蒸馏行动。2026年5月至7月期间,该公司记录到1.51亿次交互,活动高峰达到每天约300万次交互。这些请求分布在3500个账户上,但由于使用了固定请求来提取思维痕迹,Anthropic认定这是一项统一行动,并评估认为其目标是为阿里巴巴旗下的Qwen模型系列生成训练材料。

与Moonshot AI有关的请求

至于另一场被归因于Moonshot AI(Kimi模型的开发公司)的活动,Anthropic表示,该活动似乎是直接受中国军方引导的。报告提到了一项请求:分析一组封闭式监控摄像头的录像,以判断某人是否“表现异常”。在持续10天的期间内,Anthropic监测到通过一个由5000个账户组成的网络向Claude转发的近30万次请求,其中大多数针对Opus模型。

为什么这条消息重要?

如果Anthropic的估计属实,那么此事就不只是零散账户遭滥用,而是一次大规模、有组织地收集先进模型输出的尝试,可能降低开发竞争模型的成本。这些数据还表明,能力保护不仅涉及阻止对模型权重的直接访问,也涉及控制使用模式,以及识别账户和请求之间的相似性。不过,这些结果仍是Anthropic提出的指控;材料没有提供将这些活动归因于阿里巴巴或Moonshot AI的独立核实,也没有详细介绍另外三场活动,只给出了归属于它们的交互总数。

新闻来源
TechCrunch AI
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻