阿里巴巴动用1.5亿次Claude查询训练AI——Anthropic称之为盗窃
Anthropic发布迄今为止最详尽的证据,揭露中国公司挪用Claude输出进行模型训练——包括阿里巴巴利用1.5万个虚假账户在单一季度内生成1.51亿次交互。这一披露引发了关于出口管制和前沿模型未来获取途径的紧迫问题。
一份改变对话的报告
Anthropic不仅是指控阿里巴巴在窃取Claude——它还提供了一份154页的文件。这份名为《AI滥用检测与响应》的文件于10月10日发布,是截至目前关于美国政府所称的"工业规模恶意蒸馏"最详尽的公开陈述。
核心发现:今年5月至7月期间,与阿里巴巴有关联的操作者使用了超过3,500个虚假账户,与Claude产生了超过1.51亿次交互。在高峰期,这一数字达到约300万次查询。目的并非随意探索。Anthropic称,这些输出被用于逆向工程Claude的推理过程,然后转化为阿里巴巴Qwen 3.5、3.6和3.7模型的监督训练数据。
换句话说,Claude被变成了竞争对手产品的生产车间。
蒸馏在大规模下究竟是什么样的
蒸馏本身是机器学习中的标准技术。一个大的"教师"模型针对广泛的提示生成回答;这些回答随后用于训练一个更小、更便宜的"学生"模型来近似教师的行为。在获得授权的情况下,这一过程是合法的——OpenAI、Google等公司正是这样构建自己旗舰模型的更快、更精简版本的。
Anthropic的观点是,报告中描述的中国行动未经授权且是秘密进行的。该公司称在报告期内检测到并屏蔽了七家位于中国的研究所。然而,正是规模使这一案件与众不同。
阿里巴巴并非唯一的参与者。Anthropic估计,Kimi聊天机器人背后的月之暗面公司在5月至7月间将超过2,300万次用户交互路由到了Claude——尽管它告诉用户他们是在直接查询Kimi。深度求索涉及超过1,210万次此类交互。小米、智谱AI、商汤科技和MiniMax也被标记为存在类似做法。
这些数字令人震惊,因为它们揭示了一种系统性方法而非机会主义抓取。仅查询量就表明存在专用基础设施:机器人农场、账户轮换和自动化提示管道,旨在检测生效前尽可能多地提取高质量推理数据。
数据问题远不止模型权重
Anthropic报告中或许最令人不安的细节不是这些公司正在蒸馏Claude——而是还有什么通过管道流走。
Anthropic声称,DeepSeek和中广在线(成都固定环路电视)处理的交互中包含敏感的中国国家数据,包括监控系统信息和国有企业的内部代码。据报道,小米提取的数据包括个人姓名、联系信息和企业信息。数据集中还识别出一些与据信与中国军方有关联的实体相关的用户。
这是双重违规。一方面,这代表未经授权使用Anthropic的专有能力。另一方面,这表明Claude被用作敏感中国机构数据的无意渠道——这些数据可能由无意间或粗心的用户提交,这些用户以为自己在与国内模型对话。
对于在全球运营AI系统的西方公司来说,这提出了一个令人不安的问题:外国竞争对手仅仅通过将用户查询路由到他们不拥有的前沿模型,被动地 harvesting 了多少专有训练数据、安全对齐和推理能力?
美国政府此前已在打太极
在Anthropic披露之前,NSA、FBI和CISA曾发布了一份联合网络警报,描述中国AI公司正在对美国模型进行"工业规模恶意蒸馏"。但该咨询文件并未点名具体公司或公布具体数据。这是一份受外交谨慎影响而发出的警告。
Anthropic的报告消除了这种模糊性。它提供了案例研究、账户数量、查询量和涉及的模型名称。其效果是将一个 generalized 的安全关切转化为有据可查的商业情报行动——其规模仅靠半导体出口竞争无法应对。
中国商务部立即作出回应,将蒸馏定性为全行业通用AI产业中使用的中性且常规的技术,并指责美国将技术争端政治化以打压中国产业。这种论调很熟悉,但Anthropic报告中的具体内容使其更难被简单地视为修辞。现在的问题是,美国是否会像对待先进芯片一样,将前沿模型访问视为受管制的商品。
接下来会发生什么
最直接可能的影响是美国AI公司如何构建API条款和访问控制。Anthropic已经对检测到的行动实施了屏蔽措施,但报告暗示所使用的技术——账户轮换、代理路由、用户端混淆——是可复制的。防御它们需要持续投资检测基础设施,这将提高所有人的成本。
更广泛地说,这一披露可能加速美国政府将前沿模型访问作为出口管制问题的举措。目前的制度监管硬件的销售——GPU、互连、chiplet。Anthropic的报告实际上论证的是软件层同样重要:如果一家中国公司能在一个季度内从美国模型生成1.5亿个蒸馏训练样本,限制芯片销售只是战略的一部分。
对于阿里巴巴和其他被点名的公司来说,这份报告即使在确认其蒸馏行动取得了实质性成果的同时也带来了声誉风险——Qwen 3.7确实存在,Anthropic明确将其能力与从Claude提取的数据联系起来。美国监管者是否会据此采取行动仍有待观察。
清楚的是,开放研究与竞争性提取之间的界限已经模糊到双方都未完全预料到的程度。Anthropic现在正在将其安全发现作为公开文件发布。这本身就是一个战略选择——它向市场发出信号,即该公司不再将这些事件视为私人纠纷,而是作为正式记录的事项。
1.5亿次查询是一个数字。其背后的报告是一个先例。