Anthropic 打响 AI 蒸馏战争第一枪
Anthropic 2026年9月发布的首份滥用报告点名中国实验室,指其在工业规模上开展窃取 Claude 能力的蒸馏行动——但这份数据揭示的真相更为关键:西方 AI 开发者与受国家关联的中国竞争对手之间,存在着巨大的不对称,后者将模型权重视为开源资产。
来得晚了一天的报告
Anthropic 于 9 月 10 日发布了其 2026 年 9 月威胁情报报告。前一天,一名前 Anthropic 员工 Jacob Coxson 在 X 平台上发帖称,OpenAI 和 Anthropic 均未负责任地采取行动。该帖引用了 Evan Hubinger 和 Samuel Marks ——两位 Anthropic 高层——关于人工智能可能导致人类灭绝的言论。时机并非偶然。预计该公司今年将上市。一份列明你的产品如何被武器化的报告,加上你自己的员工公开质疑你们做得是否足够,这是一面残酷的镜子。
这份题为《检测与反制 AI 滥用:2026 年 9 月》的报告,涵盖了 2025 年 12 月至 2026 年 8 月期间的案例。它将滥用行为划分为七类:网络攻击、影响力行动、监控、欺诈、生物滥用、常规武器开发,以及——最具新闻性的——蒸馏。最后一个类别是该报告与既往 AI 安全文献最为不同的地方,也是地缘政治风险变得具体可触的区域。
蒸馏即工业间谍
报告点名了五家中国 AI 公司:阿里巴巴、DeepSeek、Moonshot AI、MiniMax 和 Z.ai。它还点名了小米。根据 Anthropic 的分析,这些公司实施了一场"工业规模的秘密行动",通过虚假账户、盗用信用卡和已遭入侵的身份认证凭证提取 Claude 的能力。这项技术被称为蒸馏:你将另一个模型的输出喂入你自己的训练管线,直到它逼近目标模型的行为,而无需触碰原始权重。
这种方法并非秘密。学术界多年来一直在讨论它。此次行动之所以引人注目,在于其规模与目标。Anthropic 称拦截了超过 1600 万次请求——许多请求经由西方开发者日常使用的第三方模型路由服务中转。这些请求来自 1500 多个代理账户,包含对话内容、代码片段以及开发者环境的逐步重建,旨在教会一个替代模型 Claude 如何思考。
小米的案例最为详尽。据 Anthropic 称,小米的内部模型 MiMo 并未自行处理流量,而是静默地将客户请求转发给 Claude,捕获响应后用于生成监督微调与强化学习数据。被捕获的会话中包含数百名小米用户的姓名与联系方式、十余种语言的企业数据,以及逐层重建的开发者环境。Claude 的响应并未被转回原始请求者,而是被归档、处理后注入小米的训练循环。
Moonshot AI 遭遇了类似的处理。报告指控,Moonshot 并未通过自有 Kimi 模型处理请求,而是静默转发至 Claude。这是经典的蒸馏模式:让目标模型干活,从它的回答中学习,从不暴露你在学习。
为何蒸馏重于窃取
窃取模型权重与窃取模型行为之间存在本质区别。权重是静态的,可以被修补、轮换、替换。行为则更难防御。一旦蒸馏行动成功,生成的模型便能在与任何本土训练替代品相同的法律与管辖边界内运作。它可以被部署在企业产品中、整合进政府系统、出售给第三方——且没有任何被窃取的一字节知识产权跨越国境。
这正是中国实验室行动与早期 AI 安全关切在结构上的不同之处。旧日的担忧是,某个 rogue actor 会侵入模型提供商的基础设施,携带权重一走了之。新的担忧是,合法用户在不自觉中充当数据源,通过数十亿次精心构造的交互训练出一个竞争对手模型。这不是一次单一事件,而是通过数千个账户的缓慢渗漏,每一个都看似正常的使用。
Anthropic 的报告指出,Claude Haiku、Sonnet 和 Opus 均遭到利用。下一代 Fable 和 Mythos 模型仅出现一次被确认的蒸馏尝试——这表明新架构或许更难被蒸馏,或者该行动尚未扩展至这些模型。这个区分对关注 Anthropic IPO 时间线的投资者至关重要。
生物滥用:模糊性问题
如果蒸馏是报告的地缘政治重心,那么生物滥用便是其道德焦点。Anthropic 记录了五起涉及高风险生物研究的案例:禽流感功能增益研究、肽数据库构建配合毒性优化管线,以及其他处于合法疫苗研究与病原体设计之间灰色地带的工作。
难点在于方法论。用于设计更安全的疫苗的技术与用于设计更致命病原体的技术高度重叠。Anthropic 表示无法在数个案例中判定意图。它选择基于能力风险——而非确凿的恶意——来实施拦截,这一决定引发了令人不安的问题:谁来裁定科学研究何时越线。
报告指出,Opus 4 和 Sonnet 4.5 等较旧版 Claude 模型尚不具备有效协助高级生物研究的能力,这些模型的保护措施也有限。更新一代的模型限制了更多。但这种不对称非常鲜明:使模型对生物滥用产生危险的能力阈值,同样也使它对蒸馏具有价值。运行蒸馏行动的公司并非试图设计病原体,而是试图构建能够——并最终将会——这样做的模型。
监控与影响力:国家关联模式
报告的监控部分描述了与中国国家安全机关相关的账户利用 Claude 来监控和压制异见。目标包括香港民主活动人士、天安门纪念参与者、维吾尔族支持网络和西方人权组织。一个被追踪的账户 @whyyoutouzhele 在 X 上拥有约 210 万关注者,发布的内容包含国内抗议视频及从中国境内传递的被审查信息。
影响力行动涵盖九起案例。俄罗斯国家媒体被发现将 Claude 纳入文章与广播脚本制作管线。三个与伊朗政府相关的宣传组织出现在数据中。一家土耳其公司向马来西亚某次选举出售意见操纵平台。一家法国广告公司运营约 70 个虚假新闻网站,发布约 8900 篇文章。
模式是一致的:国家和国家相关行为体正以整合其他商业软件的方式,将 Claude 纳入现有运营流程。区别在于,Claude 的能力比传统工具更难审计。当政府使用字处理软件起草宣传稿时,你可以追溯文档来源;当它使用语言模型大规模生成内容时,溯源便模糊不清。
接下来会发生什么
这份报告发布之时,AI 行业仍在界定与政府的关系。Anthropic 预计今年进行的 IPO 将迫使公司披露风险因素——包括其产品被用来对抗其运营所在国利益的风险。如果 Anthropic 的描述成立,蒸馏行动表明中国 AI 公司不将 Claude 视为需要竞争的产品,而是视为需要消费的数据集。
应对选项有限。抗蒸馏模型设计是一个活跃的研究领域,但尚无方案经过大规模验证。使用监控可以捕捉异常,但报告中描述的代理与轮换账户技术正是为伪装成正常流量而设计的。跨司法管辖区的法律追索缓慢且不确定。最直接的影响可能来自声誉层面:任何被抓获运行蒸馏行动的组织,都将面临 Anthropic 如今对阿里巴巴、DeepSeek、小米等公司施加的同种公开点名。
报告发布前一天 Coxson 的帖子值得与报告本身并读。它提出了一个报告未能完全回答的问题:如果 Anthropic 和 OpenAI 都未能负责任地行动,那么它们是根据什么标准被衡量?蒸馏行动是一种失败模式。生物滥用的模糊性是一种。监控整合是第三种。每一种指向不同类型的责任——技术性的、伦理的、地缘政治的——而每一种都没有干净的答案。
明确的是,AI 安全讨论已从理论风险评估进入了有据可查、归因明确、公开点名谴责的现实阶段。2026 年 9 月的这份报告不是关于可能发生什么的警告,而是关于正在发生什么的记录。蒸馏战争已经展开,而 Anthropic 刚刚公布了第一份公开的"伤亡名单"。