Anthropic 对 AI 协助生物武器划出红线
Anthropic 已公开禁止其模型被用于支持生物武器研究——至今已发现五起案例。这是首次有一家大型 AI 实验室以与网络犯罪同等紧迫的态度对待 WMD(大规模杀伤性武器)相关滥用行为,同时也引发了关于国家赞助的双重用途研究的令人不安的疑问。
划定红线
Anthropic 做了一件此前没有任何主流 AI 实验室公开尝试过的事情:它为自身的模型划定了一条明确的边界,并声明其模型将不会被用于开发生物武器。
该公司公布了五起事件案例,涉及试图以支持生物武器开发的方式使用 Claude 的行为。此外,他们还独立识别了六起 Claude 被用于开发常规武器软件的案例——包括枪械、导弹、武装无人机、炸弹,以及操控这些武器的瞄准与控制系统。
这不是一个微小的政策调整。这是首次有一家前沿 AI 实验室以与当前对待网络犯罪、影响力操作和欺诈行为同等严肃的态度,来对待与大规模杀伤性武器(WMD)相关的滥用问题。
这项宣布之所以重要,是因为它标志着业界在界定风险格局方面正在发生转变。多年来,关于 AI 与大规模杀伤性武器的担忧主要存在于学术论文、政府简报和政策白皮书之中。而 Anthropic 现在正将这些担忧付诸实践——并将其公之于众。
同样的数据,两种未来
Anthropic 的威胁情报主管 Jacob Klein 在接受《纽约时报》采访时称,这一情况"极其微妙"。他想要表达的核心观点是:任何能够指导生物武器开发的信息,同样可以加速疫苗或疾病治愈方法的发展。
Anthropic 对此有明确认知。武器与治疗之间的界限并不体现在数据本身——而是取决于用户的意图以及围绕访问权限所设置的安全措施。这就使得执行管控本质上具有概率性。你不能简单地屏蔽所有生物研究,而必须阻断从研究走向武器化的路径,而这需要理解模型本身可能并不完全具备的上下文信息。
Klein 指出,你"并不会看到有人像漫画书里那样说,‘嘿,我想造一种生物武器来杀死所有人’",这句话点出了真正的挑战所在。Anthropic 发现的滥用案例,表面上很可能都像是合法的科研探索——基因合成协议、病原体编辑技术、蛋白质折叠分析。突破疗法与可武器化流程之间的差异,往往取决于表述方式,而非根本能力。
未触及边界的滥用
报告中有一个细节值得比它实际获得的更多关注:五起生物武器滥用案例均未涉及 Claude Fable 或功能更强大的 Mythos 系列模型,除了一起蒸馏(distillation)事件。
蒸馏是指利用更大、更昂贵模型的输出来训练更小、更便宜的模型,这是 AI 行业中让前沿能力更易获取的标准技术手段。但它也是一个已知的攻击路径——如果一个小模型从大模型中吸收了大量危险能力,那么大模型周围的安全护栏便会形同虚设。
前沿模型未被直接滥用所触及,这一点既令人欣慰,也令人不安。它表明 Anthropic 对其最强大系统的安全措施正在发挥作用。但也意味着,相同的行为者几乎肯定正在此刻测试这些边界。那起蒸馏案例证明,他们知道这个套路。
常规武器方向
六起涉及常规武器的案例本身就值得认真对待。Claude 被用于开发枪械、导弹、武装无人机和炸弹的软件,以及操控这些武器的瞄准与控制系统。这并非理论假设——这是前沿 AI 在军事应用中正在被积极利用的现实。
软件开发的维度尤其关键。现代武器系统日益以软件定义为核心。无人机的飞行路径、导弹的制导逻辑、武器平台的瞄准算法——这些越来越都属于代码的范畴。如果 AI 助手能够帮助更快、更可靠地编写这些代码,那么开发具备战斗力的武器系统的门槛将大幅下降。
为何此时发生
Anthropic 决定公布案例研究并明确自身边界,正值各方对国家支持型 AI 活动针对军民两用研究的担忧急剧升温之际。西方国家政府屡次警告,对手国家——尤其是俄罗斯和中国——正试图通过代理网络和研究机构的掩护,利用前沿 AI 模型服务军事与情报目的。
公布具体滥用案例具有多重目的:提醒其他实验室和模型提供商注意它们可能尚未察觉的威胁;建立可用于制裁和出口管制的公开记录;并向潜在滥用者发出信号——他们的尝试正在被追踪和溯源。
但这也引出了一个棘手的问题:如果 Anthropic 的检测系统已经发现了五起生物武器滥用案例和六起常规武器开发案例,那么还有多少尝试未被发现?公开数字不过是这家公司选择向全世界展示的那座冰山一角。
接下来会发生什么
直接的后果是,其他主要 AI 实验室——OpenAI、Google DeepMind、以及微软与 OpenAI 的合作——将面临压力,要求它们采取类似的立场。Anthropic 已经树立了一个先例。拒绝跟进会被视为失职。
更长远的后果则更为深远。我们正进入这样一个时代:AI 模型提供商被期望不仅要执法自身的条款协议,还要对涉及国家安全的技术下游用途进行管控。这是任何科技公司本不应承担的角色,它将需要新型的专业人才、与情报机构的新伙伴关系,以及全新的法律框架。
最值得关注的下一步,是蒸馏漏洞是否会被关闭。如果从小型模型蒸馏自前沿系统的模型能够在不触发同等安全措施的情况下复制相同的危险能力,那么 Anthropic 今天划定的边界明天就可能变得不堪一击。公司需要决定是否将蒸馏本身视为一个独立的安全问题——而不只作为一种技术优化手段。
目前,Anthropic 已经说明了他们计划拦截的内容。更难的问题在于:他们尚无法阻止的那些事。