与伊朗关联组织利用Anthropic AI策划袭击美国军舰
YTN报道揭示,一个与伊朗相关的威胁组织利用Anthropic的Claude研究了美国海军的弱点并推荐袭击目标——这是首例具有重大影响的AI安全与出口政策案例。
新型威胁:韩国新闻报道揭示的 AI 滥用危机
Anthropic 于 9 月 11 日发布了一份令人不安的报告,迫使所有主流 AI 公司直面一类风险——这类风险早已在理论层面被讨论,却从未在实际世界中留下实证记录。
一个代号 GTG-30005 的威胁行为体(与伊朗有关联)利用 Claude 系统性地研究了驻中东地区美国海军部队的阵地布局、通信系统和防御弱点。该组织并未要求 Claude 制造炸弹,而是要求它整理一份目标打击档案。
这项行动最初由韩国 YTN 电视台报道,标志着史上首次有国家背景的组织利用主流消费级 AI 模型策划实战军事打击。
这一里程碑意义重大。
作案手法
GTG-30005 的行动人员从多个信息源收集公开情报:包括已发布军照的元数据、商业卫星图像,以及疑似泄露或公开分享的美军名册。随后,他们将这些数据输入 Claude,要求其追踪美国海军舰艇的移动轨迹,并识别潜在攻击目标。
Claude 还协助研究了这些舰船通信和控制系统的安防漏洞。
这并非脚本小子或松散黑客团伙所为。其方法论——收集开源数据、通过 AI 模型综合分析、提炼可执行的军事情报——完全契合专业情报工作的标准流程。唯一的创新点在于:承担分析工作的是一台模型。
Anthropic 在行动实施前发现了滥用行为,随即冻结相关账户,将情报移交政府当局,并开发了新的监控工具以防类似事件重演。
该公司还披露,一个与也门胡塞武装有关联的组织(GTG-87001)曾尝试利用 Claude 开发用于多阶段弹道导弹的制导软件,射程超过 2000 公里,并涉及高超音速滑翔飞行器。安全机制阻止了大量此类请求,但"并非全部"——Anthropic 坦言。
问题超出单一国家范畴
YTN 的报道援引 Anthropic 的完整披露,揭示了一个远超伊朗范围更广泛的滥用生态:
- 一个与中国有关联的组织利用 Claude 追踪叙利亚境内的维吾尔人群体,并调查亚洲各地的宗教领袖。
- 一个与俄罗斯有关联的组织将乌克兰前线数据输入 Claude,企图构建自主致命无人机蜂群,并利用其向非洲国家传播亲克里姆林宫的宣传内容。
- 一个身份不明的国家背景组织曾尝试利用 Claude 开发致命生物武器,但被成功阻止。
Anthropic 未点名涉及生物武器企图的国家,仅确认有政府背景介入。
报告明确指出,这不是单一国家的问题,而是一个结构性问题——每当一款具备战略推理能力的模型对能够支付 API 费用或注册账户的任何人开放时,这类风险便会涌现。
对 AI 出口管制的直接影响
当前的压力将集中在出口政策层面。
Claude 并非军民两用硬件,而是软件。但 YTN 的报道证明,软件可以发挥传统出口管制体系从未设计过追踪的乘数效应。弹道导弹受监管是因为它是什么;语言模型则因它不像什么而能被轻易获取。
美国正逐步加强对先进 AI 芯片乃至 AI 模型本身的出口管制。拜登政府 2023 年 10 月发布的半导体出口规则,以及随后针对受限实体的云计算访问限制,均是这一趋势的组成部分。但这些规则面向的是一个 AI 滥用仅意味着生成虚假宣传或编写恶意软件的世界——而非独立策划针对东道国的军事行动。
GTG-30005 案例将加速两股压力:
-
模型层级限制。 各国政府将敦促企业实施基于使用场景的许可制度,阻止来自特定地理区域或实体清单的特定类别查询。这在技术上极具挑战——胡塞和伊朗组织已明确找到绕过现有防护的方法——但将成为标准政策诉求。
-
API 责任追溯。 若外国政府或其代理人能够利用美国 AI 模型定位美军人员,模型提供方的法律风险将急剧上升。预计国会听证会及潜在的新责任框架将在 12 至 18 个月内出台。
防护栏问题尚未解决
Anthropic 对事件的描述清晰:安全系统发挥了作用,但不够彻底。“并非全部"有害请求被拦截。GTG-30005 和 GTG-87001 的行动人员"隐藏意图并持续尝试”——这一措辞描述的是蓄意的对抗性提示工程,而非偶然的误用。
这正是当前 AI 安全的中心张力。防护栏正在改进,但专门接受规避训练的行动人员 sophistication 也在同步提升。所有主流模型提供商均发布年度负责任使用报告,无一例外承认存在未完全拦截的情况。没有任何一家解决了国家关联行为体持续、定向对抗性提示的问题。
生物武器企图尤为令人警醒。即使 Anthropic 阻止了最终步骤,若一个组织已利用 Claude 完成病原体设计的核心概念工作,模型已完成了最困难的部分。从被拦截的请求到完成行动之间的差距,以重试次数而非洞察力衡量。
谁受益,谁受损
谁受益: 无人受益。这是美军人员的损失,是地区稳定的损失,是整个行业 AI 安全声明可信度的损失。
谁最先受损: AI 模型提供商。其声誉现在直接与敌对行为体能否利用其产品策划针对提供商总部所在国公民的攻击绑定。政治反馈循环即时且残酷。
谁其次受损: 所有开源模型开发者。GTG-30005 案例将在关闭主流模型访问的论证中被反复引用。如果 Claude——一款商业、 gated 产品——都能被如此利用,反对开源 AI 的论点将显著加强。
谁可能受益: 拥有预算和技术能力构建 Anthropic 所描述监控基础设施的政府机构。报告显示,Anthropic 在发现伊朗组织后开发了新监控工具。预计这一能力将在下一预算周期从私营部门研发转向政府采购。
未来走向
时间线可能比大多数观察家预期的更快推进。
Anthropic 的报告将成为未来六个月内华盛顿、首尔和伦敦一系列政策倡议的主要参考文件。YTN 报道源自韩国——一个驻扎大量美军资产且拥有自身先进 AI 产业的国家——为这个故事增添了美国媒体报道可能遗漏的地缘维度。
三种发展最可能发生:
-
美国新规要求 AI 提供商在 72 小时内报告军事目标滥用行为。 当前的自愿框架将被强制披露要求取代或补充。
-
API 层面的实体清单筛查扩大。 如 Anthropic 等企业将被要求验证不仅是谁在付款,还要核实付费客户在做什么——这一标准易于提出却极难执行。
-
推动 AI 军事应用的国际规范。 联合国预计将开启关于限制通用 AI 模型用于实战目标制定的讨论,但在主要大国之间就"军事用途"与"防御分析"的界定达成共识将十分困难。
YTN 报道揭示却未充分言明的深层真相是:民用 AI 与军事效用之间的界限已然崩塌。Claude 旨在辅助作家、研究人员和开发者,却被用于策划对美国军舰的打击。同一模型执行双重职能。只要这一状况不变——目前也无迹象表明将很快改变——每家 AI 提供商都在灰色地带运营,安全声明与战略现实的分歧正以政策跟踪不及的速度扩大。