politics 12 分钟阅读

五角大楼的AI幻觉差点引发一场战争

美国国防部一款聊天机器人错误地将一艘中国船只认定为携带核武器部件,在伊朗战争期间险些触发军事干预。该事件暴露出AI在被仓促纳入作战决策链时缺乏安全保障所引发的结构性危机。

  • 太空战争
  • KakaoAI
  • 霍尔木兹海峡
  • 费多罗夫

一则假报告与升空的战机

一个AI聊天机器人生成了一份报告,声称该地区的一艘中国船只载有核武器组件。美军紧急升空战机,武装士兵准备登船。然而就在任务即将发起之前,分析人员核查了自己的工作,发现这份报告完全是假的。

没有人登上那艘船。但据CNN报道,这次事件离灾难只差一步,足以让知情者心有余悸。一位消息人士直白地形容:这险些引发一场战争。

此事发生在春季,正值伊朗战争期间,当时紧张局势已经相当高涨。如果错误识别一艘载有核材料的中国船只,将迫使美方做出立即而灾难性的反应。所幸这一错误被人类发现——是人类在核查人类的工作——这纯粹是运气,而非制度的设计。

时间线很关键。据报道,一名"专业指挥部"级别的分析人员将情报报告输入一个生成式AI工具,要求它分析一艘船的货物清单,结果得到一个听起来十分笃定的结论:该船正在运输与中国核武器计划相关的组件。这份评估随即沿着指挥链上报。它没有被标记为推测性内容,没有被注明需要独立验证,而是被当作需要实施登船行动的操作级情报来处理。

事件没有进一步升级,表明军方的传统审核机制仍在运转——尽管只是勉强维持。一位高级分析师或指挥官在最后关头暂停了行动,要求提供佐证。他们找到的东西一无所有:没有卫星图像,没有信号情报,没有人源情报确认。只有一个披着权威话语外衣、听起来颇为可信的AI输出。

五角大楼希望你信任AI,别信。

国防部长皮特·赫格塞斯一直在热情推广军方的人工智能整合。“美国将继续在AI领域保持主导!“五角大楼的一个账号本周早些时候在X平台上发布。赫格塞斯本人今年一月表示,美国将成为"全领域AI优先的作战力量”。

问题在于,没有任何证据表明有人真正弄清楚了"AI优先"在实践中究竟意味着什么。今年一月,五角大楼发布了其"AI加速战略”——一份模糊的文件,提到了"蜂群铸造"(Swarm Forge)和"代理网络"(Agent Networks),但对于大型语言模型如何融入实际作战行动几乎没有给出具体解释。这份战略读起来像是一份披着军事行话外衣的技术路线图,充满野心却缺乏架构设计。

CNN的报道表明,在这个特定案例中,一名分析员要求一个聊天机器人分析关于某船货物清单的情报报告。据报道,聊天机器人的输出结果是开源信息与机密政府情报的混杂产物,得出了关于货物情况的错误结论。具体使用的工具并未被点名,尽管军方已试用过多种生成式AI系统。

这不是某个工具的失败。这是一个系统的失败——该系统将AI输出视为足够可靠、足以在不充分验证基础设施的情况下指导军事行动。聊天机器人并非有意撒谎。它完全按照这类系统的设计方式行事:生成一段符合情报评估文体模式的文字。问题在于,模式匹配不等于探求真相。

驱牛入笼

今年四月,一位五角大楼高级官员告诉DefenseScoop,赫格塞斯的部门正在"像我们所说的那样,把GenAI.mil上的一切都往死里赶"。这句话捕捉到了某种重要的东西:这不是审慎、有序的采纳,而是为了展现出领导层的果断姿态,将AI工具强行塞入每一个可用的工作流程中。

军方采购流程历来缓慢——慢得令人痛苦。AI技术实质上绕过了这道门槛。这些工具正被更快地推入五角大楼的工作流程,远远超过任何安全审查、任何测试协议、任何对其局限性的诚实评估能够跟进的速度。结果就是,一类普通平民日常随意使用的生成式AI工具,正被要求合成机密情报并产出操作级评估报告。

CNN的报道似乎是此类错误首次达到临界点的主要记录案例之一:人类士兵正在为一项具有外交敏感性的军事行动做准备。这才是关键的门槛。不是聊天机器人答错一道题。不是有偏见的招聘算法。而是真正的武器、真正的登船小队、真正可能引发的战争。

结构性问题

这次事件危险的地方不在于具体的幻觉内容,而在于它所暴露的结构。当一名"专业指挥部"级别的分析人员使用消费级聊天机器人来合成机密情报并生成作战报告时,审核链条中的某个根本环节已经出了问题。

五角大楼这一次核查了工作。没有人受伤。中国船只未被登检。战机平安返航。但在一个AI优先的军事体系中,每一个依赖AI生成评估的未来决策都将成为一次赌博。这个系统并非设计用来发现错误,而是设计来对可能完全虚构的输出产生信心。

风险远不止于一份关于一艘船的虚假报告。军方的AI系统将被越来越多地用于目标定位、威胁评估、情报综合和作战规划。每一次应用都伴随着同样的根本风险:模型听起来权威,输出的却是胡言乱语。决策越复杂、越高风险越大,人类就越难验证AI的结论是基于现实还是由模式和表面合理性拼凑而成。

这次事件还揭示了一个次生危险:AI生成情报在决策链条中的常态化。一旦指挥官和行动人员习惯了接收AI合成的评估,验证的标准就会悄然降低。为什么要花几个小时交叉比对卫星图像,而一个聊天机器人能在几秒钟内提供结构化分析?效率提升是真实的。认识论上的代价却尚未被追踪。

制度惯性

接下来会发生什么,取决于这次事件能否触发制度性的反思,还是会被吸纳进更广泛的AI必然性叙事之中。五角大楼目前的立场倾向于后者。赫格塞斯毫无放慢言辞的迹象。AI加速战略仍在执行。驱牛之举继续上演。

但也出现了早期迹象,表明这次事件可能让一些此前不便公开表达担忧的人产生了震动。熟悉该报告的消息人士将其描述为"非常可怕的事情",这种措辞表明,即便公开姿态未变,内部也已承认风险的存在。私下不安与公开热情之间的这种差距本身就是一个结构性问题——这意味着军方正在继续部署它并不完全了解、也未公开批评的工具。

此次事件设定的先例同样意义重大。如果关于一艘载有核组件的中国船只的AI幻觉,能够在活跃冲突期间一路推进到作战规划阶段,那么在另一种情境下,是什么阻止了类似的幻觉触发升级?是什么防止AI误读外交信号、伪造敌对意图的证据,或者生成一项如此令人警觉的威胁评估,以至于迫使军方做出回应?

接下来该做什么

目前没有任何迹象表明五角大楼因这次事件而放缓了AI部署步伐。赫格塞斯的言论没有转变。战略文件依然模糊。驱牛之举仍在继续。

我们需要的不只是更多的创新,而是问责制。军方必须明确建立协议,规定AI生成的情报在何时可以进入决策链条,在任何AI输出影响作战规划之前需要哪些验证步骤,以及当这些协议失效时谁负责。目前,这些问题没有任何连贯的答案。

一个可行的协议应该是这样的:AI生成的评估可以辅助分析,但不能作为主要情报来源。任何基于AI综合结果的作战计划都需要来自传统情报源的独立佐证——卫星图像、人源情报、信号情报。验证的责任落在提交AI输出的人身上,而不是接收它的人身上。而且每一次类似这样的事件都必须正式记录、审查,并用来收紧规则。

在此之前,每一次将AI工具部署到军事工作流程中都是一次掷骰子——而赌注越来越高。这次事件与真正战争之间的区别,不是一项政策,不是一个保障措施,而是链条末端某个人想到问了句:“我们怎么知道这是真的?“这个问题本应内置于系统之中。而现在,它没有。