自建博姆机的AI,改写了工具使用的讨论
韩国研究团队称,一款未发布的模型「GPT-6 Astra」在两天内写出自建模拟器和博姆机解码器,成功破解了一条1941年的恩尼格玛密码。结果并非重点——方法论才是:若得到验证,这标志着从「模式匹配」向「自主构建工具」的跨越。
结果平淡无奇,但方法不同寻常。
一份1941年7月的恩尼格玛密码电文,自2005年在线公布以来一直未被破解,据报道却在两天内被一台AI攻陷。 headline 上最抓眼球的那个数——85年未解的密文——确实好写新闻。但真正藏在下面的工程问题更锋利:这个系统究竟是推理出了答案,还是模式匹配到了一道预设好的题?
据Frode Weierud运营的密码历史研究平台Cryptocellar在24日发布的报告,团队成员Carter Reffer将一条1941年德军电文喂入一个自称"GPT-6 Astra"的模型。两天后,系统产出了一台可工作的恩尼格玛模拟器、一套Python+C++实现的图灵著名Bombe密码机解算器,以及一段明文。这条标注为MVUEH的电文是一段82字符密文,由德军无线电台发往党卫军骷髅师补给部门。解码出来的文本与同日发出的另一条兄弟电文SIPVX几乎一模一样——而这,恰恰是你预期中的后勤无线电网重发同一命令时会发生的情况。
如果你曾在密码分析领域待过,这个结果本身并不出奇。任何带有已知明文提示(crib)的恩尼格玛电文,现代笔记本电脑都能在不到一秒内解开。它的数学结构自1940年起就已公开。这85年的空白,是关注度的空白,而非难度的空白。计算机从上世纪90年代末起就一直在常规破译恩尼格玛通信流量。
这两天实际做了什么
报告的有意思之处在这里。团队声称系统并没有被喂入一套分步骤的教程。它从一批未解密的电文中识别出MVUEH是最有希望的目标,发现它很可能与SIPVX有关联,提出将"ROSENOW ROSENOW"作为共同元素这一地理位置提示,然后自行编写工具。这意味着生成转子逻辑模拟器、用C++实现Bombe的空值检测算法,并进行大规模搜索。团队还指出两个让破译更复杂的细节:第72个字符处出现的左转子异常行为,以及从1940年代一直保留至今的原始打字稿转录错误。
研究人员估算,一位人类分析师按同样流程走完需要好几个月。他们称之为历史密码解码的范式转移。这是一个大胆的主张,值得细看。
那个找不到名字模型
这个故事最大的问题出在模型名字上。“GPT-6 Astra"并不对应OpenAI、Anthropic、Google或Meta任何一家已公开宣布的产品。没有新闻稿、没有API文档、没有基准测试套件使用这个名称。韩国媒体AI Times把它当作事实报道,却没有链接任何原始技术论文或代码仓库。Cryptocellar也没有发布可核查的git提交记录、生成C++源码的哈希值,或是那两天会话的分步日志。
在有人公开生成的代码、转子设置和完整的提示/响应记录之前,这个声明只能归入"合理但未经证实"一类。报告所描述的方法在历史上是正确的——提示词、Bombe空值测试、转子顺序猜测,都是标准工具箱。一个合格的编程代理完全有可能写出这三者的可行实现。但从"一个编程代理写出了一个能跑的Bombe"到"一个自主推理系统解决了一道新的密码学难题"之间,鸿沟巨大,而报告用85年这个框架把那条界线抹糊了。
工具构建的区别为何在密码学之外也重要
剥掉恩尼格玛的外壳,底下那个关于能力的问题,正是软件工程师、研究者和政策制定者争论了十八个月的核心。当前前沿模型在基于学习上下文做模式匹配方面非常出色:给一段代码库就重构,给一个数据集就分类。但在受约束条件下构建工具方面——决定要造什么、从零写代码、对照物理或逻辑规范调试、并且在无人值守下迭代——它们的证据远不够扎实。
如果Cryptocellar的报告站得住,这两天的会话就把这些步骤按顺序走了一遍,而且应用在一个"正确工具"不是神经网络一层、而是拥有26触点转子和置换网络的机械模拟器的领域。这与我们在跟踪的LLM基准(MMLU、HumanEval、SWE-bench)呈现出不同的认知画像。它更接近机器人研究者所说的自主搭建:系统得先对物理规律有足够了解,才能造出合适的仪器,然后才能开始测量。
这会有直接后果。在科学研究里,大多数实验都需要定制仪器。在材料科学里,研究者设计晶体点阵探针;在药物发现里,有人编写对接流水线。如果语言模型能不用人类搭脚手架,就从"这是问题"走到"这是能检验假设的可工作工具”,那么发现的瓶颈就会从写代码转移到正确提出问题上。
ADFGVX边角料与接下来要看什么
报告提到,就在前一周,同一模型据称还破译了一条108年历史的德军ADFGVX电文——来自一战、采用多表代换的密码,几十年来一直抵拒人工攻击。两周之内,两套不同的密码体制、两套不同的工具链(恩尼格玛转子 vs. 拉丁方多表代换表)。如果两项都核实无误,那模式就更像是一套通用流程,而不只是一次运气好的单点突破:识别密码家族、构建匹配的模拟器、枚举密钥空间、用已知明文约束进行验证。
这套流程是可泛化的。它适用于一次性密码本分析、冷战时期的SIGINT流量,以及任何编码方案已知但密钥遗失的归档通信。它的实用价值不在于攻破现代AES,而在于以机器速度抢救历史。
什么能让怀疑者信服
三样东西。第一,一个公开代码仓库,内含生成的C++ Bombe源码、Python转子逻辑,以及完整命令日志。第二,一项可重复测试:把同样的提示词交给另一款模型,比如Claude或Gemini,看能否复现相同流程。第三,对明文的密码学审计:对照骷髅师1941年补给通信的已知档案文件,确认"ROSENOW"与"Waschbusch"是当时真实的地名与操作员姓名。
在这三项都打钩之前,这还是个强有力的线索,不是已确认的结果。但这个主张的骨架——AI在测量前先造出自己的测量仪器——才是真正值得认真对待的能力,因为它正是当前基准测试套件没有考察到的那块。恩尼格玛只是第一场考试。真正的问题是,这套考试形式在下一场还能不能站住。
更正说明:模型名称"GPT-6 Astra"按原文报道。撰文时尚无独立渠道证实其存在或规格。