当AI证明数学定理时,谁拥有数学?OpenAI面临新型署名权危机
OpenAI公布突破性数学成果后,两位研究人员独立指控该实验室未经认可便使用了他们尚未发表的研究。这场争议揭示了AI训练透明度问题正演变为署名权危机。
证据藏在提示词里
两位数学家。十个结果。一家拒绝透露创意来源的公司。
OpenAI 最近宣布十项数学证明,本意是展示人工智能在形式推理领域日益增强的能力。然而,这却成了比过往任何数据抓取争议都更深层次的争端导火索——因为与文本或代码不同,数学拥有数百年来形成的作者署名、优先权和归属体系。当一个 AI 模型产出证明时,问题不再只是“谁训练了它”,而是“谁拥有背后的思考”。
第一道裂痕出现在纽约大学数学教授特里斯坦·巴克马斯特(Tristan Buckmaster)公开发问时,他质疑 OpenAI 的 Codex 是否从自己与系统的互动中受益。巴克马斯特的担忧很直接:他曾将 Codex 用作研究工具,在从未打算纳入训练语料的对话中分享初步想法。如果这些交流影响了模型的输出,那么 OpenAI 就在将私人的智力劳动转化为专有能力——这一动态与关于代码和文学的辩论相似,但有一个关键区别。数学思想不像诗歌那样属于个人,它们属于一个通过发表、引用和同行评审来追踪作者身份的团队。切断这种联系不仅引发版权问题,更触及认识论层面的问题。
接着 came 安德烈亚斯·托姆(Andreas Thom)。
这位定居欧洲的数学家注意到,OpenAI 发布的十项成果中有一项涉及非弱拓扑群(non-sofic groups)——这是他和同事加博尔·昆(Gábor Kun)多年研究的领域。非弱拓扑群是一类无限数学结构,无法被有限对象近似,其定义看似简单,却隐藏着现代代数中最顽固的难题之一。这种关联并非巧合。托姆观察到,OpenAI 的成果显示出对他和昆 Techniques 的熟悉程度精确得令人不安,尤其是那些方法在当时既非最直观、也非最有希望的解题路径。
让托姆感到震惊的并非 AI 可能产生正确证明,而是该证明似乎带有他未发表研究的印记——那些尚未进入公共记录的思路,OpenAI 根本不可能通过常规渠道合法获取。
数学界不按科技规则出牌
这场争端之所以比普通 AI 数据争议更重要,是有原因的。在计算机科学领域,数据集可以被抓取、重新分发并在法庭上争论。在人文学科,合理使用原则提供了一定的框架。而数学则运行在完全不同的体系中。优先权比所有权更重要。一个证明被发表、被引用、被归属。如果有人独立得出相同结果,双方都会获得认可;如果有人先得出,命名权便不可协商。
这一体系假设思想通过发表变得公开,却从不假设思想能从私人对话、训练日志或模型权重中被提取。OpenAI 的行为——宣布基于未发表工作的成果,并在受到批评后悄悄修改其报告——暗示要么对数学运作方式缺乏基本认知,要么是故意试探在舆论施压下能隐瞒多少署名,直到被迫纠正。
两种解读都不体面。
修改本身说明问题。OpenAI 最初未在公告中承认托姆和昆的贡献。直到遭到数学界的批评,才悄悄修订了文本。这并非一家自信于透明的公司会采取的模式,而是一家知道自己越界、宁愿隐形修复而非公开面对的公司之典型做法。
真正的疑问:“训练于”究竟意味着什么?
争议的核心不在于 OpenAI 能否证明它未使用托姆和昆的工作,而在于它能否证明“确实没有”。公司的模型由数万亿 token 训练而成,实际上无法审计哪些具体思想出现在哪些具体对话中。在这种情况下,举证责任不应完全由指控方承担。当一家公司发布宣称具有革命性能力的产品,却从模糊的训练过程中获益时,它有义务证明这种能力并非源于未补偿、未署名的劳动。
然而,OpenAI 仅以沉默和修改回应。这是一种回避,也是不幸成为常态的一种模式。
其影响远超数学领域。如果一个研究社区的未发表思想能被吸收进前沿模型而无需署名,那么“工具”与“ extractor ”之间的界限将彻底崩溃。数学家使用 AI 工具,AI 工具向数学家学习,两者之间的界限比 OpenAI 高层愿意承认的要薄得多。
谁赢,谁输,接下来如何?
托姆和巴克马斯特迫使 OpenAI 不得不面对一场它原本希望避免的讨论。他们揭露了公司公开宣称的开放性与实际署名实践之间的差距。数学界历来在 AI 署名问题上反应迟缓,此次却以罕见速度和一致立场作出回应。这一反应意义重大,表明该领域正在密切关注,且不满足于模糊的承诺。
OpenAI 在这场争端中一无所获,只留下防御性修改的记录。该公司在研究人员中本就脆弱的信誉再受打击。而其竞争对手,尤其是那些主打透明度的公司,获得了清晰的进攻机会。
未来走向将取决于 OpenAI 及其他实验室是将署名视为合规问题还是设计原则。若为前者,我们将看到更多悄悄修改、更多法律博弈,以及更多研究者选择将思想保留在离线状态。若为后者,我们或许会迎来真正的转变:透明的训练数据披露、注明来源贡献的模型卡片,以及向塑造前沿模型的研究社区提供收入分成机制。
两种结果均未可知。但数学家已划下界线。问题在于企业是否会尊重它。