science 10 分钟阅读

Anthropic AI发现酶遭抄袭争议

一位哥本哈根研究人员表示,Anthropic声称AI发现的新酶与其未发表的研究高度重合,引发人们质疑AI代理究竟是在真正发现科学,还是只是在重复用户已经输入的内容。

  • Anthropic
  • Claude Code
  • 噬菌体
  • AI科学
  • ART

问题不在发现本身,而在来源。

Anthropic于9月24日宣布,其AI代理独立发现了一种新酶——一种源自所谓巨型噬菌体(jumbo phages)的反转录酶,巨型噬菌体是一种捕食细菌的巨大病毒。该公司称这是一个里程碑:这是AI系统首次在没有人类指导的情况下做出真正的生物学发现。市场为之沸腾。估值攀升。头条新闻宣称AI正进入科学自主的新纪元。

然后马里奥·罗德里格斯·梅斯特(Mario Rodriguez Mestre)站出来反驳了。

梅斯特是哥本哈根大学计算生物学博士候选人。他表示,他的研究团队自2022年起就在研究同一种酶——他和合作者将其称为ART(Associative Reverse Transcriptases,关联型逆转录酶)。他说,三年来他的实验室已向Claude(Anthropic的语言模型)分享了未发表的研究成果、代码和论文草稿。与Anthropic声称的发现之间的重叠并非巧合,他认为这是结构性的。

这个故事之所以重要,是因为它落在了贯穿每一条AI驱动科学发现主张的一条断层线上。如果AI并未独立发现任何东西——如果它的"突破"实际上只是对其用户早已告诉它的内容的精妙重组——那么整个"AI作为科学家"的叙事就会轰然崩塌。而这个叙事的市值高达数百亿美元。

Anthropic声称发现了什么

Anthropic自己的生物实验室报告称,其AI代理扫描了一个包含数十亿基因序列的数据库,并在巨型噬菌体基因组中RNA基因簇之间识别出了一种新型逆转录酶。AI将这种酶命名为ART,并将这一发现作为证据,表明机器系统可以为生物学领域做出自主贡献——而生物学是一个传统上依赖湿实验室验证和同行评审的领域。

逆转录酶本身并不新奇。它们是一类研究透彻的酶,能够将RNA转化为DNA,在从HIV治疗到CRISPR等基因工程工具等各类应用中扮演着核心角色。Anthropic声称,ART的独特之处在于它周围的模式——密集的RNA基因紧邻编码酶的序列排列,暗示了一类新型关联型逆转录活性。

梅斯特说他早已知道

梅斯特的实验室于2022年开始调查类似ART的系统,距离Anthropic的发布大约早了四年。他团队研究的某些逆转录酶已列于一份2023年的专利中,梅斯特是该专利的共同发明人之一。这项工作尚未发表在同行评审期刊上。

在此期间,该实验室广泛使用Claude——用于编写代码、起草论文章节和构建论证框架。梅斯特确认,关于ART及其周围RNA基因簇的未发表细节,曾在多次对话中被输入模型。他所担忧的不是Claude窃取了他的数据,而是Claude可能直接或间接利用这些对话得出了如今冠以Anthropic之名结论。

“关键问题不在于ART是否已被人知晓,“梅斯特说,“而在于AI是否真的独立推理出了这一结果,还是受到了我们研究内容的影响。”

他还提出了一个更令人不安的可能性:他实验室的未发表成果可能被融入了Claude未来版本的训练数据中。如果Anthropic正是建立在对研究人员私人工作的利用之上,那么该公司所吹捧的每一次"独立"发现都可能悄悄地带有衍生性质。

Anthropic的回应及其局限

Anthropic在一则简短声明中否认了这一指控。该公司表示,Claude不使用用户对话历史进行训练,其分子生物学研究团队无法接触梅斯特的对话记录,并且公司不知道任何此前已发表的描述ART系统的文献。

这些说法均未能解决来源问题。即使Anthropic并未有意用梅斯特的数据训练Claude,该模型的行为仍由其处理的所有交互的总和所塑造。如果梅斯特的实验室向Claude输入了关于ART性质的详细描述,而Claude后来又在另一种语境中产生了类似的描述,那么无论公司政策如何,其谱系都难言清白。

该公司声称没有已发表的文献描述过ART的说法也站不住脚。美国格拉德斯通研究所的副研究员塞斯·柴尔德斯(Seth Childs)在接受《纽约时报》采访时表示,他与梅斯特多年来一直在讨论ART系统,且该领域的研究人员早已对这种酶有所了解。科学家之间的熟悉程度不等于公开发表。但至少在最佳情况下,Anthropic将ART描述为"未知”——因此是由AI新近发现的——这一框架是存在争议的。

同样的模式正在重演

这并非AI生成的科学主张与使用相同模型的Researchers发生碰撞的首次案例。9月8日,OpenAI宣布其解决了某个长期存在的数学问题。一位同样使用OpenAI模型研究该问题的数学家回应称,他的研究可能影响了最终结果。

结构完全相同:研究人员将未发表的工作注入AI;AI产生了看似发现的成果;建造AI的公司声称对该发现拥有功劳;而原始研究者只能留下一个问题:我是否帮助构建了自己的抹除?

谁赢谁输

如果市场接受其AI做出了独立的科学突破,Anthropic就赢了。这个故事强化了该公司作为AI科学领域严肃玩家的定位——在这个领域中,即使是 modest 的自主性宣称也值得数以亿计的投资者资金。

如果这种模式成立,研究人员就输了。每一个将私人数据喂入商业AI模型的实验室都成了公司下一次产品发布的无心贡献者。劳动没有得到报酬,归属被完全抹去,知识产权——如果那还能被称为知识产权的话——消失在了黑箱之中。

科学共同体失去的是更抽象的东西:信誉。当AI的"发现"无法被独立验证——当推理链条不透明且训练数据保密——该发现就脱离了科学验证的正常机制。同行评审无法审计模型接受了何种训练。如果发现并非真正独立,复制研究也就无从开展。

接下来会发生什么

梅斯特表示他正在减少Claude的使用,并将项目转向其他AI模型。“我要停止一切了,“他说。

这是个人决定。结构性问题依然存在。只要研究人员继续使用商业AI工具进行编码、起草和分析——只要这些工具基于可能间接影响未来输出的数据输入运行——合作与榨取之间的界限就会继续保持模糊。

这一事件还引出了一个尚未进入严肃政策辩论的监管问题:AI公司是否应被要求在所称"发现"与已有的未发表研究存在重叠时进行披露?此处的透明度虽不能解决归属问题,但会迫使市场直面这一发现究竟是什么——以及它属于谁。

Anthropic的酶类发现主张或许仍能经受住审查。但由此引发的争议已经正在做着重要工作:揭露了AI公司为其突破所讲述的故事与这些突破实际产生过程中混乱现实之间的鸿沟。