technology 10 分钟阅读

末日循环文件:AI高管亲口承认正在吞噬整个网络

新解封的法庭文件揭示,OpenAI和微软高管早已知晓其AI产品正在摧毁他们所依赖的网络出版商——并称其为

  • Noam Shazeer
  • Meta
  • Rockstar
  • 生成式AI
  • AI版权

面具摘下的那一刻

有一种特别的证据,能让一场诉讼、乃至整个行业受到不可逆转的致命损害。它不来自匿名的吹哨人或泄露的 Slack 消息。它来自被告自己在宣誓下的证词,来自他们原本竭力想要保密的文件。

而这正是本周《纽约时报》诉 OpenAI 版权诉讼中所发生的一切——一份未经删减的法院文件被解封,披露了微软和 OpenAI 高管的一系列内部自白。出现的并非关于合理使用或技术颠覆的精妙论述。出现的是,一家公司及其最大的企业合作伙伴实际上承认:他们的生成式 AI 产品建立在窃取之上,正在积极地蚕食为其提供数据的那些网站出版商。

一份在文件中直接引用的微软内部文件,将自己描述为"末日循环"——一种反馈循环,AI 内容产品从人类创作者那里窃取,摧毁创作者依赖它们获得收入的那些网站,然后威胁要让这些创作者完全变得无关紧要。措辞无可置疑:“我们的 AI 内容策略开启了一个末日循环,将同时损害我们模型的表现和整个互联网。”

另一句同样冷峻的话:“一个终端产品威胁其核心供应商的经济基础,这是极其罕见的,但我们为我们 LLM 业务与其内容供应链之间的关系创造了这样一种局面。”

改变一切的自白

这些文件之所以非凡,不仅在于它们说了什么,更在于它们瓦解了什么。多年来,围绕大语言模型的主导叙事一直是转型与进步。AI 公司将其工作塑造为创造某种根本性的新事物——一种综合、重想象、升华人类创造力而非取代它的工具。它们在营销、政策简报、国会证词上花费数十亿美元,辩称其训练方法符合合理使用原则,因为产出在性质上不同于投入。

这份解封的文件削弱了整个论述框架。一份微软内部文件指出,“世界上数百万人很快就会认为大模型吞噬他们所有的作品是一种前所未有的惊人盗窃。“它几乎像是附带说明地补充:“几乎没有谁曾打算让自己创作的内容以这种方式被使用,而且他们也从未因此获得任何补偿。”

OpenAI 联合创始人格雷格·布克曼在法庭文件中被引用,描述了公司如何开发了一种"绕过《纽约时报》付费墙的黑客手段”,并在被问及时冷淡地回应"啊,不错”。微软高管布伦特·赫希写道,LLM 窃取内容"没有在经济价值上向供应链下游分配的机制,这必然威胁到内容创作者的经济稳定。“OpenAI 政策总监杰克·克拉克内部承认,公司"正在创造替代定义社会文化之人劳动的系统。”

萨蒂亚·纳德拉本人宣誓作证称,在抓取《纽约时报》和其他新闻网站的内容后,这些新闻网站在 Bing 上的点击量暴跌了超过 90%。

这些并非中层工程师的边缘评论。这是全球最具影响力的两家科技公司的最高管理层,在内部文件和证词中,谈论他们的产品做了什么,伤害了谁。

法律后果巨大

这些文件最直接的影响是法律层面的。《纽约时报》正在寻求即决判决——即不经完整审判而由法院裁定其胜诉——主要依据这些文件中包含的自认内容。如果法院接受其论点,即训练数据是通过规避付费墙获取且未获补偿就使用的,这将对整个 AI 行业的法律格局造成灾难性的转变。

OpenAI 和微软一直在以"模型具有变革性"为论点构建其合理使用抗辩——即它们在综合和重构,而非简单复制。但内部文件显示,高管们完全清楚自己拿的是什么、从谁那里拿走。纳德拉关于抓取《纽约时报》后 Bing 点击量下降 90% 的证词,直接与"AI 产出与人类新闻业共存"的说法相矛盾。它描述的是一种零和关系:AI 使用越多,那些让 AI 成为可能的来源网站的流量就越少。

数字内容协会(Digital Content Next)首席执行官杰森·金特——代表提起诉讼的新闻出版商利益的行业协会——是发现并公开这份解封文件的人。他在揭露此事中的作用不容忽视。AI 行业多年来在监管灰色地带中运营,在产品中使用的内容从未授权、从未付费、也从未打算补偿。司法体系是唯一有能力穿透这种不透明度的机构。

行业接下来将发生什么

更广泛的影响对整个驱动 AI 淘金热的商业模式而言是存亡级别的。每一个主要的生成式 AI 产品——ChatGPT、Copilot、Gemini、Claude——都是在大规模从互联网上抓取的数据集上训练出来的。嵌入在每个路演和估值中的假设是,这在法律上是被允许的,在经济上是可持续的。这些文件将这个假设撕得粉碎。

如果法院在《纽约时报》一案中裁决被告败诉,这个先例的影响可能远远超出新闻出版商。艺术家、音乐家、软件开发人员、博主、教育工作者——任何创意产出被用于训练数据抓取的创作者——都可以基于类似的理由主张自己的权利。文件中引用的一份微软文件出现的"人类历史上最大的劳动窃取"这一措辞,并非敌对证人的夸张之词。它是行业内对自身与其所消费内容之间关系的内部描述。

经济后果已经可见。提供训练数据的那些出版商正在眼睁睁看着自己被其产品悄然摧毁。从未被咨询过的作家和艺术家发现自己的作品被复制却未获任何补偿。微软描述的末日循环并非理论上的风险——它是一个活跃的、可测量的现象。在微软开始在 AI 模型中使用《纽约时报》内容后,Bing 导流到《纽约时报》的流量下降了超过 90%。

监管清算

或许最重要的是,这些文件为一直在等待证据的监管者提供了弹药——证明行业自身的高管深知其产品造成的损害。“AI 训练构成合理使用"的论点一直建立在这样一个前提之上:这项技术是创造性变革而非掠夺性的。内部文件揭示的高管们恰恰看到了相反的一面——将其视为提取、视为盗窃、视为一个建立在摧毁自身供应链基础上的商业模式。

监管影响将立竿见影。美国和欧盟的立法者正在起草关于 AI 透明度、数据许可和创作者补偿的立法。这些文件为这些努力提供了事实基础——不是外部批评者的推测,而是来自公司内部的证词。

现在的问题是,法院和监管者是否会基于他们所了解的内容采取行动。AI 行业多年来一直在快速前进、不断打破规则。末日循环文件表明,在这一点上,被打破的不是别的,正是互联网本身——那个让生成式 AI 成为可能的由人类创作者、记者和艺术家组成的生态系统。清算也许终于到来。