technology 9 分钟阅读

日本文书店化为美国AI提供燃料,一次倾倒50吨

去年,一家日本出版批发商将超过50吨日文书籍运往美国。法院文件和出口数据指向AI训练——这是数据经济的物理足迹,以被销毁的纸张来衡量。

  • 纽约时报
  • AI训练数据
  • Anthropic
  • 出版批发商
  • 版权

仓库里堆满了书。然后它们消失了。

在美国的某个地方,一座仓库正在缓慢地填满日本纸张。不是小说畅销书,也不是旅游指南——那些是几十年前的老书、学术专著、漫画档案,以及一家大型日本出版批发商库存中的 everything。这些书是通过集装箱运来的。仅去年一年,出口记录就显示超过 50 吨货物以“日本书籍”的名义离开日本。

如果每本都是重达 500 克的精装书,这批货物的总量约为 10 万册。这不是图书馆采购。这是一条数据源。

纸质线索指向法庭文件

实体书与人工智能训练之间的联系在日本尚未得到证实,但来自多个方面的间接证据正在汇聚。日本网络新闻调查机构利用贸易分析平台 Sayari 锁定了这些航运记录。美国法庭文件则点名了该批发商的集团企业,将其与美国 AI 公司 Anthropic 联系起来——这家 AI 公司曾公开讨论过系统性地扫描全球每一本书的计划。

Anthropic 的做法是刻意的粗暴。该公司不逐一授权文本——而是购买或收集实体书,用工业装订设备将其拆解,以高速拍摄每一页,再将结果数字化,最后丢弃残骸。这个过程将出版作品转化为机器可读数据,随后销毁原始载体。据 404 Media 引用的美国法庭文件显示,日本出版物也在目标之列,一家日本大型出版取次(即位于日本出版供应链核心的批发分销商)的名字出现在文件中。

亚马逊也在运行类似的操作。美国媒体报道称,该公司在仓库中收集实体书,将其装订成巨大的滚筒,通过扫描仪处理,然后将废墟扔掉。日文书籍也包括在这些 shipment 中。

批发商本身拒绝确认最终用途。它向调查机构表示,不知道自己的集团书籍被出售给 AI 公司用于学习目的。但出口记录不会说谎——50 吨“日本书籍”在一年内跨越太平洋,而买家身份在海关数据中并未披露。

50 吨究竟意味着什么

要理解规模,需考虑日本的出版生态系统。日本每年生产大约 30 万至 40 万种新书。10 万册的 shipment 代表了库存中相当可观的一部分——那些原本只能堆在仓库或被打成纸浆的书。这不是转瞬即逝的数字文件。它们是受版权保护的文本,拥有署名作者、插画家、编辑和出版商,名字印在每一页上。

漫画维度尤其重要。日本的漫画产业产值达数百亿美元,依赖严格控制的发行模式。如果 AI 公司正在系统地吸收日本漫画档案,它们不仅仅是在复制图像——而是在吞入一种历经数十年形成的视觉语言,包括分镜构图、墨色技法以及叙事节奏惯例,这些在没有源材料的情况下难以复刻。

法律灰色地带

日本目前的版权法将 AI 学习视为法律灰色地带。早稻田大学法学部教授上野达宏表示,现有框架可能允许 AI 学习作为信息分析的一种形式——但他立即补充了一个重要例外:如果使用不正当损害版权持有者的利益,豁免可能不适用。

这个限定条件正是争议的核心所在。也是全球数十起诉讼堆积的地方。

日本出版商已为此斗争多年。日本杂志出版协会于 2023 年发表联合声明警告称,通过未经授权的 AI 学习大规模生成内容将摧毁创作机会,使商业出版在经济上不可持续。2025 年,出版社和日本漫画家协会在一份声明上联合署名,要求企业在将受版权保护的作品用于 AI 训练前获得proper licensing。

他们的论点很简单:如果 AI 公司需要数百万本受版权保护的文本才能构建产品,而该产品又与其所消费的作品创作者直接竞争,那么经济逻辑就会崩塌。作者拿不到钱。插画家拿不到钱。出版商拿不到钱。书在这个过程中被销毁。

谁赢谁输

赢家很明显。那些在不谈判个别授权的情况下就获取海量训练语料库的 AI 公司,将数据获取成本从潜在的上亿美元降至二手书加运费的价格。基础设施到位后,额外训练数据的边际成本趋近于零。他们的模型得到改进。他们的估值上升。

输家是书中所有内容创作者——而且这并非假设性担忧。日本作者和漫画家已经看到自己的作品未经许可、未获补偿就出现在 AI 训练数据集中。经济损失是缓慢累积的。读者开始接触到与人类作品难以区分的 AI 生成内容。如果竞争环境被基于其目录训练的衍生模型淹没,出版商无法收回投资。专业创作的整体激励机制正在侵蚀。

接下来会发生什么

法律局势天生不稳定。日本当前的版权框架是在大规模商业 AI 出现之前制定的。“信息分析”例外正在全球法院进行测试,目前尚无任何司法管辖区形成稳定标准。日本很可能会走上同一条轨迹——零碎的判决、摇摆的解释,以及逐渐积累的案例法,这对创作者和 AI 公司都难以令双方满意。

更实际的压力可能来自市场力量。如果 AI 公司继续依靠窃取的数据运营,替代方案就是专业人士完全退出——仅在验证人类署名的平台上独家发布,拒绝为任何数据集授权作品,或构建防止扫描的技术措施。这些现象已经出现。它们是否足以改变企业行为,仍是一个开放性问题。

这批 50 吨的 shipment 讲述的故事远超一家批发商转移库存。它记录了一个时刻:美国 AI 公司的数据饥饿跨越太平洋,将日本的图书馆、仓库和书店化为燃料。书是真实的。作者是真实的。破坏是真实的。现在的问题是,日本法律——以及未来的全球法律框架——会将此视为商业模式,还是其他性质完全不同的东西。