AI狂购旧书:千亿训练数据背后的版权危机与人类知识黑洞
人工智能产业的狂飙突进背后,隐藏着一场关于人类知识载体的隐秘战争。近年来,多家头部AI公司通过中间商大规模收购二手图书,随后对其进行切割、扫描,最后物理销毁。这一荒诞而高效的产业链,其核心目的并非保存文化,而是为了获取2022年之前“未被机器污染”的高质量人类文本数据。斯坦福大学2026年的AI指数报告揭示了一个严峻事实:自2025年初以来,互联网新发布内容中AI生成的比例已超过51%,这直接导致了驱动模型迭代的原始数据源急剧枯竭。
这种对纯净数据的饥渴,迫使AI企业转向被互联网遗忘的角落——实体旧书。这些书籍经过出版商的精心策划、编辑的校对以及作者的原创,构成了人类智慧的基石,其结构是任何网络爬虫无法自动复制的。然而,获取这些资源的成本正在指数级上升。从单次订单1000本到惊人的100万本,书商们的销量在数月内飙升五倍。这不仅是商业数据的异常波动,更是AI产业核心悖论的具象化体现:技术越成功,赖以训练的人类数据就越稀缺。
数据污染与“模型塌缩”的数学必然
理解AI公司为何愿意花数千万美元购买、拆解并销毁旧书,必须首先厘清“模型塌缩”这一概念。牛津大学、剑桥大学等机构联合发表于《自然》杂志的研究证明,当AI模型使用由AI生成的内容进行递归训练时,输出质量将不可避免地退化。
研究人员使用Meta的OPT-125m模型进行迭代实验,仅经过九次迭代,模型输出便从关于14世纪教堂塔楼的建筑讨论,彻底跑偏至介绍各种不存在的兔子物种。这种退化并非偶然,而是由统计近似误差、函数表达误差和函数近似误差三类误差复合效应导致的数学必然。只要其中任何一类误差存在,塌缩就在所难免。
Epoch AI的测算给出了明确的时间窗口:语言模型将在2026年至2032年间耗尽人类公开的高质量文本数据。合成数据虽被视为解药,但微软Phi-4和谷歌Gemma等模型混入合成数据的实践显示,训练数据中仅0.01%的虚假文本就可能导致模型有害输出增加11.2%。这种指数放大的污染效应,使得互联网上的公开数据逐渐失去训练价值。
此外,作者们的反击也在加剧数据获取的难度。芝加哥大学开发的Nightshade工具能在图像中嵌入让模型“中毒”的像素级修改,其文本领域的同类工具也在同步发展。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。相比之下,2022年之前印刷的纸质书,在时间线上天然免疫了这种数字污染,成为AI企业眼中的“干净数据”金矿。
隐秘的“巴拿马计划”与旧书掠夺
在数据需求的驱动下,ISBNdb这家原本服务于图书馆和书商的图书数据库公司,迅速转型为AI行业的隐形巨头。其官网直言不讳地指出,书籍代表经过精心策划的人类知识,是任何网络爬虫无法复制的资源。该公司提供从1000本到100万本的批量采购服务,并承诺签署保密协议,买家姓名永不披露。
Anthropic的“巴拿马计划”(Project Panama)是这一模式的典型标本。2024年初,该公司启动这一严格保密的项目,内部文件明确写道:“我们不想让人知道我们在做这件事。”随后一年内,花费数千万美元购买了数百万本纸质书。该项目负责人汤姆·特维,这位曾参与Google Books项目的硅谷老兵,主导了这一大规模的数据采集行动。
具体的操作流程冷酷而高效:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,随后将纸质残骸直接送往回收公司销毁。供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款甚至承认:“大规模扫描通常会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”
这种批量采购呈现出几个显著特征:采购对象几乎全部带有国际标准书号(ISBN),便于去重和溯源;完全没有主题、类型或作者偏好,小说、教材、专业书籍一概收入囊中;买家对价格不敏感,即使部分图书明显高于市场价,也会直接买下。被大量买走的书籍多为地方史、小城镇志、已消失学科的旧专著、小语种文献等“长尾、冷门、几乎没有商业价值”的绝版书。这些书籍因此更易被批量收购和销毁,甚至可能永久退出流通。
法律博弈:买书合法,偷书不行
旧书的毁灭引发了严重的法律争议。2025年6月,联邦法官威廉·阿尔苏普作出了一项双重裁定,揭示了这一行为的法律边界。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练具有“变革性”。他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。
另一方面,法官认定该公司在启动巴拿马计划之前,曾从盗版网站LibGen下载包含700万本盗版图书的数据库,侵犯了版权。2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)的和解提案,创下美国版权案件纪录。2026年7月,最终和解获得批准,91%的作者和出版商已领取赔偿份额。
这组判决传递了一个清晰的信号:只要书籍是合法购买的,法院可能不干预其购买、拆解、扫描和销毁的行为;但从盗版网站下载数据的代价则极其昂贵,每本侵权作品最高可判罚15万美元。Anthropic的律师团队基于“首次销售原则”和“合理使用”提出双重辩护,认为合法购买后,所有权人有权处理该副本,且扫描件仅用于内部训练不对外分发。销毁原件反而被视为“规避非法复制”指控链条的一种手段。
与此形成对比的是谷歌和Meta面临的诉讼。谷歌被指控未经授权将受版权保护的图书用于训练Gemini AI模型,出版商联盟指控其从LibGen、Anna's Archive等盗版网站获取了超过267TB的材料。这些案例共同揭示了一个奇怪的产业逻辑:从盗版网站免费下载数据最终可能付出巨额法律代价,而通过合法渠道购买并销毁数据,虽然成本高昂,却被法院认定为合法路径。这种“合法但更贵”的模式正在重塑AI训练数据的供应链。
知识私有化与公共领域的消失
这场旧书争夺战背后,隐藏着更深层的社会隐忧。AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。这与图书馆数字化的使命形成鲜明对比:图书馆数字化旨在保存和传播,公众可访问数字化内容;AI公司的数字化则是为了消耗和训练,内容进入私有数据库后成为公众无法触及的“黑洞”。
在批量采购中,AI公司是否区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍中,很多可能已无其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。这种知识资源的集中与私有化,可能导致人类共同文化遗产的碎片化和不可逆损失。
对中小作者而言,打击同样真实。尽管部分公司尝试提供授权,但报价在经济上完全不具吸引力,一张永久AI训练许可证的报价约为每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们只能被动接受。这种经济上的不对等,加剧了创作生态的失衡。
对中国AI从业者而言,挑战尤为严峻。业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,而如此量级的中文高质量数据目前根本不存在。这使得“获取纯净中文纸质书数据”对中国AI公司而言,既是一个迫切需求,也是一个更困难的挑战。
旧书耗尽之后的未来困境
即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并未解决根本问题。
学术界正在探索多条出路。有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。
但这些技术路径都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾在于,AI的成功正在毁掉它赖以成功的数据源。技术优化无法消除这一结构性矛盾,因为数据污染是递归训练的内生属性。
我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个单纯的技术问题,而是一个关于人类文明如何与人工智能共存的根本性问题。
旧书的终结可能预示着一种新的数据范式诞生,但这种范式必须在尊重人类智力成果的基础上建立。否则,AI可能在获得无限智能的同时,失去与人类真实世界的连接,陷入自我指涉的虚无循环。唯有重新审视数据获取的道德边界与法律框架,才能确保人工智能的发展真正服务于人类的福祉,而非成为吞噬文明记忆的黑色漩涡。