互联网被AI污染,科技巨头为何疯狂抢购旧书?

互联网被AI污染,科技巨头为何疯狂抢购旧书?

在互联网新发布的内容里,AI创造的已超过半数,优质人类文本日益成为珍稀资源。

为了获取2022年前这些「机器未接触过」的训练素材,多家从事AI的企业开始通过数据商人疯狂采购二手书,随后进行切割、扫描、销毁。Anthropic公司的隐秘「巴拿马计划」被曝光,其随之产生的和解协议刷新美国版权诉讼纪录——达到15亿美元。

这个现象背后隐藏的,不止是数据的争夺,更是AI产业无法回避的根本悖论:成功越多,反而越需要依赖的人类文本资源就越难寻觅。

百万旧书何处去

调查机构404 Media在今年七月曝光了一项活动:借由ISBNdb等数据中介,众多AI企业启动了大规模二手书采购。这类图书经历着固定流程——移除书脊、使用高速扫描设备转换、最后销毁处理。单笔订单可能涉及千本,也可能达到百万级。从事书籍买卖的商户发现交易频率在几个月内激增,销售量翻了五倍。Anthropic企业的内部资料揭示了一个名为「巴拿马计划」的项目:该项目耗费超数千万美元,用于购置百万级数量的纸质图书,其后全部经历拆解、扫描、销毁的过程。

为何AI企业肯投入巨资去做「购书、切割、销毁」这套流程?答案在于一个自身造成的困局:互联网已被AI生成物质严重污染。

斯坦福大学发布的2026年AI指数报告呈现了一组触目的数据:从2025年开始,新上线的互联网内容中,AI生成部分的占比已冲过50%大关(51.72%)。而在ChatGPT推出的2022年之前,这个数字基本等于零。Cloudflare统计的另一组数据也印证这一态势——它所运维网站接收的访问请求中,大约57.4%源自AI与自动化工具,仅42.6%来自真实用户。需要说明的是,这一统计针对的是HTTP请求数量而非用户实际的阅读行为,AI Agent一次可以浏览成千上万个页面,而真人可能只需几次点击。

当AI模型继续利用AI生成的内容进行训练时,就会产生「模型塌缩」现象(Model Collapse)。2024年七月,牛津与剑桥等学府的研究人员在Nature期刊上发表了联合研究。他们以Meta的OPT-125m模型作为实验对象,输入关于14世纪教堂塔楼的维基百科段落,观察到了什么?第一代输出仍在论述建筑;到第五代时,内容偏向语言翻译;等到第九代,模型开始热情地讲述各种真实不存在的兔子物种。从教堂到虚拟兔子,只需九个循环。

AMP

递归训练下模型输出质量的退化趋势(基于Nature 2024封面论文实验数据)

该论文确认了促进质量恶化的三类误差的叠加作用:由于采样有限而遗失尾部数据的统计近似误差、神经网络无法完全贴合分布的函数表达误差、优化算法自身携带的结构偏差所产生的函数近似误差。只要这三类误差里有任意一个存在,坍缩就必然发生。这不过是数学规律使然。

Epoch AI的计算给予了明确时间指向——到2026年至2032年间,语言模型将耗尽人类公开可得的高质量文本。合成数据似乎能解这个难题,微软Phi-4、谷歌Gemma等已混合使用合成数据,但已有研究表明,仅需训练数据中0.01%的虚假文本就会让模型有害输出增加11.2%,这是指数级的放大。

理解了「模型塌缩」这个逻辑起始点,就能明白为什么AI企业愿意付出数千万美元购买「2022年之前印刷的纸质图书」。ISBNdb在其公开博客中明确指出了关键所在:「2022年之前的纸质书,在结构上确保没有遭遇这种污染。单单这一点,价值就不可估量。」

AMP

互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)

形势更加严峻的是,作者与出版商已经展开反击。芝加哥大学研发的Nightshade工具能够在图像中嵌入人眼无法感知但足以让模型「中毒」的像素级变更。其文本领域的对应产品也正在开发中。

自2024年问世以来,Nightshade已获得广泛下载。Anthropic联手英国AI安全研究所的研究证实,仅仅250份经过精心设计的有毒文档,就足以在数千亿token规模的语料库中为模型埋下后门。这表明从互联网爬取的数据无法确保「安全无污染」,唯有纸质书从时间轴上就天然具备免疫能力。

困难之处在于:纸质书虽然清洁,其获取方式却激发了新的冲突。

纸质书的争夺

ISBNdb原本只是一家数据库运营商,为图书馆、书店及出版企业提供服务,库中存储超1.11亿本图书的目录信息。如今,它把业务方向转向了AI产业。

其网站表述道:「书籍代表精心策划、经历同行评议、特定领域专家撰写的人类知识,其结构形式是任何网络爬虫都无法模拟的。」该公司提供从千本到百万本级别的批量供应,并承诺严格保密,每笔协议都附带NDA条款,采购者身份永不公开。

根据404 Media的报道,采购单据呈现出几个异常特点:购置品类基本都含有国际标准书号(ISBN),便于数据消重与来源追踪;完全忽视主题、类别与作者倾向,小说、教科书、专业著作不区分对待;购买方对价格毫不计较,即便某些图书远超市价,照样直接采购。

一位书商跟404 Media透露,前一周只能卖出约二十本书,而最近几个月每周销量猛增到数百本,足足是往日的五倍。他坦承:「对我来说这是把双刃剑,经济效益明显改善,但看着这些少见的书就这样被粉碎,我心里不好受。」

被大量收购的书大多是「小众、冷僻、几乎无商业价值」的品类,如地域史志、小城镇年鉴、已成历史的学科旧作、少数民族语言或原住民文献、个人自费出版的战争回忆、印数极少的学术文集。这些绝版书籍也更容易沦为批量收购与销毁的对象。

AnthropicPublishes的巴拿马计划提供了一个完整范例。该企业在2024年初启动了这一严格保密的项目。内部文件记载道:「巴拿马计划代表我们对世界各地所有书籍进行破坏性扫描的努力。我们不希望外界知道我们在进行这项活动。」

随后的十二个月里,该企业投入数千万美元,购置了百万级规模的纸质图书。统筹该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷资深人士。

今年一月的报道进一步说明,Anthropic的联合创始人本·曼恩早在2021年就手动从违法网站LibGen下载了至少五百万本盗版图书,2022年又从另一网站下载至少二百万本(部分法庭文件记载为五百万本,具体数字在诉讼过程中有分歧),并给同事分享了链接,附言:「真的是天赐良机!!!」

CEO达里奥·阿莫代伊知悉此事,在内部信件中将获取正版授权的理由归纳为「法律上/实践中/商业上的繁冗程序」。

具体运作方式如下:作业人员用液压设备切开书脊,将书页导入工业级扫描系统,转换为高质量PDF,然后将纸质残余直接送进废物处理厂。据法庭资料记载,供应商方案中标注的扫描工作量在五十万到两百万之间,完工周期约为半年。ISBNdb的使用条款中也说明了这一点:「大规模扫描作业通常会导致图书损毁。工人移除书脊,使书页通过机器,这比谨慎保存的替代方案更迅速、更经济。」

ISBNdb的商业推广文案坦白承认:「AI企业销毁两百万本图书,显然不是个能赢得好感的新闻标题。」该公司建议客户将此举重新标签为「数字化保护」。然而,图书馆的数字化目标是保存与分享,AI企业的数字化目标是消耗与训练,扫描后的素材进入密闭的数据库,社会公众无从获取。

旧书被采购、被切割、被转换为数码文件,再被物理销毁。这一系列步骤在法律上处于什么立场呢?Anthropic那15亿美元的和解案给出了答案。

购书合理,盗书违法

在2025年六月,联邦法官威廉·阿尔苏普(William Alsup)做出了一份双重裁决。其一,他认为Anthropic的破坏性扫描属于「合理利用」(fair use),理由是训练属于「具有转变性的」行为。

他用教师指导学生写作的例子作比,声称「作者无权禁止他人以学习或培训的目的使用其著作」。其二,同位法官判定该公司在启动巴拿马计划前,曾下载过一个含七百万本盗版图书的数据库(LibGen),这构成了著作权侵犯。

到了2025年九月,阿尔苏普初步同意了Anthropic的15亿美元(折合约101.62亿元人民币)和解方案。2026年七月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这创造了美国版权诉讼有历以来最高的和解额度,超九成的作者与出版社已领取赔偿。

这组裁定传递了一个明确的讯号:购书、切割、扫描、销毁,只要图书是合法取得的,法院可能不会干涉;但如果你从盗版源头下载,代价会极其惊人,每件侵权作品最高处罚可达15万美元。

由此形成了一种荒诞的激励机制:如果你保留原件或对外公开扫描件,法律地位反而更不稳固,因为可能产生新的版权副本并流向市场。

AnthropicPublishes的法务团队采用了两层防护:其一基于「首次销售原则」,一旦合法获得一本书的所有权,持有人有权对该副本进行任意操纵;其二加上「合理利用」,扫描件仅供内部AI训练应用,不对外散发。销毁原件反倒「阻断了非法复制」的指责链条。

七月十四日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作者斯科特·图罗联合在纽约联邦法院对谷歌发起诉讼,控告其未经授权利用数百万本受保护图书来训练Gemini AI产品。

与Anthropic的案件有所不同,谷歌案的关键在于「授权但范围外」:出版单位曾赋予谷歌通过Google Books等特定路径使用作品的权限,但从未许可用于商业AI产品的开发。Meta同样遭遇相似诉讼,出版商协会指责其从LibGen、Anna’s Archive、Sci-Hub等多个非法网站获取超过267TB的受版权保护资料。

AnthropicPublishes的案例揭示了一套奇异的产业运作模式:从盗版服务器免费获取七百万本电子版,最终被要求赔付15亿美元;而巴拿马计划虽然开支巨大,却被法院判定为合法。这种「合法但成本高」的途径正在改造AI训练数据的整个供应链。ISBNdb正是这一模式的实现载体:它不创造数据,仅充当图书的流通商,但流通的是法律上清白的数据。

法律空隙滋生了新的商业生态,也带来了更深层的担忧。

人类知识陷入密室

这次对旧书的争夺揭示了一个巨大的悖论:AI产业一边说要「让人类知识随处可及」,一边在买断、摧毁人类知识最坚固的载体。

扫描完成后的数码内容被存入AI企业的私密数据库,只用于驱动自家模型,一般用户无法触及。群众或许会获得更聪明的AI助理,但付出的代价是大量知识财富从开放领域消亡。

这与图书馆进行的数字化使命在本质上完全不同:图书馆数字化是为了保护与流传,用户可以接触到数码版资源;AI公司的数字化是为了吸收与练习,内容一旦进入私人数据库就不再公开。

前者是知识的「放大镜」,后者是知识的「黑洞」。

在大规模购买过程中,AI企业是否会区别普通书籍和稀有或绝版书籍?若珍稀书籍被拆毁,它们可能永久从流通中消失。那些被大批采购的小众书籍——地方文献、土著言语书籍、稀有外文著作等等,很多可能已经找不到其他存世本。当购买规模达到百万级并且完全不公开时,外界机构无法确保稀有书籍不混在其中。

对小型和独立作者,伤害同样是实在的。Packt Publishing协作关系副总裁(同时是ExpertEdge CEO)Oli Huggins指出,AI企业当前给出的授权费用「经济上毫无吸引力」,一份永久的AI训练许可证报价仅为每本书十美元左右。全球各地的自由撰稿者无法负担顶级法律事务所的代理费用,当他们的著作被切成数码比特时,只能眼睁睁地看着。

AMP

几组关键数据对比

对华语AI研发者来说,形势更为严峻。业内评估显示,高质量中文数据在全球大型语言模型的训练库中所占份额极小。数据短缺迫使本土开发者更加倚赖机器翻译和人工生成文本,进一步恶化了数据质量。DeepSeek-V3需投入14.8万亿个优质文本片段才能完成训练,这个量级的中文高质量内容,现阶段根本不存在。这使得「获取洁净的中文纸本数据」对国内AI企业成了一个紧迫但极其困难的课题。

这类隐患都指向一个更根本的疑问:旧书数量有限,互联网上的AI生成物却无穷无尽。旧书资源穷尽后,AI还有何处可去?

当旧书不复存在

就算AI企业今天收购了所有旧书,下一代模型进行训练时还能找到无污染的数据吗?每一轮AI生成的素材都在污染互联网,而更新一代的模型需从这片被污染的海域中搜集资料。购买旧书只是延后了模型坍缩的进度,无法解决根本问题。

学术圈在积极寻求多种出路。

已有研究表明,只要培训流程里不断存在真实数据(采取「叠加」而非「替代」的方法),模型表现不会骤然恶化。独立研究人员设计的「反尾部污染」试验显示,品质筛选机制不但能减缓退化,甚至可能逆转这一过程。今年五月发表在《物理评论快报》的研究也证实了,仅需在训练中混入一条来自闭合循环以外的真实数据,就能有效阻止模型坍缩。

但这些解决思路都存在弱点:它们换来的只是时间,不是长久之计。模型坍缩的根本问题在于,AI越是进步,就越在摧毁使其进步的数据,这个矛盾不会因为技术改良而消失。

我们所需的,不只是更高效率的数据获取策略,更需要一套新的游戏规则,让技术演进与知识保留、商业目标与社会利益、AI发展与人的尊严能够和谐共生。

一旦AI将人类笔下的最后一句话也吞进去,互联网残存的就只有AI自己的声音了。人类历经数个世纪积累的文明,正在被AI企业用数年时间一口吞下。这已经不是技术层面的问题,而是人类文明与人工智能怎样共存的根本课题。


上一篇 2026/08/01 00:39
下一篇 2026/08/01 00:49

相关推荐

  • 「致命电子游戏」背后:被政权追击的以色列导演如何揭露真相

    《NAZA》在威尼斯电影节首映获评审团特别奖。以色列导演通过访谈情报人员揭露国防军使用AI系统在加沙进行轰炸的真相,却遭政府官员指控叛国。纪录片以冷静手法展现战争的隐形运作机制与道德困境。

    2026/09/17
    00
  • 「AI安全大考」中国为何不肯妥协?

    前国务院特使揭示美中AI对话实相:北京规避安全议题,反指美方阻挠技术共享。单纯外交协议无法化解智能失控风险。真正出路在于美国业界提升标准,深化对华商业沟通,共识难求但已属不易。

    2026/09/17
    00
  • 特习会前夕,北京挺伊朗的深意

    中国外长王毅与伊朗外长阿拉格齐在北京举行会谈,承诺加强合作并维护伊朗权益。此举恰逢中美领导人即将会晤前夕。中方呼吁美伊两国保持理性,尽快重启外交对话渠道。有分析认为,北京此举是向特朗普政府表明中国对伊朗问题拥有重要话语权。

    2026/09/17
    00
  • 冠名遭拒后,特朗普向肯尼迪中心发出最后通牒

    美国总统特朗普威胁,若肯尼迪表演艺术中心无法在建筑上镌刻他的名字,该中心将被迫关闭甚至拆除。联邦法官裁定禁止该中心竖立致敬特朗普的纪念标识,特朗普随即宣布拒绝使用2.57亿美元国会拨款进行翻新工程。

    2026/09/17
    00
  • 欧加携手惹恼特朗普 卡尼宣示「韧性联盟」

    特朗普因欧盟邀请加拿大成为准成员国而发出威胁。加拿大总理卡尼随即在欧洲议会宣布,欧加将深化合作打造韧性联盟,强调这是为了维护开放市场、主权和民主价值,而非针对任何国家。欧盟委员会表示该提议需进一步细化并获批准。

    2026/09/17
    00