这些档案揭示出一个事实:两家公司借助采购他人创作的内容来驱动模型的训练过程。
然而这只是冰山一角。我们在互联网上留下的每一个足迹,如今都在逐步沦为训练AI的养料。
AI既不会点赞、不会收藏、也不会转发——说白了,它根本无意于欣赏你的创意,只是将你的全部创作纳入囊中,融入自身。
结果是,人类的专属技能——笔下的词句、笔下的图像、口中的旋律、快门捕捉的瞬间——全都沦落成了AI革新的中心。
但解脱或许就在眼前。不过这个消息听起来更像诅咒而非救赎:很快,AI就能自行生产养分,将不再需要我们了。
案件的源头与细节
案件的源头可追溯到2026年9月17日,纽约南区联邦法院公布了一组保密文件。这份档案来自《纽约时报》对OpenAI及微软提起的版权纠纷,其核心内容就是这两个企业内部沟通的记载。
微软旗下应用科学部门的负责人布伦特·赫克特(Brent Hecht)在某份机密备忘中,将这种利用整个互联网内容来训练语言大模型的行为定性为「前所未有规模的非法掠夺」,甚至更激进地声称这可能代表了「人类社会有史以来最大规模的价值窃取」。值得注意的是,这番论述出自被告阵营的内部人士,而非原告方的法庭攻击。
这场诉讼已在法庭上缠斗了接近三十个月。
诉讼的一方是《纽约时报》,对方则为OpenAI和微软两家巨头。历轮审理中,法庭的倾向性判决普遍认可了「将受保护著作纳入模型培训可被视为合理利用」的立场。此番披露的档案与以往的区别在于,它直接呈现了被告方自身的记录,而非双方争执的法律观点。
根据微软内部的数据统计,自从Copilot发布以来,指向《纽约时报》的访问流量与使用传统Bing检索时相比,遭遇了最高达93%的下跌。
赫克特在某份内部演讲稿中将此现象命名为「自我毁灭的循环」,他的观点是,这一趋势「既会削弱模型本身的性能水平,也必将对整个网络生态带来损害」。
在另一份文档中,赫克特指出,一款终端应用对其关键内容源头的生存造成威胁,这在常理中属罕见现象,却恰恰是大模型产业及其「内容生态系统」演变的必然产物。这里的「内容源头」具体所指,就是从事新闻生产的各类媒体机构。
ChatGPT的负责人尼克·特利(Nick Turley)在某次公司内沟通中提及,类似ChatGPT的生成式产品对出版业形成了「存亡危机」,其本质上「具有替代属性」,且「伴随能力的提升,替代效应会愈发凸显」。
OpenAI掌舵人布罗克曼宣称这些模型「在新闻领域表现出众」。同年出庭作证的纳德拉则坦承,与智能对话工具互动的使用习惯已经「代替了用户直达网站获取资讯的需求」。
但相关法律明确规定,不得做出「削弱或蚕食原始作品商业价值」的行为。
档案还公示了数据集的具体体量。光是OpenAI的学习库里,就收录了来自《纽约时报》、《每日新闻》以及调查性报道机构的近92000份内容副本。
某个基于Common Crawl二次开发的数据库里,单独针对nytimes.com这一网域就爬取了超过200万条内容。然而其他传播机构的统计结果更加惊人:《纽约时报》被采集390万份,《芝加哥论坛报》及其附属期刊遭抓取730万份。
另一项代号为Project Mango的计划,其数据库中封存了超过16万部来自新闻出版社的原创著作。OpenAI向微软移交了自己GPT-3的完整学习库,而微软随后又通过名为Project Taxi与Project Mango的两个渠道,将数据反向供给OpenAI。
这些文件还曝光了具体的实施细节。
公司的一位研究人员尼克·赖德(Nick Ryder)曾向高管布罗克曼提及掌握了一套「突破《纽约时报》内容付费限制的技术手段」,而布罗克曼的回应仅是「不赖」。
他们联手构建的两个数据集——WebText和WebText2——其主体部分源自互联网上直接爬取的新闻内容,同时还从Common Crawl这一公共资源库中导入了数百万篇各类文章。
更值一提的是,在将数据喂入模型前夕,他们会有意清除掉附随的著作权说明,理由是团队研究者「不希望模型在输出给客户的内容中包含版权提示」。
主诉律师史蒂文·利伯曼(Steven Lieberman)声称,现有证据足以证实,OpenAI与微软对自身行为的非法性质心知肚明。
对此微软做出声明,这些议论仅代表某员工的个人看法,不构成执法层面的判断,更未必体现企业的真实主张。赫克特本人并非制定政策的高管,其聘用的目的是为了「引入多维度、不均衡的观察视角」。
数据掠夺的产业生态
说起来,OpenAI并非首次因此陷入漩涡。
2023年秋天,美国作家联盟联手包括约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)在内的17位创作者。
在纽约南区联邦法院对OpenAI展开了集团诉讼。随后,来自特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等多位创作者的独立诉讼陆续汇入,原告方的数量仍在继续膨胀。
作为《纽约时报》诉讼中的关键证据——编号为J的附件,其标题为《GPT-4对〈纽约时报〉内容的百例记忆录〉,厚度达127页。只需输入某篇文章的片段,该模型便能精准复述后续内容,甚至连署名信息与原文引用都分毫不差。
到了2026年,arXiv学术库中出现了一篇题为《对齐之争:打地鼠式的攻防战》的研究。
学者将AI模型进行了特定的微调——投喂情节梗概而隐瞒原始文本。出人意料的是,GPT-4o与Gemini 2.5 Pro竟能还原出85%至90%受保护著作的完整内容,部分段落的字面复现长度甚至突破460个单词。这一现象被研究者戏谑地标记为「对齐博弈」:堵住了东边的缺口,西边却又开始渗漏。
这并非巧合。早在2023年,研究人员尼古拉斯·卡尔利尼(Nicholas Carlini)就曾指出一个规律:AI的体量越庞大,某段信息被反复灌输的频率越高,周边语境提供得越充分,它对这段内容的记忆就越牢固。
然而将网络公开信息化为模型养分的企业,绝非只有OpenAI与微软两家。
2026年9月初,伊利诺伊北区法院收到了一份新的集团诉讼状。提起人是数个普通家庭及其子女。起诉书控告Meta在未获许可的情况下,对Facebook及Instagram的使用者进行了面部照片与生物特征信息的非法搜集,并将这些数据用于三个模型的开发:驱动人脸识别功能NameTag的底层系统、与NameTag配套的「人脸特征库」,以及用于图片生成的Emu和Muse Image。
这套识别技术原本为Ray-Ban与Oakley智能眼镜量身定制。早前在2026年6月上旬,便有使用者在Meta的官方应用程序里捕捉到了NameTag相关的代码踪迹,可当时尚不清楚这个模块具体服务哪种功能。
Meta发表了否认声明:「此案缺乏法律依据,对我们工作的描述有失偏颇……NameTag尚未面向大众推出,我们对最终落地方案仍未定论。」公司还补充说明,自己「并非在搭建一套通用型人脸库」。
尽管言辞坚决,Meta却已因类似风波三度进入司法程序。
2021年那一回,因为「自动好友标签」功能侵犯《伊利诺伊生物信息隐私法案》,Meta赔出了6.5亿美元,约142万位该州使用者获得分配,部分人得到了超过四百美元的赔偿。到了2023年,Instagram的人脸技术再度惹祸,又赔去6850万美元,合计约400万伊州用户具备索赔资格。同样的问题也让Snap在2016年付出了3500万美元的代价。
根据该法律的处罚标准,每位受害人每一项违规行为要罚1000到5000美元。
从这个罚则推算,按Meta的客户基数,可能的赔偿总额会超过10亿。但Meta仍然愿意掏钱,因为相比赔款而言,法律并未禁止Meta推进模型研发,所以这笔开支还落在了可容忍的范围内。
Meta的数据掠夺目标,还包括企业自己的员工。
2026年4月下旬,Meta向其美国员工的办公设备上部署了一种监测工具,这款软件能够时时刻刻捕捉鼠标动作、点击坐标及键盘敲击,并周期性地采集屏幕快照,供公司的智能模型学习使用。
该工具被命名为「模型能力倡议」(Model Capability Initiative)。Meta的技术掌舵人安德鲁·博斯沃思(Andrew Bosworth)在某份机密函件中阐述,长远愿景是将AI助手打造成可「独立承担任务」的执行者,而人类工作者的角色则蜕变为「制定方向、进行稽核及协力优化」。
该计划后来更名为「AI智能体转换推进器」。Meta官方回应说,采集的数据仅供模型学习,不涉及员工评估,且建立了敏感信息的防护机制。
不过多家媒体的报道指出,监控涵盖了员工日常接触的全类别应用与网络平台,从谷歌、GitHub、Slack到个人邮箱Gmail一应俱全;美籍员工无权选择退出,唯有那些处于欧盟《通用数据保护条例》庇护范围内的欧洲员工才被豁免。
巧合的是,就在同一周内,Meta启动了约8000人的裁员,这让不少被保留的员工滋生出恐慌——他们在无意识地为自己未来的「替代者」蓄力。到了2026年半年期,Meta被迫叫停了这一计划,起因是监测装置意外搜集了机密数据,且这些敏感信息曾短暂地对全体员工可见。
Meta的贪欲远不止于此。
Meta旗下专门维护着一个视频爬虫工具,代号为MSAE。Meta AI的官方披露表明,其模型的学习库中纳入了来自YouTube的370万条视频转录文本这一第三方数据源。
2026年初,几位合计坐拥620万粉丝的YouTube内容创作者——h3h3 Productions、Mr. ShortGame Golf、Golfholics等——在加州中区联邦法院向Snap发起诉讼,控告其动用后台自动化系统,批量下载数百万部YouTube视频的音视频内容,并将之导入HD-VILA-100M与Panda-70M这两个数据库,驱动诸如「Imagine Lens」之类的图像编辑功能开发。
这份诉讼摒弃了常规的著作权突破口,转而针对《数字千年版权法》第1201条中关于反规避的条款:YouTube的架构目的是供人线上浏览,而非授予用户获取原始文件的权限,Snap在大规模层面上的行为涉嫌触犯了这一法律禁区。
其中一位控方代表伊桑·克莱因(Ethan Klein)更是趁势将英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果等巨头一并拖入诉讼,声称这些企业「单日可掠夺相当于80年的内容体量」。
搜索巨头也难逃其咎
作为搜索引擎业务的王者,谷歌自然也难逃其咎。
2026年夏季,哈切特出版社、Cengage学习公司、爱思唯尔集团携手畅销作家斯科特·图罗,在纽约法院对谷歌提起诉讼,声称谷歌借用数百万部带版权的书籍来训练Gemini。诉讼文书列举,谷歌从「业界公知的非法资源池」中搜刮内容,更甚者是突破学术出版平台的付费防线,非法获取爱思唯尔出版的《柳叶刀》及《细胞》等期刊论文。
根据诉讼描述,Gemini能够在20分钟的时间里、耗费仅0.39美元,就输出一部长达10万字的悬念小说。值得注意的是,谷歌的内部文档中曾出现过警示,指这种做法可能会给公司带来「100亿至1000亿美元量级的法律风险」。
语音与音乐领域也遭了厄运
语音与音乐领域也遭了厄运。
苹果的智能助手Siri会将「无意触发」时的音频片段外包给合同评估员进行审听。根据国际媒体的披露,这些片段里包含医患交流、商务洽谈,甚至疑似违法交易的对话。部分审听员每日需要消化超过1000条音频。苹果最后选择了9500万美元的和解方案。
到了2024年初夏,美国唱片业协会代理环球音乐、索尼音乐、华纳音乐向AI音乐公司Suno及Udio提起诉讼,指其非法运用了受保护的音乐作品。
最后的人类粮草
但我们大可宽心,因为我们这一代人极有可能是人类作为AI粮草的最终一期。如今,这些AI企业已经学会了自给自足。
2026年仲夏,Anthropic发布了一篇文章,题目为《AI自我建构的时代》。文中提及,到2026年5月为止,整合进该公司产品代码仓库的新增代码有超八成出自Claude之手,而非人类开发者。在此前的时间里,这一占比仍停留在一位数。
换言之,仅仅十五个月时间,这家企业便实现了编程任务的大规模外包。部分工程师已经半年未触及代码;他们日均合并的代码规模,已较往年增长八倍。
2026年秋初,Anthropic推出了另一篇研究报告,标题为《量化AI进化的步伐》,核心议题围绕「AI在研发中的主导程度」展开。文中采纳了Epoch AI所提出的自动化阶位体系,从零级(AL0,无AI涉入)延伸到五级(AL5,AI独立运作)。
其中第四级别表示AI能够依据粗粒度的方向指示,独立完成从头到尾的绝大多数任务,人类的角色缩减为全程监控与最终的审批权。
文中数据显示,至2026年早春,Anthropic达标AL4等级的研发任务占比不足1%。待至5月,这一比例跃升至12%,7月冲至22%,8月更是飙升到26%。
若降低门槛至第三级(AL3,AI在人类紧密指引下执行大规模任务),则超过90%的研发活动都能胜任。文件还指出,在Anthropic最核心的Agent框架内,任何时点都有约三万个AI智能体投身于研究与工程领域,单在2026年8月份就贡献了逾10亿项决策。
而OpenAI采纳了迥然不同的路径。
2026年盛夏,OpenAI公开了一次重要实验:在推出GPT-5.6时,他们令最强的Sol模型独立对一个较小的模型Luna执行「后期优化」步骤。研究人员仅输入了一条「信息量极其有限的指令」,Sol就自行搜索最优训练参数、精选硬件配置、下达训练指令、监测执行过程,并额外衍生了合成数据集。
这套操作若交由人力完成,需要两位资深学者花费整整两周时间。在OpenAI自设的「递归自我优化评分榜」上,Sol较前代模型GPT-5.5超越了16.2个单位。
Anthropici将此现象定义为递归自我进化。其核心要义在于,模型的养料泉源正经历一场巨大转向:从「人造创意」演变至「AI自产内容」。
而你我,不过是这场伟大迁移竣工前,最后一批可用的人类供给。
但问题随之而来:AI自我繁殖的数据,能否承载下一世代模型的野心?
2024年,舒马伊洛夫(Shumailov)等学者在《自然》期刊发表了一篇研究,题目为《递归利用合成数据训练致使AI模型崩坏》。
研究结果表明,频繁采用AI生成的数据来训练模型,会导致模型的「退化」现象——输出的丰富度逐次萎缩,边缘化的信息被有规律地丢弃,最终蜕变为「句子精正、含意贫瘠」的僵化状态。
该研究的最终定论为:不可将AI合成数据作为人类数据的绝对替代品,二者需要叠加融合。只要真实的人类信息仍占据一席之地,模型的生命力就能保持。
因此当下业界的通常做法是,以10%至30%的真实人类信息作为基础支撑,余下的空间由AI自我供养。
这10%到30%,正是我们这个时代仅存的价值。然而令人扼腕的是,就连这点价值也在走向终结。
届时若AI自产数据的品质能臻于稳定境地,若这种循环得以顺畅运转,人类数据的采集价值就彻底消失殆尽了。