人类饲料的倒计时——我们如何成为AI最后的养料

纽约南区联邦法院在2026年9月18日向外界披露了一套机密文件,其中记录了OpenAI与微软内部的往来备忘。

这些档案揭示出一个事实:两家公司借助采购他人创作的内容来驱动模型的训练过程。

然而这只是冰山一角。我们在互联网上留下的每一个足迹,如今都在逐步沦为训练AI的养料。

AI既不会点赞、不会收藏、也不会转发——说白了,它根本无意于欣赏你的创意,只是将你的全部创作纳入囊中,融入自身。

结果是,人类的专属技能——笔下的词句、笔下的图像、口中的旋律、快门捕捉的瞬间——全都沦落成了AI革新的中心。

但解脱或许就在眼前。不过这个消息听起来更像诅咒而非救赎:很快,AI就能自行生产养分,将不再需要我们了。

案件的源头与细节

案件的源头可追溯到2026年9月17日,纽约南区联邦法院公布了一组保密文件。这份档案来自《纽约时报》对OpenAI及微软提起的版权纠纷,其核心内容就是这两个企业内部沟通的记载。

微软旗下应用科学部门的负责人布伦特·赫克特(Brent Hecht)在某份机密备忘中,将这种利用整个互联网内容来训练语言大模型的行为定性为「前所未有规模的非法掠夺」,甚至更激进地声称这可能代表了「人类社会有史以来最大规模的价值窃取」。值得注意的是,这番论述出自被告阵营的内部人士,而非原告方的法庭攻击。

这场诉讼已在法庭上缠斗了接近三十个月。

诉讼的一方是《纽约时报》,对方则为OpenAI和微软两家巨头。历轮审理中,法庭的倾向性判决普遍认可了「将受保护著作纳入模型培训可被视为合理利用」的立场。此番披露的档案与以往的区别在于,它直接呈现了被告方自身的记录,而非双方争执的法律观点。

根据微软内部的数据统计,自从Copilot发布以来,指向《纽约时报》的访问流量与使用传统Bing检索时相比,遭遇了最高达93%的下跌。

赫克特在某份内部演讲稿中将此现象命名为「自我毁灭的循环」,他的观点是,这一趋势「既会削弱模型本身的性能水平,也必将对整个网络生态带来损害」。

在另一份文档中,赫克特指出,一款终端应用对其关键内容源头的生存造成威胁,这在常理中属罕见现象,却恰恰是大模型产业及其「内容生态系统」演变的必然产物。这里的「内容源头」具体所指,就是从事新闻生产的各类媒体机构。

ChatGPT的负责人尼克·特利(Nick Turley)在某次公司内沟通中提及,类似ChatGPT的生成式产品对出版业形成了「存亡危机」,其本质上「具有替代属性」,且「伴随能力的提升,替代效应会愈发凸显」。

OpenAI掌舵人布罗克曼宣称这些模型「在新闻领域表现出众」。同年出庭作证的纳德拉则坦承,与智能对话工具互动的使用习惯已经「代替了用户直达网站获取资讯的需求」。

但相关法律明确规定,不得做出「削弱或蚕食原始作品商业价值」的行为。

档案还公示了数据集的具体体量。光是OpenAI的学习库里,就收录了来自《纽约时报》、《每日新闻》以及调查性报道机构的近92000份内容副本。

某个基于Common Crawl二次开发的数据库里,单独针对nytimes.com这一网域就爬取了超过200万条内容。然而其他传播机构的统计结果更加惊人:《纽约时报》被采集390万份,《芝加哥论坛报》及其附属期刊遭抓取730万份。

另一项代号为Project Mango的计划,其数据库中封存了超过16万部来自新闻出版社的原创著作。OpenAI向微软移交了自己GPT-3的完整学习库,而微软随后又通过名为Project Taxi与Project Mango的两个渠道,将数据反向供给OpenAI。

这些文件还曝光了具体的实施细节。

公司的一位研究人员尼克·赖德(Nick Ryder)曾向高管布罗克曼提及掌握了一套「突破《纽约时报》内容付费限制的技术手段」,而布罗克曼的回应仅是「不赖」。

他们联手构建的两个数据集——WebText和WebText2——其主体部分源自互联网上直接爬取的新闻内容,同时还从Common Crawl这一公共资源库中导入了数百万篇各类文章。

更值一提的是,在将数据喂入模型前夕,他们会有意清除掉附随的著作权说明,理由是团队研究者「不希望模型在输出给客户的内容中包含版权提示」。

主诉律师史蒂文·利伯曼(Steven Lieberman)声称,现有证据足以证实,OpenAI与微软对自身行为的非法性质心知肚明。

对此微软做出声明,这些议论仅代表某员工的个人看法,不构成执法层面的判断,更未必体现企业的真实主张。赫克特本人并非制定政策的高管,其聘用的目的是为了「引入多维度、不均衡的观察视角」。

数据掠夺的产业生态

说起来,OpenAI并非首次因此陷入漩涡。

2023年秋天,美国作家联盟联手包括约翰·格里森姆(John Grisham)、乔治·R·R·马丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大卫·鲍尔达奇(David Baldacci)、乔纳森·弗兰岑(Jonathan Franzen)、斯科特·图罗(Scott Turow)在内的17位创作者。

在纽约南区联邦法院对OpenAI展开了集团诉讼。随后,来自特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等多位创作者的独立诉讼陆续汇入,原告方的数量仍在继续膨胀。

作为《纽约时报》诉讼中的关键证据——编号为J的附件,其标题为《GPT-4对〈纽约时报〉内容的百例记忆录〉,厚度达127页。只需输入某篇文章的片段,该模型便能精准复述后续内容,甚至连署名信息与原文引用都分毫不差。

到了2026年,arXiv学术库中出现了一篇题为《对齐之争:打地鼠式的攻防战》的研究。

学者将AI模型进行了特定的微调——投喂情节梗概而隐瞒原始文本。出人意料的是,GPT-4o与Gemini 2.5 Pro竟能还原出85%至90%受保护著作的完整内容,部分段落的字面复现长度甚至突破460个单词。这一现象被研究者戏谑地标记为「对齐博弈」:堵住了东边的缺口,西边却又开始渗漏。

这并非巧合。早在2023年,研究人员尼古拉斯·卡尔利尼(Nicholas Carlini)就曾指出一个规律:AI的体量越庞大,某段信息被反复灌输的频率越高,周边语境提供得越充分,它对这段内容的记忆就越牢固。

然而将网络公开信息化为模型养分的企业,绝非只有OpenAI与微软两家。

2026年9月初,伊利诺伊北区法院收到了一份新的集团诉讼状。提起人是数个普通家庭及其子女。起诉书控告Meta在未获许可的情况下,对Facebook及Instagram的使用者进行了面部照片与生物特征信息的非法搜集,并将这些数据用于三个模型的开发:驱动人脸识别功能NameTag的底层系统、与NameTag配套的「人脸特征库」,以及用于图片生成的Emu和Muse Image。

这套识别技术原本为Ray-Ban与Oakley智能眼镜量身定制。早前在2026年6月上旬,便有使用者在Meta的官方应用程序里捕捉到了NameTag相关的代码踪迹,可当时尚不清楚这个模块具体服务哪种功能。

Meta发表了否认声明:「此案缺乏法律依据,对我们工作的描述有失偏颇……NameTag尚未面向大众推出,我们对最终落地方案仍未定论。」公司还补充说明,自己「并非在搭建一套通用型人脸库」。

尽管言辞坚决,Meta却已因类似风波三度进入司法程序。

2021年那一回,因为「自动好友标签」功能侵犯《伊利诺伊生物信息隐私法案》,Meta赔出了6.5亿美元,约142万位该州使用者获得分配,部分人得到了超过四百美元的赔偿。到了2023年,Instagram的人脸技术再度惹祸,又赔去6850万美元,合计约400万伊州用户具备索赔资格。同样的问题也让Snap在2016年付出了3500万美元的代价。

根据该法律的处罚标准,每位受害人每一项违规行为要罚1000到5000美元。

从这个罚则推算,按Meta的客户基数,可能的赔偿总额会超过10亿。但Meta仍然愿意掏钱,因为相比赔款而言,法律并未禁止Meta推进模型研发,所以这笔开支还落在了可容忍的范围内。

Meta的数据掠夺目标,还包括企业自己的员工。

2026年4月下旬,Meta向其美国员工的办公设备上部署了一种监测工具,这款软件能够时时刻刻捕捉鼠标动作、点击坐标及键盘敲击,并周期性地采集屏幕快照,供公司的智能模型学习使用。

该工具被命名为「模型能力倡议」(Model Capability Initiative)。Meta的技术掌舵人安德鲁·博斯沃思(Andrew Bosworth)在某份机密函件中阐述,长远愿景是将AI助手打造成可「独立承担任务」的执行者,而人类工作者的角色则蜕变为「制定方向、进行稽核及协力优化」。

该计划后来更名为「AI智能体转换推进器」。Meta官方回应说,采集的数据仅供模型学习,不涉及员工评估,且建立了敏感信息的防护机制。

不过多家媒体的报道指出,监控涵盖了员工日常接触的全类别应用与网络平台,从谷歌、GitHub、Slack到个人邮箱Gmail一应俱全;美籍员工无权选择退出,唯有那些处于欧盟《通用数据保护条例》庇护范围内的欧洲员工才被豁免。

巧合的是,就在同一周内,Meta启动了约8000人的裁员,这让不少被保留的员工滋生出恐慌——他们在无意识地为自己未来的「替代者」蓄力。到了2026年半年期,Meta被迫叫停了这一计划,起因是监测装置意外搜集了机密数据,且这些敏感信息曾短暂地对全体员工可见。

Meta的贪欲远不止于此。

Meta旗下专门维护着一个视频爬虫工具,代号为MSAE。Meta AI的官方披露表明,其模型的学习库中纳入了来自YouTube的370万条视频转录文本这一第三方数据源。

2026年初,几位合计坐拥620万粉丝的YouTube内容创作者——h3h3 Productions、Mr. ShortGame Golf、Golfholics等——在加州中区联邦法院向Snap发起诉讼,控告其动用后台自动化系统,批量下载数百万部YouTube视频的音视频内容,并将之导入HD-VILA-100M与Panda-70M这两个数据库,驱动诸如「Imagine Lens」之类的图像编辑功能开发。

这份诉讼摒弃了常规的著作权突破口,转而针对《数字千年版权法》第1201条中关于反规避的条款:YouTube的架构目的是供人线上浏览,而非授予用户获取原始文件的权限,Snap在大规模层面上的行为涉嫌触犯了这一法律禁区。

其中一位控方代表伊桑·克莱因(Ethan Klein)更是趁势将英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果等巨头一并拖入诉讼,声称这些企业「单日可掠夺相当于80年的内容体量」。

搜索巨头也难逃其咎

作为搜索引擎业务的王者,谷歌自然也难逃其咎。

2026年夏季,哈切特出版社、Cengage学习公司、爱思唯尔集团携手畅销作家斯科特·图罗,在纽约法院对谷歌提起诉讼,声称谷歌借用数百万部带版权的书籍来训练Gemini。诉讼文书列举,谷歌从「业界公知的非法资源池」中搜刮内容,更甚者是突破学术出版平台的付费防线,非法获取爱思唯尔出版的《柳叶刀》及《细胞》等期刊论文。

根据诉讼描述,Gemini能够在20分钟的时间里、耗费仅0.39美元,就输出一部长达10万字的悬念小说。值得注意的是,谷歌的内部文档中曾出现过警示,指这种做法可能会给公司带来「100亿至1000亿美元量级的法律风险」。

语音与音乐领域也遭了厄运

语音与音乐领域也遭了厄运。

苹果的智能助手Siri会将「无意触发」时的音频片段外包给合同评估员进行审听。根据国际媒体的披露,这些片段里包含医患交流、商务洽谈,甚至疑似违法交易的对话。部分审听员每日需要消化超过1000条音频。苹果最后选择了9500万美元的和解方案。

到了2024年初夏,美国唱片业协会代理环球音乐、索尼音乐、华纳音乐向AI音乐公司Suno及Udio提起诉讼,指其非法运用了受保护的音乐作品。

最后的人类粮草

但我们大可宽心,因为我们这一代人极有可能是人类作为AI粮草的最终一期。如今,这些AI企业已经学会了自给自足。

2026年仲夏,Anthropic发布了一篇文章,题目为《AI自我建构的时代》。文中提及,到2026年5月为止,整合进该公司产品代码仓库的新增代码有超八成出自Claude之手,而非人类开发者。在此前的时间里,这一占比仍停留在一位数。

换言之,仅仅十五个月时间,这家企业便实现了编程任务的大规模外包。部分工程师已经半年未触及代码;他们日均合并的代码规模,已较往年增长八倍。

2026年秋初,Anthropic推出了另一篇研究报告,标题为《量化AI进化的步伐》,核心议题围绕「AI在研发中的主导程度」展开。文中采纳了Epoch AI所提出的自动化阶位体系,从零级(AL0,无AI涉入)延伸到五级(AL5,AI独立运作)。

其中第四级别表示AI能够依据粗粒度的方向指示,独立完成从头到尾的绝大多数任务,人类的角色缩减为全程监控与最终的审批权。

文中数据显示,至2026年早春,Anthropic达标AL4等级的研发任务占比不足1%。待至5月,这一比例跃升至12%,7月冲至22%,8月更是飙升到26%。

若降低门槛至第三级(AL3,AI在人类紧密指引下执行大规模任务),则超过90%的研发活动都能胜任。文件还指出,在Anthropic最核心的Agent框架内,任何时点都有约三万个AI智能体投身于研究与工程领域,单在2026年8月份就贡献了逾10亿项决策。

而OpenAI采纳了迥然不同的路径。

2026年盛夏,OpenAI公开了一次重要实验:在推出GPT-5.6时,他们令最强的Sol模型独立对一个较小的模型Luna执行「后期优化」步骤。研究人员仅输入了一条「信息量极其有限的指令」,Sol就自行搜索最优训练参数、精选硬件配置、下达训练指令、监测执行过程,并额外衍生了合成数据集。

这套操作若交由人力完成,需要两位资深学者花费整整两周时间。在OpenAI自设的「递归自我优化评分榜」上,Sol较前代模型GPT-5.5超越了16.2个单位。

Anthropici将此现象定义为递归自我进化。其核心要义在于,模型的养料泉源正经历一场巨大转向:从「人造创意」演变至「AI自产内容」。

而你我,不过是这场伟大迁移竣工前,最后一批可用的人类供给。

但问题随之而来:AI自我繁殖的数据,能否承载下一世代模型的野心?

2024年,舒马伊洛夫(Shumailov)等学者在《自然》期刊发表了一篇研究,题目为《递归利用合成数据训练致使AI模型崩坏》。

研究结果表明,频繁采用AI生成的数据来训练模型,会导致模型的「退化」现象——输出的丰富度逐次萎缩,边缘化的信息被有规律地丢弃,最终蜕变为「句子精正、含意贫瘠」的僵化状态。

该研究的最终定论为:不可将AI合成数据作为人类数据的绝对替代品,二者需要叠加融合。只要真实的人类信息仍占据一席之地,模型的生命力就能保持。

因此当下业界的通常做法是,以10%至30%的真实人类信息作为基础支撑,余下的空间由AI自我供养。

这10%到30%,正是我们这个时代仅存的价值。然而令人扼腕的是,就连这点价值也在走向终结。

届时若AI自产数据的品质能臻于稳定境地,若这种循环得以顺畅运转,人类数据的采集价值就彻底消失殆尽了。


上一篇 2026/09/29 20:30
下一篇 2025/12/25 09:25

相关推荐

  • 白宫午宴风云:特朗普力推「超级智能」,科技巨头齐呼自治

    特朗普白宫午宴与全球AI产业领导人相聚,力推行业自我规范而非政府立法约束。他宣布将「人工智能」更名为「超级智能」,强调美国在该领域的巨大优势需要通过「不扼杀增长」来维持。会议涉及数据中心争议,两党对AI监管出现罕见共识。

    2026/09/29
    00
  • 奥特曼期待多年的AI产品终于来了,OpenAI DevDay发布全天候数字员工

    OpenAI DevDay 2026大会发布全天候智能体Dots、GPT-6.1 Sol模型及Ultrafast服务。Dots配置专属云端计算资源,可自主完成任务。Sol成本仅为旗舰型号五分之一,新增Pro 500订阅提供极速服务。OpenAI重点打造企业级安全与团队协作完整生态。

    2026/09/29
    00
  • 警惕|中行万事达卡突发盗刷风波,损失赔付有说法了

    9月下旬,中国银行万事达信用卡遭遇大规模非法交易,涉及卓隽留学卡等多种卡型。受害者卡片未曾离身却在境外巴西等地被刷走巨款。银行已确认赔偿责任,损失原则上由发卡行承担。专家解析风控漏洞与防范建议。

    2026/09/29
    00
  • 从巅峰到无期:疫苗女王8年后的终局审判

    长生生物董事长高俊芳因四宗重罪被判无期,吉林省高院二审维持原判。从2018年疫苗风波到2026年终审,八年间企业从292亿市值到注销,这是一场系统性造假背后的深层警示。

    2026/09/29
    00
  • 创造历史又惹祸?星舰首次入轨任务意外提前结束,溅落爆炸令人担忧

    美国SpaceX公司星舰飞船9月28日成功实现首次地球轨道飞行,却因发动机故障不得不提前结束任务。返回途中以超20倍音速冲入大气层,虽在太平洋成功溅落但着陆瞬间发生迄今最剧烈爆炸。

    2026/09/29
    00

发表回复

登录后才能评论