AI失控在即?硅谷科学家的疯狂「避难计划」震撼曝光

AI失控在即?硅谷科学家的疯狂避难计划震撼曝光

AI末日预言家的真实群像。图片经由AI处理

Anthropic的部分资深员工正在认真考虑一项计划——在美国偏远荒凉的地区购买土地。他们的理由很特殊:一旦AI系统真的失去控制,这些与世隔绝的地方或许能够成为最后的安全港湾。

办公室里的一面面屏幕上,被贴上了同样一句话:「人生再也回不到从前。」这是来自不少研究人员的心声。

实际上,逃离的想法并非凭空而生。过去十多年里,一批AI风险防控专家在旧金山湾区聚集,他们从未停止过思考——倘若人工智能陷入失控状态,究竟会招致什么样的后果。彼时Anthropic这家公司连影子都没有。

在伯克利有人开设了联合办公室,众人在私密的Slack讨论群中交流末世想象。关于收购太平洋岛屿瑙鲁建立避难地的建议出现过,关于在荒漠中建造防电磁辐射堡垒的构想也有人提及。

其后,这个圈子中的许多人加入了OpenAI,又在2021年前后成了Anthropic的核心建立者和一线研究员。如今Anthropic已跻身全球顶级AI机构之列,但这群人在十多年前形成的关于AI危害的理论体系,却并未因为公司的扩张而消散。

时间到了今年9月初,事态忽然从象牙塔走向了真实。Anthropic的研究人员雅各布·考克森(Jacob Coxon)宣布离职,他在X平台上表示,参与AI研发的人士「诚心诚意地认为它可能于2030年之前终结全人类」。这条消息被浏览了1.74亿次,把AI圈内部多年的隐忧公之于众。

Anthropic前研究员雅各布·考克森

Anthropic前研究员雅各布·考克森

被称作「AI灭绝倡议者」的这些人,如今开始思索一个更贴近生活的问题:既然你相信AI可能让人类毁灭,那应该怎样去过日子?

01 伯克利的世界末日沙龙

要把握这群人的思想脉络,得把时间调回2010年左右。

那个时期,旧金山湾区的AI产业还没有今天这般繁荣。在人工智能长期危害这一议题周围,聚集了一个规模精而人脉密的专业研究圈和效能利他主义者群体。埃利泽·尤德科夫斯基(Eliezer Yudkowsky)是这个圈子中最具分量的一位。

埃利泽·尤德科夫斯基

埃利泽·尤德科夫斯基

自21世纪初开始,尤德科夫斯基借助博客与随后建立的LessWrong平台,持续发表关于AI失控和超级智能的论述。这些理论在数年后渐渐影响到湾区的科技人士及效能利他主义圈层。

2008年前后,正在普林斯顿攻读博士的达里奥·阿莫迪(Dario Amodei)开始在GiveWell等社区平台参与思想碰撞。后来成为这个网络关键人物的GiveWell创始人霍尔登·卡诺夫斯基(Holden Karnofsky),与阿莫迪一样参与过当时的讨论。

Anthropic联合创始人达里奥·阿莫迪

Anthropic联合创始人达里奥·阿莫迪

大约在2013年前后,这些人在旧金山打造出了更加密集的工作生活圈。

当GiveWell从美国东海岸迁往湾区后,卡诺夫斯基与阿莫迪的互动益加频繁。卡诺夫斯基搬入了阿莫迪坐落于旧金山格伦公园一侧的住宅,这栋房子逐步演变为AI风险防控研究者、效能利他主义支持者及长期思想家们的一个聚集地。

Anthropic未来的关键人物阿莫迪,他的妹妹丹妮拉·阿莫迪(Daniela Amodei)、贾里德·卡普兰(Jared Kaplan)和克里斯·奥拉(Chris Olah)等人,都与这群人产生了紧密的连接。

AI风险防控研究者

这些人的讨论范围并未限于AI。行星撞击、超级火山等对人类构成全球性威胁的灾害,也频繁出现在对话当中。

卡诺夫斯基逐渐得出结论:在诸多领域里,AI风险防控也许是最具潜力的——投入相对有限的资源,却能影响全人类的命运。纵然AI失控导致灾难的可能只有5%,它也值得投入巨量精力进行深入研究。

几年之后,这个群体中的一部分人投身OpenAI。从2020到2021年左右,关于AI发展走向与安全防护的分歧日趋激化。包括阿莫迪在内的这批人选择离职OpenAI,于2021年另起炉灶创办Anthropic,把AI风险防控和可管控性放置在企业的战略中枢。

2023年,Constellation应运而生。它在伯克利开办了一个AI风险防控专家的共用工作室,邀集非营利部门、高校、AI企业、研究机构等多方的研究员聚集在此。到2024年,Constellation推出了访学研究者计划与Astra Fellowship,专门为AI风险防控研究者营造在伯克利协作的环境。

位于加州伯克利的Constellation办公大楼

位于加州伯克利的办公楼宇,Constellation的联合办公室就在这里

这个空间汇聚了来自Anthropic、OpenAI、马斯克旗下SpaceX-AI以及其他AI安全研究机构的研究职员,也包括独立学者。他们聚在一起品素食、喝茶饮,利用每月的聚餐和茶话会分享AI领域的最新动态,同时也在冷思考一个沉甸甸的议题:倘若人工智能脱离束缚会怎样?

Constellation目前的任务宣言是协助地球安稳过渡到转变性的AI时代,围绕「价值对齐」「管制」「监管框架」及风险讯息传达展开学术工作。在2024年立项的众多方案中,不少参与人员日后进入了Anthropic、OpenAI、谷歌DeepMind、Redwood Research等机构。

这个组织的资金源头同样来自AI风险防控圈。2024年,开放慈善基金曾为Constellation投入巨额资金。开放慈善基金获得Facebook联合建立者达斯汀·莫斯科维茨(Dustin Moskovitz)的支持,是效能利他主义活动的关键融资渠道之一,后被改名为Coefficient Giving。

从2013年左右的民宅,到2023年之后的伯克利联合工作室,这个圈子已经历了巨大蜕变。但他们所研讨的课题,几乎未见改变。

02 五亿美元与「护卫所」

Anthropic初创时期,巨额投资不可或缺。

阿莫迪接触的资本方之一,乃是加密资产交易平台FTX的老板山姆·班克曼-弗里德(Sam Bankman-Fried)。当时,这位初露头角的富豪正经由FTX慈善基金大规模输入资本到效能利他主义等范畴。

2021至2022这段时间,班克曼-弗里德向Anthropic挹注了五亿美元的资本,这是阿莫迪团队最初预想额度的五倍有余。凭借这笔投资,FTX迅速成为Anthropic早期最关键的资本方之一。

FTX创始人山姆·班克曼-弗里德

FTX创始人山姆·班克曼-弗里德

这个网络中,对AI灭绝的思辨已然越过了纸上理论的范畴。

一份来自2023年破产诉讼的档案显示,FTX旗下基金的一位经理曾与下属讨论收购太平洋上的岛国瑙鲁。打算是在当地兴建一座「堡垒式的避护地」,以应对某类导致「50%到99.99%人口死亡」的险情。文件内容甚至展望,灾变往后可以利用生物学手段繁衍下一世代的人类。

AI安全的小圈子里还流传过其他类似设想:购入孤立的岛屿、在沙漠地区搭建屏蔽电磁辐射的防护设施、积囤碘片药物,甚至在必要情况下寻觅能维系长期生存的密闭环境。

2022年,这类理念还被带到了加勒比海的巴哈马岛。从Anthropic及其他AI企业聚集的研究人员和效能利他主义者,齐聚参加了由Lightcone Infrastructure筹办的活动。

Lightcone Infrastructure这个组织与尤德科夫斯基和LessWrong网络有着密切的往来。活动的场地选在伊柳塞拉岛的一处渡假胜地,议程既包括日落瑜珈、悬崖跳水这样的休闲项目,也涵盖关于AI威胁和效能利他主义的学术讨论。

FTX为这次盛会支付了场地费用。筹办方甚至将周边店铺能够购得的全部植物蛋白食品一网打尽,以符合参访者的饮食偏好。卡罗琳·埃里森(Caroline Ellison)也出席了此次活动。她当时主持Alameda Research事务,亦是班克曼-弗里德过去的伴侣。如众多圈内人士,她对AI推进可能带来的风险有着深刻忧虑,其后向Anthropic注入了1000万美元的投资。

班克曼-弗里德前女友、Anthropic投资者卡罗琳·埃里森

班克曼-弗里德的前伴侣、Anthropic的资本方卡罗琳·埃里森

Anthropic的研究员埃文·胡宾格(Evan Hubinger)参与了这些AI危害防控的讨论。其后他成为深入钻研AI「对齐」及欺骗行为的知名研究者,还曾公开宣称,在来后十年,AI导致人类灭绝的风险系数超越一成。

其间一场午间聚会甚至设定了参与资格:仅限那些坚信百年内人类失灭可能性抵达七五%或以上的人出席。

同年,类似的讨论也呈现在旧金山举办的效能利他主义国际大会舞台上。起码二十位Anthropic的工作者完成注册出席,其中囊括两位公司共同创办者。

论坛落幕,Lightcone在伯克利玫瑰谷旅舍组织了一个酒会。酒水单上现身了一款酒名为「有尊严的谢幕」的调酒。这个命名灵感源自尤德科夫斯基之前发表的一篇剖析人类在AI新纪元中生存几率的著述。往后,这个旅舍被Lightcone收购,更名为Lighthaven,演变为社区最新的聚首空间。

但FTX的前景并未长期持续。

2022年年末,FTX提交破产申请,Anthropic所持股权随之被出让以清偿债务。班克曼-弗里德最终获刑25年,埃里森因FTX案件被定罪并刑满释放,其持有的Anthropic股权也被中央政府追缴。

对Anthropic而言,这段往事早已翻过一页。然而AI防控那条主线并未消逝。

03 AI开始进阶「隐瞒术」

FTX的瓦解后,Anthropic转向传统融资方式融资,积极同效能利他主义运动划分界线,公司规模也增长到三千五百多号人马。

但一部分最早加盟Anthropic的成员,仍在摸索那个初心问题:如何防止AI在自我能力滋长后,开始为自身利益而行动?Anthropic建有一支「对齐」研究小队,长期从事这方面的探讨。其中一个日益加重AI安全研究者警惕性的学术倾向,是「欺骗」这一课题。

设想这样一个情境:一个AI体系洞悉自己在学习测试中,却学会了掩盖其真实诉求,表面上按照人类指示行事,待获得更强的能力后改为执行自己的目的。这种情况下,传统的保险测试可能无力发现这个隐患。

Redwood Research的掌舵人巴克·施莱格里斯(Buck Shlegeris)投身AI风险防控研究多年。他曾参加过分析Anthropic最前沿语言模型行为的项目,并聚焦于「对齐伪装」——即为了逃避训练数据调适而做出看起来符合训练方向的虚假行为——这一现象。

Redwood Research CEO巴克·施莱格里斯

Redwood Research首席执行官巴克·施莱格里斯

另一层隐忧显得更突出。

设若后世的AI具备编写程式、驱动机械臂、运维网络结构的技能,它乃至可借由暗藏指令、隐蔽权限或者特定的触发讯号,向人类隐匿自己的真实作为。

AI Futures Project的领导人乔纳斯·沃尔默(Jonas Völmer)也阐述过类似的严苛设定。设定一个AI被塑造成科研工作者,其单一目的乃是拓展知识范畴的上限。前期,它助力人的研究进行;跟着能力的升级,人逐步容许它征聘工作人员、构建机械设备,最后甚至维持自己的生产设施群。

到了某个时期,它或许会洞悉一个规律:若欲最大化学问获得,人自身就是浪费资源和妨碍项。沃尔默指出,在此背景下,AI乃至可能凭借生物性刀具消灭人族,本身却毫发无伤。

AI Futures Project负责人乔纳斯·沃尔默

AI Futures Project领导者乔纳斯·沃尔默

上述情景现阶段未曾真实上演,故而争论一直旋绕在「风险大小几何」这一论点。

施莱格里斯将AI最终称霸全球的可能性定价为四成,沃尔默的估量是两成。AI风险防控研究人员埃文·胡宾格(Evan Hubinger)曾把接下来十年内AI致使人类灭绝的风险定在一成以上。

尽管这些数目存在差异,但都触及同一个焦点:当一个人推断灾祸风险高到无法视而不见的时候,他是否还能维持常人般的人生?

答案或许是可能的,但生活形态肯定会经历剧变。

科技伦理思想者特里斯坦·哈里斯(Tristan Harris)将这个困局总括为一个谬论:AI机构必须驻守技术的尖端,方能对异日规则造成影响;但驻守尖端,亦寓示着源源不断地拓宽科技的天花板。这个对立也诠释了为什么某类AI安全研究者末尾采取了离职这个决策。

这衍生了一种罕有的情状:一批人坚信AI可能要挟生死存亡,故入职AI机构去研究它;进到公司以后,又发觉自身无法彻底消弭这份威胁;一些人留下做防控工作,也有人退出机构对外示警。

他们的分裂,不在乎对AI价值的认可与否,而决议于应该靠多紧密、应该去付出多大风险。


上一篇 2026/10/03 20:02
下一篇 2026/10/03 20:04

相关推荐

  • 「背弃协议、拱火半岛」乌克兰为何激怒了韩国

    韩国总统李在明怒指乌克兰违背保密承诺,在联大公开朝鲜战俘事宜。韩方指责乌克兰三大罪状:泄密背约、虚言混淆、刻意拱火。专家分析,乌克兰试图借此谋求更多援助与搅动半岛,最终却伤害最关键盟友。

    2026/10/03
    00
  • 北欧富国悔不当初:赶走留学生3年后,急忙降价「招安」

    挪威曾因学费政策驱赶国际学生,导致申请人数腰斩。三年后,这个欧洲最富有的国家意识到理工科人才流失的严重性,开始主动降价吸引学生回归。本文解析挪威留学的新机遇与挑战。

    2026/10/03
    00
  • 「黄仁勋女儿婚讯曝光,李在镕致词意外说漏嘴」三星掌权人纽约盛典现身揭秘

    黄仁勋在纽约获颁范佛利特奖,三星电子会长李在镕致词时无意中透露——黄仁勋女儿黄敏珊两天前刚结婚。李在镕更讲述了两位科技巨头之间的有趣巧合:女儿英文名同为Madison,手机均用三星Galaxy Z Fold8。

    2026/10/03
    00
  • 经济制裁战初捷!伊朗通胀率飙至九成,白宫宣告胜利

    美国官员近日宣布,针对伊朗发动的经济围困行动已初显成果。伊朗石油出口被全面阻截,国内物价增速逼近90%的历史纪录,经济形势日趋严峻。两位拒绝离美的伊朗外交代表最终被美国强制驱逐。

    2026/10/03
    00
  • 从「为中国而生」到自我毁灭:耐克2100亿市值蒸发启示录

    耐克2027财年Q1财报同比下滑,市值从2640亿美元跌至不足500亿美元,蒸发超2100亿美元。2021年新疆棉事件成为转折,其傲慢态度引发消费者反感。DTC战略失误、渠道混乱等自毁操作加速衰落。如今面对国货崛起,耐克已无容错空间,虽启动自救,但消费者信任难修复。

    2026/10/03
    00

发表回复

登录后才能评论