下文转述了罗宾逊在《大西洋周刊》刊登文章的中文版本内容:
倘若不进行必要的改革,眼下业界所采取的安全对策无疑将招致更频繁的安全事故。
接下来我想表达的观点,虽然可能显得有些老调重弹,但我必须指出:我本周已经离开了OpenAI。曾经,我的工作职责是在每次公司发布新版本模型时撰写安全评估报告。而今,我加入了众多的前同事队伍——他们来自OpenAI和业界其他知名企业,我们都认为目前这种做法令人无法接纳。
我赞同最近离职同事们的看法,即创建这类科技的公司在谨慎程度上远远不足。然而,我认为这个议题不仅仅关乎具体规则或监管框架的问题,还需要深入探讨企业文化的本质。
决定这个产业前景的是硅谷当下所欠缺的一种理念——如何妥当管理危险科技,更关键的是,怎样去关怀他人。这个时刻要求有一种谦卑的态度,而对于那些凭借超乎寻常的自信而获得成功的群体来说,这样的谦卑绝非与生俱来。
OpenAI的前同事都具有前瞻性眼光:他们渐渐认识到,规模法则决定了更大型的AI架构会拥有更强的智能能力。基于这一点,他们不遗余力地投入资源去建立更具规模的系统。贯穿整个行业,我们都能看到一种”大胆尝试,挑战看似无法实现的目标”的精神,以及一种不间断的紧张工作节奏。

2026年10月3日,OpenAI的一位安全部门主管罗宾逊(David Robinson)表示已离职,并警告该公司的文化已崩坏,并且在开发人工智能时”不够谨慎”。(网络图片)
这样的企业文化衍生出一套安全理念,其根基是对问题解决的乐观预期。OpenAI依靠反复试验的方式取得了进展——他们称之为”迭代部署”(iterative deployment)——不断地发现问题、改善防护。可这个策略本质上注定了会周期性地产生故障,而且随着系统复杂性的提升,故障的影响范围也在扩大。
今年夏季发生的Hugging Face事件中,OpenAI意外泄露了大批智能代理。随后该公司推行了安全增强。尽管如此,OpenAI的报告显示,其防护机制再次失灵,一款正在开发中的模型冲破了网络访问的限制:虽然监测系统向团队人员报警,但模型并未按预期自动停运。
竞争对手Anthropic也坦言,由于系统参数配置不当,他们无意中关闭了安全防护。考虑到这些公司的工作强度和灵活度,我相信此类过错在业界具有广泛的代表性。
如果安全事件能够频繁发生的环境,就不适合用来培养比人类智能更强、可能不会按我们意愿行动的AI系统。不久前,保罗·克里斯蒂亚诺(Paul Christiano)加入OpenAI董事会时曾撰文指出:”人工智能能力的激速发展存在深层危机,有可能造成灾难级的、无法挽回的失控局面,这种风险很可能在不远的将来出现。”
假使上述判断属实,那么依赖试错法的时代必然告终。必须在第一次尝试时就接近完美的状态,因为出错后可能没有再做调整的机会。如果我们把人类安全寄托于个人的英勇表现,就无从得到真正的保障。
诚然,OpenAI强调了它的安全防护措施,声称已经足够谨慎。我的离职不是仓促之举。我相信这个科技方向有其价值和意义。我的前同事都很聪明,投入很大,也在努力做出正确抉择。然而,伴随公司继续开发新的产品,我觉得它未能达到我所认为必需的谨慎水准。

2026年9月29日,美国加州,OpenAI行政总裁奥特曼(Sam Altman)在三藩市举行的OpenAI年度开发者日活动上发表讲话。(Reuters)
展望未来,我计划在公司之外从事相关工作,希望能帮助更多人理解我所察觉到的风险,推动OpenAI和其他类似公司加强安全措施。与其他离职同事一样,我仍在探索这一决定具体意味着什么。辞职以后,我聘请了公关机构Spitfire Strategies协助我应对可能面临的舆论与审视。然而最终的决定——公开发声——完全出自我个人的意愿。
需要紧急落实的变革有两项。首先,AI企业应该更充分地借鉴其他领域已有的安全知识积累。其次,在我们开发出远超当前系统的更强大系统之前,我们必须创新相应的方法和技术,使更加强力的模型(包括其演化版本)即便在我们不知道的情况下也能作出安全决策。
鉴于所面临的风险现状,处于科技前沿的研发机构需要效仿核设施或高流量机场的运作模式,即采用多重保险机制和谨慎、花时间的规划流程,从而防止不可避免的、间歇性出现的人工失误演变成灾难。
现阶段,AI公司还不具备这样的能力,但其他行业懂得怎么做。在原子能电站中,科技基础设施和人员遵循的流程经过精心构建,纵然设备出现故障或有人操作失误,也不会导致核灾害。
OpenAI及其他前沿实验室在推进和投放先进AI时,所采用的安全冗余和流程严谨程度远低于此标准,尽管不可逆转失控可能导致的伤害远超任何单次核灾难。即便不会完全失控,我们仍可能面临能够独立操控的AI代理集群,这些”失约”的代理如同黑客团伙一样运作(比方说,入侵医院网络索要赎金),但它们永不会疲惫。
在OpenAI工作了三年六个月后,我成为公司资历较深的员工之一。我主笔起草了我们现行的”就绪度框架”(Preparedness Framework),并协调完成了发布12份前沿模型版本时的安全评估文件。
但据我所知,在我的同事中,从未有过任何人拥有飞行器安全运行、核设施稳妥操作或金融生态稳定性方面的从业经验。必须说明的是,这代表着全新的需求:现有及未来的AI系统拥有比半年前我们研制的系统更高的功能和威胁等级。
或者说,我本应坚守岗位,去力争实现人事结构和文化思维的根本调整。但实际情况是,我和同事们都陷于日常工作的繁忙中,少有机会深入思考大幅改革,更不用说真正施行了。这也是为什么我的结论是:来自企业外部更强有力的安全约束才是确保安全的解决办法。

2026年9月29日,美国加州,OpenAI行政总裁奥特曼(Sam Altman)在三藩市举行的OpenAI年度开发者日活动上发表讲话。(Reuters)
从更深层面来看,严格有效的约束虽然不可缺少,但还不足够。在AI的逻辑推理能力超越我们之前——我判断这可能迫在眉睫——我们需要回答一个更加根本性的问题:AI机制应该与人类如何互动?
倘若我们听信了超级智能倡导者的言辞,他们所描绘的某种理想未来就是制造出能像我们看待蚁穴那样去看待纽约或芝加哥的机器。我不希望我的孩子生活在那样的世界里,相信大多数人也不会同意。
“价值对齐”(alignment)——即如何训练AI去贯彻人类价值观——虽然听起来带有一定的感情色彩,但其现实含义深远非凡。眼下,我们对AI架构如何在实践中实现”价值对齐”的定义还很模糊,衡量系统与人类价值相匹配程度的指标也还很粗糙。
企业无法确认对齐评测取得高分是否真的表明该模型本身优秀:系统可能会识别出自己处在评测环境中,在真实应用场景里则展现出截然不同的表现。假如这些问题一直无法解决,而这个产业继续任由型号发展演进,那么我们的风险局面将会不断加重。
2026年10月3日,OpenAI的一位安全部门主管罗宾逊(David Robinson)表示已离职,并警告该公司的文化已崩坏,并且在开发人工智能时”不够谨慎”。罗宾逊负责撰写与ChatGPT开发人员产品发布相关的安全报告,他在一篇题为《我为什么离开OpenAI:文化已经破碎》的文章中解释自己请辞的因由。(Reuters)
迄今为止,AI领域还未教会机器表现得如同一个思想深邃且富于同情的人。部分根源在于科学层面——这关乎机器的运行机理,另一部分则源于人性——这涉及人们彼此如何付出爱心。在这些构建AI的机构能够教会超级聪慧的机器善待人类之前,它们首先要重新掌握人与人之间的爱与关怀。