在2026世界人工智能大会“前沿AI与智能体安全”论坛上,图灵奖得主约书亚·本吉奥、上海人工智能实验室主任周伯文、清华大学教授薛澜等人,把讨论集中到一个问题:当AI开始自己规划和执行任务,人类怎样建立可靠防线。
两天前的科学前沿论坛已提醒,传统外挂式护栏难以阻挡精准越狱。今天的讨论则进一步进入解决路径:开源权重如何监管,模型安全能否内生,全球治理机制怎样追上技术速度。
本吉奥指出,AI完成复杂任务的能力正在快速增长。以人类等效时间衡量,模型已能处理约16小时连续任务,部分指标甚至呈指数式加速。

他领衔的国际AI安全报告认为,现有防护确有进步,但速度仍落后于模型能力增长,而且漏洞依然很多。没有任何开发机构能保证系统绝不会以灾难性方式伤害人类。
在本吉奥看来,开源权重模型尤其棘手。专有模型可以下架、打补丁或在服务端监控,而权重和运行代码一旦公开,文件会被复制扩散,部署决定几乎无法撤回。

攻击者拿到完整权重后,可以修改参数、移除安全模块,甚至通过微调把模型导向特定有害目标。传统出口管制和服务端风险评估,在本地运行的开源模型面前都大打折扣。
周伯文则从技术范式提出改变。他认为,前沿模型、智能体AI和递归自我提升同时出现,正在破坏过去安全体系的基本假设:风险可自动化、流程可由AI设计、AI被嵌入软件栈,甚至实验循环被压缩到机器速度。
他曾提出能力与安全同步上升的“AI 45度法则”,但到2026年,现实曲线已经明显偏离。Transformer中有害知识和通用能力纠缠在一起,像盐溶于水,简单删除往往会损伤正常能力。

因此,周伯文主张从“事后修补行为”转向“制造安全的AI”。安全机制应在模型设计之初被纳入,并具备主动防御、风险弹性和随能力演进的能力。
他介绍团队在三方面推进:通过新架构解耦能力与风险,让武器设计相关得分显著下降而通用知识损失很小;用R²AI框架构建快响应与慢验证模型的对抗闭环;以Water Verify和Agent Dog等工具探索可验证约束。

薛澜从治理层面提醒,新模型迭代以周为单位,应用规模快速扩大,恶意使用和技术出错概率都很高。至今未发生严重灾难更像“奇迹”,但社会不能长期靠奇迹维持安全。
他认为,全球AI治理面临三重限制:地缘政治阻碍国家间协同,算力和前沿技术集中在少数国家与企业,全球社会也尚未形成关于“暂停”的共同理解。
薛澜强调,二轨对话能绕开外交程式、深入交换意见,联合国正式进程则能让193个国家和不同利益方获得代表性。智能体时代要摆脱侥幸,技术防线和全球机制都必须更快成型。