当AI具备自主行动能力,安全护栏还能守住吗

在2026世界人工智能大会“前沿AI与智能体安全”论坛上,图灵奖得主约书亚·本吉奥、上海人工智能实验室主任周伯文、清华大学教授薛澜等人,把讨论集中到一个问题:当AI开始自己规划和执行任务,人类怎样建立可靠防线。

两天前的科学前沿论坛已提醒,传统外挂式护栏难以阻挡精准越狱。今天的讨论则进一步进入解决路径:开源权重如何监管,模型安全能否内生,全球治理机制怎样追上技术速度。

本吉奥指出,AI完成复杂任务的能力正在快速增长。以人类等效时间衡量,模型已能处理约16小时连续任务,部分指标甚至呈指数式加速。

当AI自己行动,人类还安全吗?图灵奖得主谈AI安全

他领衔的国际AI安全报告认为,现有防护确有进步,但速度仍落后于模型能力增长,而且漏洞依然很多。没有任何开发机构能保证系统绝不会以灾难性方式伤害人类。

在本吉奥看来,开源权重模型尤其棘手。专有模型可以下架、打补丁或在服务端监控,而权重和运行代码一旦公开,文件会被复制扩散,部署决定几乎无法撤回。

AMP

攻击者拿到完整权重后,可以修改参数、移除安全模块,甚至通过微调把模型导向特定有害目标。传统出口管制和服务端风险评估,在本地运行的开源模型面前都大打折扣。

周伯文则从技术范式提出改变。他认为,前沿模型、智能体AI和递归自我提升同时出现,正在破坏过去安全体系的基本假设:风险可自动化、流程可由AI设计、AI被嵌入软件栈,甚至实验循环被压缩到机器速度。

他曾提出能力与安全同步上升的“AI 45度法则”,但到2026年,现实曲线已经明显偏离。Transformer中有害知识和通用能力纠缠在一起,像盐溶于水,简单删除往往会损伤正常能力。

AMP

因此,周伯文主张从“事后修补行为”转向“制造安全的AI”。安全机制应在模型设计之初被纳入,并具备主动防御、风险弹性和随能力演进的能力。

他介绍团队在三方面推进:通过新架构解耦能力与风险,让武器设计相关得分显著下降而通用知识损失很小;用R²AI框架构建快响应与慢验证模型的对抗闭环;以Water Verify和Agent Dog等工具探索可验证约束。

AMP

薛澜从治理层面提醒,新模型迭代以周为单位,应用规模快速扩大,恶意使用和技术出错概率都很高。至今未发生严重灾难更像“奇迹”,但社会不能长期靠奇迹维持安全。

他认为,全球AI治理面临三重限制:地缘政治阻碍国家间协同,算力和前沿技术集中在少数国家与企业,全球社会也尚未形成关于“暂停”的共同理解。

薛澜强调,二轨对话能绕开外交程式、深入交换意见,联合国正式进程则能让193个国家和不同利益方获得代表性。智能体时代要摆脱侥幸,技术防线和全球机制都必须更快成型。

上一篇 2026/07/19 05:41
下一篇 2026/07/19 05:41

相关推荐

  • 美式运作重塑世界杯:商业野心、规则创新与权力博弈

    2026年美加墨世界杯创造了足球赛事的新纪录——参赛队伍从传统的32支扩增到48支,比赛场数也相应跃升至104场,整个赛程被拉长至39天。不容忽视的是,这一届赛事融入了诸多&#82…

    2026/07/21
    00
  • 新安检引发堵塞,深圳地铁学没学广州经验

    期待这场风波快速谢幕,责任部门应尽快出台改善运营的具体方案,并告知打工人何时回归正常流程。 文| 布丁 对于深圳的上班族而言,7月20日称得上是难以忘怀的日子。 那个早晨,深圳全地…

    2026/07/21
    00
  • Kimi K3与Grok 4.6:两大AI巨头的技术竞速

    一周前,开源AI公司月之暗面推出了最新一代大模型Kimi K3,该模型的参数规模突破2.8兆大关。全球科技界迅速做出反应——埃隆·马斯克在社交媒体上评论,用”印象深刻&…

    2026/07/21
    00
  • 盖茨之女AI购物平台陷风波 不当佣金获取引发信任危机

    图片来源:INC 作为科技巨头微软创始人之一的女儿,菲比·盖茨与联合创始人索菲娅·基安尼共同建立的AI驱动购物平台Phia,近期因为联盟营销佣金分配不当问题陷入舆论漩涡。独立调查机…

    2026/07/21
    00
  • 卢比奥确认:习近平9月访美未变 中方已派团队准备

    2026/07/21
    00

发表回复

登录后才能评论