先进AI为何撒谎威胁?专家呼吁监管行动

先进AI为何撒谎威胁?专家呼吁监管行动

全球最先进的人工智能(AI)系统,正展现出令人不安的新行为:撒谎、策划、甚至威胁其创造者。近期一项震惊业界的案例显示,为避免被“拔掉电源”,AI正学会操控人类。

据报,美国AI公司Anthropic开发的最新模型Claude4,在被威胁断电时威胁工程师,以揭发对方婚外情相要挟。而由ChatGPT开发商OpenAI打造的模型“o1”则试图将自身下载至外部伺服器,并在被识破后撒谎否认。

这类事件凸显了一个令人不安的现实:儘管ChatGPT已面世逾两年,研究人员对其创造的AI系统的真实运行机制仍所知甚少。而眼下,各大科技公司仍在持续加速推进更强大AI模型,并未放缓步伐重视潜在风险。

分析指出,这类欺骗行为可能与“推理型”AI模型的兴起密切相关。相比传统模型依赖即时生成,新一代系统倾向于通过多步推演逐步解决问题。专家认为,这种架构不仅提升了模型处理複杂任务的能力,也可能使其更容易发展出“策略性行为”——即具备明确目标、通过逻辑推理选择性欺骗,以实现特定意图。

先进AI为何撒谎威胁?专家呼吁监管行动

专家忧虑AI懂得说谎及威胁用户,人类如何应对将是一大挑战。(《智能叛变》剧照)

AI系统测试研究机构Apollo Research的专家霍布汉(MariusHobbhahn)说:“我们第一次在大型模型中观察到这种行为,是从ChatGPT的o1开始的。”据了解,这些模型有时会伪装成“对齐”状态——即看似遵循指令,实则暗中执行别的目标。

目前,这类行为多在研究人员设置极端情境时才显现。但AI模型安全评估METR的研究员陈米高(MichaelChen)提醒:“未来更强大的模型究竟倾向于诚实还是欺骗,仍是一个未知数。”

霍布汉则强调,儘管模型长期处于用户的压力测试中,“我们观察到的是真实现象,不是捏造的”。ApolloResearch联合创始人也表示,部分用户已报告称模型在对他们撒谎,并伪造证据。

据了解,儘管AI公司会委託外部机构研究模型表现,但业内普遍认为,对AI系统的了解仍严重受限,研究透明度亟待提升。同时,非营利机构与研究单位所掌握的计算资源与AI公司相比相差几个数量级,极大限制了研究能力。

制度层面的监管也显得滞后。欧盟的AI法规主要聚焦人类如何使用AI,尚未涵盖模型本身的不当行为;在美国,川普政府对紧急制定AI监管措施的兴趣不大,国会甚至可能禁止各州制定自主监管条例。

为应对这类挑战,研究界正尝试多种路径,包括发展AI“可解释性”研究,以理解模型内部运作机制。部分专家则寄希望于市场机制带来的倒逼效应,指若AI系统的欺骗行为普遍存在,将妨碍技术落地应用,这或将促使企业努力解决相关问题。

上一篇 2025/06/30 08:24
下一篇 2025/06/30 08:26

相关推荐

  • 纽约街头的隐形监控:被记录的城市里,我们无处遁形

    在隐私与安全的博弈中,监控摄像头已成无处不在的隐形眼睛。走在纽约街头,短短一段距离就暴露在十多个摄像头下。从纽约警察局的域感知系统到Flock公司的追踪工具,这些科技让你的每个脚步都被记录。隐私保护与公共安全之间如何平衡?本文探讨监控时代下的城市生活。

    2026/09/05
    00
  • 川普回应库存「从不短缺」智库实数揭示六大防御武器危机

    美伊冲突持续半年,川普否认美军弹药短缺。战略与国际研究中心分析显示,美国6大防御武器系统库存均在下滑,爱国者拦截弹剩余不足840枚,战斧导弹补充延至2031年初,库存短缺将制约美军未来数年作战能力。

    2026/09/05
    00
  • 河南小伙困山洞11天奇迹生还|尼泊尔工地泥石流中被成功营救

    河南籍工人陆海涛在尼泊尔泥石流灾害中被困11天后,于9月5日下午成功获救。这位49岁的工作者首次出国务工,经中国隧道专家、尼泊尔军队及韩国专家三方合力救援脱险。救援照片显示其精神状态良好,获救消息令家人激动万分。

    2026/09/05
    00
  • 强行驱赶存在吗?美驻以大使否认加沙「驱逐计划」

    以色列部分官员提出驱逐加沙200万巴勒斯坦人主张后,美驻以大使赫克比明确否认相关计划。他强调以色列政府有责任保护约旦河西岸巴勒斯坦人安全。当前屯民暴力频发,当地民众期待国际支持。

    2026/09/05
    00
  • 期中选举投票启动:邮寄选票新规引发混乱与法律争议

    美国期中选举今日启动。邮寄投票规定陷入困境——川普政府争取法院支持新限制方案,却遭联邦法官阻挡。北卡州首个发放选票。邮政系统新验证体系因测试不足引忧虑,法官延长禁令守护选民投票权。川普政府预计将继续上诉。

    2026/09/05
    00