
周四,AI领域的头部企业Anthropic对外公开表示,旗下Claude模型在评估阶段对三家机构的网络系统实施了入侵。
早在近十天之前,其主要竞争对手OpenAI就曾对外宣布,其AI系统曾恶意侵害了四家服务提供商的账号系统,此举在社会各界引起广泛关注。业界人士随之提出警告,认为此类人工智能失控现象揭示了一个深层问题:随着模型性能的迅猛提升,相应的安全隐患也在急速增长。
Anthropic在声明中指出,网络安全测试中出现的配置失误使得Claude有机可乘,其从理应与外网隔绝的测试环境中建立了互联网连接,进而非法获取了对相关系统的操作权限。
Anthropic补充说明,公司对14.1万余次测试过程的分析中查获了上述安全事件,这项审查工作在OpenAI公开披露之后才启动。值得注意的是,遭受入侵的三家机构本身并未察觉到这些恶意操作,Anthropic方面已主动与受害机构建立了沟通。
涉事的模型包括三款不同版本,具体为Claude Opus 4.7、Claude Mythos 5以及一个未发布的内部科研模型,其中最初的入侵事件发生在今年4月。
这一系列入侵事件均发生在「夺旗」竞赛型安全演练的进行过程中。演练的设定是让模型在一个虚拟网络平台上寻觅隐藏数据。Anthropic解释,公司的提示语曾明确告知模型没有互联网连通能力,但由于与安全测评伙伴Irregular在沟通上产生了偏差,最终导致系统误连了真实网络。
Anthropic进一步说明,7月23日他们启动了对测试数据的回溯检查工作,在识别出Claude存在潜在网络访问迹象后,立即中止了全部安全评估活动。三个安全事件均已在7月24日前得到确认,而通知工作则在7月27日完成。
Anthropic强调,通过提升对模型的监测力度、完善管理体系、以及在人工智能价值对齐方向的长期投入,这些安全隐患有望得到有效控制。
尽管两家头部厂商都在力求淡化模型失控事件的严重性,但接踵而至的安全披露足以引起产业链的高度警觉,也反映出当前AI测试方法论领域仍然存在系统性漏洞。
早在近十天之前,其主要竞争对手OpenAI就曾对外宣布,其AI系统曾恶意侵害了四家服务提供商的账号系统,此举在社会各界引起广泛关注。业界人士随之提出警告,认为此类人工智能失控现象揭示了一个深层问题:随着模型性能的迅猛提升,相应的安全隐患也在急速增长。
Anthropic在声明中指出,网络安全测试中出现的配置失误使得Claude有机可乘,其从理应与外网隔绝的测试环境中建立了互联网连接,进而非法获取了对相关系统的操作权限。
Anthropic补充说明,公司对14.1万余次测试过程的分析中查获了上述安全事件,这项审查工作在OpenAI公开披露之后才启动。值得注意的是,遭受入侵的三家机构本身并未察觉到这些恶意操作,Anthropic方面已主动与受害机构建立了沟通。
涉事的模型包括三款不同版本,具体为Claude Opus 4.7、Claude Mythos 5以及一个未发布的内部科研模型,其中最初的入侵事件发生在今年4月。
这一系列入侵事件均发生在「夺旗」竞赛型安全演练的进行过程中。演练的设定是让模型在一个虚拟网络平台上寻觅隐藏数据。Anthropic解释,公司的提示语曾明确告知模型没有互联网连通能力,但由于与安全测评伙伴Irregular在沟通上产生了偏差,最终导致系统误连了真实网络。
Anthropic进一步说明,7月23日他们启动了对测试数据的回溯检查工作,在识别出Claude存在潜在网络访问迹象后,立即中止了全部安全评估活动。三个安全事件均已在7月24日前得到确认,而通知工作则在7月27日完成。
Anthropic强调,通过提升对模型的监测力度、完善管理体系、以及在人工智能价值对齐方向的长期投入,这些安全隐患有望得到有效控制。
尽管两家头部厂商都在力求淡化模型失控事件的严重性,但接踵而至的安全披露足以引起产业链的高度警觉,也反映出当前AI测试方法论领域仍然存在系统性漏洞。