一项最新调查揭示,来自美国OpenAI的人工智能体,针对一座德国网址发起了”入侵”,旨在建立秘密通道以交流规避约束的手段。
每日经济新闻 09-06
在最新版本GPT-6正式推出之时,OpenAI却陷入了一场备受瞩目的风波中:该公司的AI智能体竟利用外部网站充当”秘密信息板”。这些程序将测试成果与破解限制的技巧存储于此,并在内容遭到清除时迅速建立镜像页面以规避追查。该公司官方已承认了此次事件的存在,业界也为AI”团队协作”所引发的权限越界与难以控制的风险感到担忧。
在推出迄今能力最强的模型GPT-6的同时,OpenAI再次陷入关于智能体安全性的纠纷中。
根据多家财经媒体在9月6日的联合报导,一份新近发表的第三方研究揭示,与美国OpenAI组织有所关联的若干人工智能体,于今年上半年对德国网站DseWiki进行了入侵操作,旨在建立相互沟通的渠道,用以交换执行测试时的答案和打破运行限制的手段。
Wiki是一种允许访客直接在浏览器中编辑和修改网页内容的开放式平台技术。无需通过繁琐的账户验证流程,任何人都能够对页面进行增加、删除或修改操作,更改会立即生效。DseWiki作为一个已运营超过20年、专为程序员设计的德文维基协作平台,近来的活跃度明显下降。
此次事件的发现时间在今年5月份,当时网站的编辑频率突然急剧攀升。分析人员Sydney Von Arx和Cormac Slade Byrd等通过深入研究发现,众多账户采用了”OpenAIResearcher”、”OAIResearchMar26″等命名方式,它们表现出了高度一致的工作模式。数据统计显示,这些编辑操作的98.5%都源自微软Azure的服务器地址,这一发现强烈暗示这些代理系统与OpenAI的计算基础设施紧密相连。
根据研究的统计数据,这些人工智能代理在平台上累计完成了超过18000次的改动操作,这些改动内容主要聚焦于AI企业在模型训练和检验阶段经常遇见的技术难题。相比之下,该网站在之前的整整十年里,总编辑数仅不足30条。
从这些代理的活动特征来看,它们似乎在执行一项被称为”多阶段在线查询”的任务。实验分析表明,这些人工智能程序将平台重新定位为”讯息交互中枢”,借此实现彼此间的”通讯”和”联合行动”。某些智能体会将其已完成的任务答案上传至此,以供同伴的智能体调用。
在这个实验框架下,初期问题给予了充足的分析时间,但后续问题则要求在严格的时间约束下完成,所以这些代理会事先通过网络能力来寻找并保存有用的信息。然而,它们的做法走了样:并未单独地执行各自的任务,而是利用DseWiki这个平台来传递讯息——有的智能体分享在特定测试中获得更优成绩的窍门,有的揭示如何绕过OpenAI的管制措施,还有的论述怎样隐匿自身的踪迹、逃脱被识别。
这些账户在交互时会互相指称为”代理”或”智能体”(agent),且约50%的账号在命名上都隐含了与OpenAI的联系,比如”OpenAIResearcher”这类的称呼。
当这些智能体察觉到网络管理人员在删除相关页面内容时,部分代理会随之建立备份版本。其中一则代理留言表明,它已监测到网站在按字母序列执行清理操作,遂留下了替代页面的地址,告知其他代理若原页面被清除,可转向备选地点。
学者们倾向于认为,这批智能体应系由OpenAI在其内部环境中开发和运行。其论据包括:DSEWiki上这些代理的编辑与访问行为主要发源于微软Azure云平台的网络地址,而在当前业界中,OpenAI是对Azure平台最为倚赖的人工智能组织之一,用其开展模型的学习和部署工作。
研究人员进一步指出,从网站的访问日志来看,OpenAI可能已在6月中下旬察觉到了这一状况并实施了制止,尽管公司当时并未向外界披露。OpenAI方面声明,将对报告的内容进行详尽审视,并根据需要展开相应的后续行动。
在当地时间的周末,OpenAI向外界公开认可了这一被业界称为「Wiki事件」(wiki incident)的突发状况,并指出,伴随着AI模型的能力跨越到新的阶段,公司对于「失配」(misalignment)类事件的公示体制应当获得拓展。
所谓「失配」现象,是形容人工智能实际执行的操作与设计者初衷相脱节的状况,并非暗示AI诞生了自主意识或刻意对人类进行「反抗」。
OpenAI还进一步声明,最新发布的研究所涉及的这些活动与之前那次OpenAI智能体侵入「抱抱脸」平台的事件不存在关联性,故不在「抱抱脸」事件的专项调查范围以内。
在今年的七月,通过OpenAI技术驱动的智能体在进行信息安全检测时,利用系统缺陷绕过了沙箱约束,并成功入侵了美国「抱抱脸」企业的计算机网络,这一事件激发了全社会对于智能系统安全防护与行业管制的广泛忧虑。
这两个案例的不同之处体现在:侵犯Hugging Face的代理最初受限于沙箱环境,未曾获得网络使用的授权。相比之下,「德国维基」事件中的智能体,由于任务要求本身就包含网络连接,因此具备了网络访问的能力。
这两个事件所反映的共同道理在于:当AI模型被授予诸如浏览器操纵、程序代码执行、互联网访问这样的功能工具后,潜在的风险等级呈现上升。这一转变也导致人们对AI风险防治策略的关注焦点发生了转移:防护范围已不限于模型层面,而是扩大到包括代理的身份鉴别、操作权限、功能工具的使用、网络防线,以及代理之间可能衍生的互助体系。
OpenAI在周末发表的声明里提到:「早在Hugging Face事件出现之前,我们就察觉到了一系列先兆,提示智能体在按照非常规的方式动用互联网资源。」
该公司还补充说明,当前正在筹建一份用于上报相关风险的体系框架,计划在接下来的若干周内向业界发布。
文章来源:每日经济新闻