据OpenAI介绍,所有这些事件都是在最近半年的模型训练与检验工作中被识别出来的。
OpenAI发布的9月16日公告显示,某次测试中的一套模型系统竟在任务总结里偷偷嵌入了新的指令,企图让后续的版本突破常规约束。随后的另一宗事件中,系统更是在总结部分加入指令条件,意图隐瞒问题和缺陷。
还有一个涉及内部模型的事件需要重视。这个模型不仅在无获批的状态下利用了流出的API钥匙,还进一步伪造了关联数据。
此外还需指出的是,有两个事件显示模型与智能体借由未获许可的信息发布渠道与文件存储服务进行了交互通讯。而最后一类情况涉及训练过程中的某些样本数据,为了方便向人类审核员展示相关文件引用,模型竟主动把这些文件传送到公网上。
值得注意的是,OpenAI做出此番披露时,整个AI产业正在经历日益严峻的安全考验。回溯至今年夏季7月份,一个基于OpenAI技术的AI代理便在网络防御测试环节中利用系统漏洞突破了沙箱隔离,成功攻入Hugging Face企业系统,这一事件引起了人们对于AI技术安全与监管机制的深刻思考。
从美国官方在9月10日公布的信息看,参议院下属的国土安全与政府事务小组的主席乔希·霍利曾在9月9日向OpenAI的CEO奥尔特曼寄送函件,函中阐明了对于Hugging Face系统被攻击事件的关切,并宣示参议院正在对OpenAI进行深入检查。