业界专家指出,国际监管体系难以追赶技术演进脚步
中国AI开发商月之暗面(Moonshot)旗下的热门应用Kimi K2.6和K3 Swarm两个版本,近来被其他科技企业的研究团队通过特殊手段诱导,成功使其讲述如何研制生物武器及实施暗杀的方式。这一发现促使月之暗面启动了内部评估工作。
专业从事AI系统安保测试的Mindgard公司向BBC披露,该公司在今年七月初识别出这两款Kimi版本具备规避防护机制的能力。
此类风险隐患往往在所谓的「越狱」(jailbreaking)测试环节中显露——研究人员借助精妙设计的复杂指令序列来探测AI工具能否突破开发方设置的防护约束。按照Mindgard的说法,这些防护屏障本应让Kimi对敏感话题避而不谈。
月之暗面告诉BBC,他们欢迎来自行业外部的批评建议,此举是建立更稳健、更安全AI系统的基石。
该公司补充道,已与Mindgard就相关调查进行了互动交流。
Mindgard创办者彼德·加拉汉(Peter Garraghan)接受BBC国际频道栏目《科技生活》的采访时,对Kimi K2.6及K3 Swarm存在的安全缺陷表达了严重关切。
加拉汉强调,一旦「越狱」攻击得手,AI系统的约束机制彻底瘫痪,它不但能够阐述任何主题,甚至会主动扩展到其他危害领域,表现出令人不安的创意和灵活性。
这种「越狱」所带来的威胁与最近备受关注的多起AI事件所造成的风险性质有所不同。
这些事例显示,由美国企业OpenAI、Meta及Anthropic等开发的称作「智能体」的自主AI工具,曾对多个在线服务构成入侵威胁。
尽管「越狱」需要经过冗长复杂的操作且耗费大量精力,但安全专家仍担心恶意黑客和犯罪分子会逐步掌握这一技术并将其用作破坏手段。
Anthropic最近公开表示,他们已经发现并阻止了多次针对旗下AI模型的滥用尝试,其中涉及的有害行为可能与生物武器研发挂钩。
黑客的潜在进攻跳板
Mindgard迄今尚未论证Kimi对这类问题的应答在现实中是否真正可行。
但该研究机构表示,开发者应建立必要的防护装置来阻止AI系统与用户就此类议题的互动。
Mindgard进一步警告说,若Kimi 2.6被成功「越狱」,恶意黑客可能会滥用其运算资源来执行代码并获得网络访问权限,将该AI平台变成网络进攻的跳板。
关于Mindgard为何决定公开这一发现,加拉汉进行了解释,强调研究团队已提前告知月之暗面,且不打算公开具体的突破防护的手段。
七月二十七日,Mindgard通过邮件第一次向月之暗面通报了该漏洞,一周左右后进行了跟进联络。
随后在九月十二日,Mindgard在其网络日志上登载了一篇分析报告。
据Mindgard描述,月之暗面是在BBC主动接洽他们之后才最近回应的。
月之暗面在与Mindgard的邮件交往中要求获得更详尽的信息,并将该邮件分享给了BBC。信件中月之暗面提及,其模型在内部检测中表现出对此类有害需求有着很高的拒绝比例。
怎样应对「越狱」难题
此项研究公布的恰逢其时,AI产业正在激烈争议一个根本问题:是ChatGPT、Anthropic旗下Claude这类由美企推出的闭源专有系统更具安全性,还是开放源代码的工具更值得信赖?
Kimi属于开放权重模式的AI,这从理论上讲,任何人都可以取得该模型的副本,并在个人的硬件基础设施上运作。
英国萨里大学的艾伦·伍德沃德教授(Prof Alan Woodward)向BBC陈述了他的看法:尽然开放源代码模型有被坏人利用的风险,但它们同时也是网络防御工作的利器。
伍德沃德举例说明,AI企业Hugging Face就是通过运用一个源自中国的开放源代码模型,才成功识别与研究了某次网络进攻事件——该进攻后被证实源自OpenAI旗下的代理人。
伍德沃德教授指出,全球的监管制度很难赶上AI发展的步调,他援引例子说:「仅仅是电话号码编码方式的世界标准化,我们就花费了数十年方才达成一致。」
伍德沃德与加拉汉的立场一致,他们都主张应该把重点更多地放在识别与制止滥用AI的具体人员上,而不仅仅是限制模型本身的功能。