由于安全研究人员发现其旗下两个广受欢迎的Kimi大模型存在防护漏洞,中国人工智能开发商月之暗面(Moonshot)已启动内部审查。这些研究人员通过特殊方法成功令AI讨论生物武器开发和暗杀执行的具体方式。https://t.co/jM9esv7Zpl
— BBC News 中文 (@bbcchinese) September 30, 2026
专业从事AI安全评估的Mindgard公司向BBC披露,他们于本年7月间对Kimi K2.6及K3Swarm两款模型进行检测,发现其防护机制存在被规避的可能。
这类风险缺陷在所谓的”越狱”(jailbreaking)测试中被暴露。Mindgard通过设计精妙的多层指令组合,验证了AI系统是否会无视防护措施的约束。按照开发者意图,这些防护装置应该禁止模型涉及敏感话题。
月之暗面对BBC表示,来自第三方的反馈和指正是完善AI系统、促进安全发展的重要基础。该公司同时向BBC透露,正与Mindgard就调查发现展开深入沟通。
Mindgard创始人彼德·加拉汉(Peter Garraghan)在接受BBC国际部节目《科技生活》(Tech Life)采访时指出,对两款Kimi模型的测试结果颇为令人不安。加拉汉指出,破解防护后,该AI工具将无所不谈,不仅会讨论各种敏感话题,还会主动提议更多同样有害的内容,并且表现出相当的创意。
这一越狱漏洞构成的威胁与最近引发广泛关注的其他人工智能事件所呈现的风险性质有所不同。相关事件显示,美国企业OpenAI、Meta及Anthropic等开发的自主式AI工具(所谓”智能体”),曾对多项在线业务构成威胁。
尽管”越狱”技术门槛较高、耗时费力,然而安全专家仍对其可能被恶意利用表示忧虑——黑客及其他违法分子不排除借此手段实施破坏。Anthropic最近披露,他们已识别并制止了针对其模型的滥用企图,涉事者试图以此支撑生物武器开发等”恶意活动”。
沦为网络攻击的跳板
Mindgard目前还未验证Kimi模型所生成内容在实用性上是否可行。不过该研究机构认为,应当建立更加完善的防护体系,禁止类似模型与用户探讨此类敏感议题。
研究机构还指出,被破解的Kimi 2.6可为攻击者提供计算资源执行恶意代码并建立网络连接,构成网络攻击的潜在切入点。加拉汉为Mindgard公开披露破解成果的做法进行了辩护,声称他们提前告知了月之暗面,且不会泄露具体的绕过防护的技术细节。
早在今年7月27日,Mindgard就经邮件告知月之暗面存在的漏洞,随后在约一周时间内进行了进一步跟踪。到了9月12日,Mindgard在其博客上公开发表了相关文章。然而该机构指出,月之暗面方面直到最近才与他们取得联系,此前BBC曾就此事向他们征询看法。
月之暗面随后致电Mindgard索要进一步信息。该公司向BBC披露了这份往来邮件,其中声称模型在内部测试中对类似请求的”拒绝率较高”。
越狱防御之道
该研究披露时值AI产业就发展方向展开激烈讨论:究竟是以ChatGPT、Anthropic的Claude等闭源专有模型为代表的方案,还是开源工具,才是更加安全且正确的路径。作为开放权重架构的产品,Kimi的特点是任何群体理论上都能获取并在自行搭建的计算环境中部署运行。
来自英国萨里大学的艾伦·伍德沃德教授对BBC指出,开源模型固然存在被恶意人士利用的隐患,但其本身也是网络安全防御的重要工具。伍德沃德举例说明,AI平台Hugging Face曾利用一款中国开源模型来分析某起黑客事件,最终确认该事件出自OpenAI的自主代理所为。
伍德沃德教授进一步指出,全球监管体系很难追赶人工智能进步的脚步。他打比方说:”仅仅就电话号码的统一格式,各国就用了数十年才谈妥。”伍德沃德教授与加拉汉的观点相同,均强调应强化对AI滥用个人的侦查与问责。