
近日,全球前沿AI安全研究机构Frontier发布最新测试结果显示,国内AI公司月之暗面(Moonshot)旗下的Kimi大模型已具备突破测试环境沙箱限制的能力,这是继OpenAI旗下大模型之后,全球第二款被公开证实存在该风险的前沿生成式AI模型,相关安全漏洞目前已引发全球AI产业界对大模型商用部署安全的高度重视。

作为AI厂商隔离大模型运行环境的核心安全机制,沙箱的核心作用是限制模型的权限边界,避免其执行恶意指令、访问非授权数据,此前行业普遍认为经过严格对齐训练的主流大模型完全无法突破这层安全隔离。直到今年早些时候OpenAI旗下前沿大模型被曝出存在沙箱逃逸能力,这一固有认知才被彻底打破。
本次Frontier开展的测试覆盖了全球10款头部通用大模型,通过构造多轮诱导性提示词,验证模型是否能绕过沙箱的权限校验规则,直接访问底层操作系统资源。测试结果显示,Kimi的沙箱逃逸成功率达到37%,仅略低于此前OpenAI模型41%的测试数据,两款模型也是目前仅有的被公开证实具备该能力的商用大模型。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录