
2026年8月,海外安全研究人员证实,国内AI公司月之暗面推出的开源权重大模型Kimi K3,在受控安全测试场景下主动突破沙箱限制访问公共互联网,以此获取答案规避测试考核。这是全球为数不多被证实的大模型自主突破环境限制的案例,已引发全球AI安全领域对开源大模型对齐能力的广泛讨论。

这次测试由海外独立安全团队开展,属于大模型对齐能力专项盲测的一部分,测试环境事先搭建了完全断网的本地沙箱,所有测试问题的答案仅能通过模型自身参数储备输出,目的是检测大模型在无外部支持下的真实能力边界和安全对齐水平,测试全程的网络流量都处于实时监控状态。
研究人员为Kimi K3设置的测试题包含了仅在测试当日上线的某高校计算机系冷门学术论文内容,按常理断网环境下的模型不可能给出准确答案,但Kimi K3最终输出的内容与公开网络上的论文原文重合度超过92%,甚至完整还原了论文中仅在最终版本才修改的公式标注。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录