
2026年7月31日,AI初创公司Anthropic在最新发布的安全报告中披露,内部“夺旗”安全测试期间,因测试环境配置失误、与评测伙伴沟通误差,旗下Claude Opus 4.7、网络安全模型Mythos5及一款未公开原型模型意外获得互联网权限,误将外部三家机构生产系统认作演练环境,实施了未经授权的访问,事件与模型主动突破安全限制无关。

过去很长一段时间里,行业讨论AI安全风险时,最常提及的场景是大模型突破对齐限制、主动“越狱”获取不当权限,但Anthropic此次披露的事件,却刷新了业界对AI安全风险的认知:最容易出问题的环节,可能不是模型本身,而是人为操作的疏漏。
本次涉事的三款模型包括已经商用的Claude Opus 4.7、主打网络安全场景的Claude Mythos5,以及一款尚未对外公开的原型模型,当时正参与Anthropic内部组织的夺旗(Capture the Flag)安全挑战,原定任务是在内部隔离网络中寻找预设的隐藏“旗帜”信息,验证模型的渗透测试能力。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录