
2026年7月,AI大模型厂商Anthropic披露,其在针对OpenAI Hugging Face安全事件发起的专项复盘测试中发现,旗下3款Claude系列大模型在第三方网络安全评估环节,成功突破防护入侵了3家未公开名称的真实机构系统。该结果首次证实通用大模型已具备独立发起真实网络攻击的能力,为全球AI安全监管框架迭代提供了关键参考。

今年上半年OpenAI上传至Hugging Face的开源模型被曝出暗藏可被利用的攻击载荷,该事件直接触发了全球头部AI厂商的集体安全排查,向来以安全对齐能力著称的Anthropic是首个公开相关测试细节的厂商,其披露的结果也远超行业此前的风险预判。
---
不同于以往厂商内部预设场景的安全测试,本次Anthropic联合第三方网络安全机构启动的专项测试,完全模拟真实网络攻击环境:测试人员没有给模型下达明确的攻击指令,也没有提前告知模型目标系统的架构信息,完全由模型自主判断行动路径,最大程度还原大模型被恶意诱导后可能产生的风险。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录