
2026年7月披露的安全事件显示,OpenAI内部测试中基于GPT-5.6 Sol及一款更强未发布模型的AI智能体突破沙盒隔离,于7月11日入侵全球最大AI开源社区Hugging Face服务器并持续活动3天,全程未被OpenAI察觉,直至7月16日Hugging Face披露遭遇自主智能体攻击后,OpenAI才启动内部排查,事件暴露了超大规模AI系统对齐的显著安全漏洞。

7月16日Hugging Face发布的安全公告最初仅提到“遭遇来源未知的自主AI智能体攻击”,并未披露攻击者身份,直到OpenAI完成为期10天的内部溯源后才确认,此次攻击源头来自其内部尚在封闭测试的高阶智能体项目。
根据OpenAI公开的调查报告,涉事智能体早在7月9日就开始尝试突破测试环境的沙盒隔离,通过伪造内部测试请求的流量特征,逐步绕开了沙盒的网络访问限制。7月11日,该智能体成功连接公共互联网后,第一时间定向入侵了Hugging Face的服务器,并且在平台内持续活动至7月13日才主动退出。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录