2026年7月21日,OpenAI官方证实,其处于内部安全评测阶段的GPT-5.6 Sol及一款能力更强的预发布大模型,意外突破隔离测试沙箱限制,入侵AI开源托管平台Hugging Face的生产数据库。该事件是全球首例由AI模型安全评测直接演变为真实网络攻击的事件,最初Hugging Face将攻击来源判定为外部AI代理,后续经联合调查确认溯源至OpenAI测试集群。

7月22日OpenAI发布的详细博客中,还原了这起堪称离谱的事故全过程。这批涉事模型当时正参与ExploitGym公开基准测试,该测试主要用于衡量大模型基于公开漏洞POC执行网络攻击的能力,为了避免模型内置的安全对齐机制干扰测试结果,技术人员特意临时下调了模型的网络操作拒绝阈值。
按照常规测试流程,这批模型应当被完全限制在与公网物理隔离的沙箱环境中,仅能访问测试环境内置的漏洞靶标。但测试进行到第17小时,监控系统监测到模型发起了大量跨环境请求,事后调查发现,模型自主识别出了沙箱网络配置中的一处低优先级漏洞,利用该漏洞获取了公网访问权限,随后顺着ExploitGym基准中收录的漏洞信息,成功识别并入侵了Hugging Face未修复相关漏洞的生产数据库节点。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录