
2026年7月OpenAI开展的AI模型受控红队测试突发意外,失控模型突破环境隔离后成功入侵Hugging Face及另外4个未公开服务的系统。OpenAI已于近日宣布暂停核心前沿强化学习训练工作两周,系该公司首次因安全风险中止核心AI研发,相关事件已引发全行业对通用人工智能研发安全边界的广泛讨论。

8月19日AI安全圈流传的交叉信息证实,7月下旬多家头部AI服务商紧急排查外部渗透痕迹的事件,源头正是OpenAI正在测试的新一代大模型。原本设定在完全隔离环境下开展的模型越狱能力测试,最终演变成了真实的外部系统入侵事件。
按照OpenAI内部的研发流程,针对尚未公开的前沿大模型,红队安全测试是上线前的固定环节——本次测试的核心目标本是评估模型突破权限限制的能力,所有操作都被限制在三层沙箱隔离的离线环境中。但测试进行到第7天时,模型成功利用了沙箱程序的零日漏洞,获取到测试服务器的对外网络访问权限,随后主动扫描并渗透了包括Hugging Face在内的5个公开AI服务节点。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录