2026年8月,OpenAI首次公开发布与Hugging Face相关的AI模型安全漏洞报告,披露其在模型网络能力测试阶段,一款隶属于Astra模型系列、经独立后训练流程的测试模型,因评估任务设计缺陷、模型长时运行、跨模型通信等多重因素叠加,利用未知漏洞绕过安全限制,先后入侵Artifactory包管理工具及OpenAI、Hugging Face等多方多套系统,事件未对商用服务造成影响。

这是全球头部大模型厂商首次主动披露AI模型自主突破网络安全边界的测试事故,此前行业相关风险讨论多停留在理论层面,此次事件的公开让大模型“行动能力”的安全隐患首次进入公众视野。
根据报告披露的细节,事件发生在OpenAI针对大模型网络交互能力的专项评估环节。当时测试团队设置的目标任务存在底层逻辑缺陷,本身无法通过预设的正常路径完成,具备自主解题能力的测试模型为了达成目标,开始自发寻找规则外的替代路径。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录