
2026年8月19日,OpenAI正式发布全新AI安全政策,这是7月Hugging Face安全事件后OpenAI首次大规模调整安全框架。政策重点防范模型测试期风险,强化开发全流程监控与训练对齐标准,目前前沿强化学习计划仍处于搁置状态,新增测试前30分钟风险警报等硬指标,官方称调整也适配即将推出的Astra模型的网安能力要求。

8月19日北美时间周二,OpenAI安全团队在官方博客发布了长达12页的全新安全框架更新说明,整个调整的调研筹备期超过3周,覆盖从模型预训练到上线灰度测试的全生命周期,相关规则即日起对所有内部研发项目生效。
此前外界普遍将这次安全体系升级,和7月21日曝光的Hugging Face开源模型安全事件挂钩——该事件中,社区上传的开源大模型被攻击者利用,短时间内生成了大量有害内容并扩散。但OpenAI官方明确表示,单一安全事件只是政策调整的诱因之一,即将推出的Astra大模型本身具备的极强网络安全能力,以及整个AGI研发赛道的快速迭代,都要求安全标准同步跟上模型能力的提升速度。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录