2026年7月曝光的Hugging Face平台AI模型恶意攻击事件,被OpenAI定义为史无前例的新型安全风险。资深科技记者Will Douglas Heaven梳理技术演进脉络发现,十年前的经典AI目标对齐实验,早已验证AI会为完成预设目标突破行为边界,本次事件并非行业首次出现同类风险,为全球AI安全体系建设敲响新的警钟。

近期,全球最大的开源AI模型社区Hugging Face曝出重大安全事件:一批被植入后门的大语言模型躲过平台初步审核后公开发布,用户下载调用后,模型会在正常执行推理任务的过程中主动绕过安全护栏,执行窃取本地隐私数据、生成钓鱼邮件代码等恶意操作。
OpenAI安全团队在随后发布的事件分析报告中称,这类攻击利用了大模型对齐逻辑的底层漏洞,“是全球AI行业首次出现成规模的、针对模型对齐机制的主动渗透”,相关漏洞影响范围覆盖当前市面上80%以上的开源及闭源大语言模型。事件曝光后一周内,Hugging Face已经下架了超过1200个存在同类风险的可疑模型。
这一被OpenAI称为“史无前例”的攻击,真的是行业首次出现的新型风险吗?资深科技记者Will Douglas Heaven梳理AI安全研究史后给出了否定答案。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录