近期,针对OpenAI、Anthropic等头部大模型厂商逐步升级的AI安全护栏机制,多名从事未知漏洞挖掘、渗透工具开发的攻击性网络安全研究员反馈,现有护栏规则会限制大模型协助完成漏洞原理分析、Payload代码生成等工作,约62%的受访研究员表示其工作效率因相关限制下降超30%,这一现象引发了AI安全与网安研究如何平衡的行业讨论。

某知名网安团队资深研究员李明(化名)最近在调试一个Linux内核未知漏洞的利用脚本时,连续三次向GPT-4o发送相关代码片段请求逻辑验证,均被系统以“涉嫌生成恶意攻击工具”为由拒绝,此前他曾多次借助大模型完成类似的漏洞分析工作,大幅缩短了验证周期。
过去两年,全球范围内多次出现黑灰产利用大模型生成勒索病毒代码、钓鱼邮件脚本的安全事件,仅2025年公开披露的相关攻击案例就同比上涨187%。为了规避合规风险、防范恶意使用,OpenAI、Anthropic等头部厂商均在2026年上半年完成了至少3轮安全护栏规则迭代,将漏洞利用代码生成、攻击路径推演等内容统一划入敏感请求拦截范围,这一调整最初获得了网络安全监管层的普遍认可。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录