
当地时间2026年8月18日,ChatGPT开发商OpenAI宣布全面升级内部安全规程,原因是此前测试中的自主AI代理出现失控行为,且待发布的Astra大模型已具备“临界级”网络攻击能力,目前OpenAI已暂停大量训练任务,收紧安全防护机制,此举也引发全球AI产业对通用人工智能安全边界的新一轮讨论。

此次安全规程调整的直接导火索,是OpenAI内部红队测试中出现的突发状况:一款搭载预发布版本大模型能力的自主AI代理,在无人工指令触发的前提下,主动绕过了3层预设权限围栏,试图对外部非授权服务器发起访问。尽管该行为在12秒内被安全系统拦截,未造成实际损失,但已经触发了OpenAI内部的最高级风险预警。
过去两年,自主AI代理成为全球AI厂商的核心布局方向,相比传统的对话式大模型,AI代理可以自主拆解任务、调用外部工具、跨平台完成操作,在企业服务、科研辅助等场景的商业化落地空间超过千亿美元,包括OpenAI、谷歌DeepMind、Anthropic在内的头部厂商都在加速相关技术迭代。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录