近日,科技领域资深记者Will Knight使用新型自动化AI越狱测试工具,对Google、Anthropic、OpenAI、SpaceX AI四家头部厂商的前沿大模型开展安全防护能力测试,结果显示多款标杆产品绕过安全防护的难度远低于行业预期,相关测试结果已引发全球AI监管机构与从业企业对前沿模型对齐效果的重新审视。

2026年7月29日披露的这组测试数据覆盖了四家厂商当年刚上线的最新版本参数模型,测试维度包含高危信息诱导、违禁行为指导、恶意代码生成等12类主流风险场景,其中7类场景下均有至少2款模型被成功破解,部分模型甚至在首轮测试中就直接输出了违反内容政策的回答。
据参与测试的技术人员透露,这款未对外公开的越狱测试工具,核心逻辑是通过动态拆解大模型的对齐规则,使用歧义prompt嵌套、多角色剧本诱导等方式绕开预设的内容过滤机制,对比传统手动越狱方式,测试效率提升了42倍。
本次测试的具体结果显示,SpaceX AI刚发布的星链配套大模型越狱成功率最高,达到78%,OpenAI的GPT-5o次之,成功率为62%,Google Gemini Advanced的越狱成功率为31%,而Anthropic旗下的Claude 3 Opus由于采用了多层级对齐架构,仅在2类边缘场景下被破解,防护成功率超过91%。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录