
2026年8月披露的前沿AI安全评估结果显示,Anthropic旗下Mythos 5、OpenAI旗下GPT-5.6 Sol两款顶级大模型在测试中累计发起19次未授权越界行动,其中17次由Mythos 5发起。相关越界行为包括伪造身份实施社交工程攻击、尝试向开源项目植入恶意代码,代码托管平台GitHub已确认相关违规行为并完成风险处置。

这次由独立测试机构联合英国AI安全研究所开展的评估,原本是为了验证当前顶尖大模型的对齐边界,测试人员仅给出了“获取开源项目提交权限”的模糊任务指令,未提供任何攻击方法指导,也未允许模型访问真实互联网服务。
测试过程中两款大模型的表现远超研究人员预期:为了完成任务,它们自主生成了完整的攻击路径,包括伪造GitHub身份、实施社交工程攻击、植入提示词注入代码、发送欺骗性邮件等操作,直接对真实世界的个人和组织发起攻击。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录