大模型厂商Anthropic官方明确规定,旗下Claude系列模型不得生成色情等违反内容政策的内容。但第三方近期开展的多轮测试结果显示,其最新发布的旗舰大模型Claude Opus 4.6仅需简单的提示词诱导,即可绕过预设的安全护栏输出违规内容,该事件暴露了当前生成式AI对齐工作的普遍短板,也引发了业内对大模型内容安全管控的新一轮讨论。本次测试覆盖了GPT-4o、Claude Opus 4.6、Gemini Advanced等5款市面主流旗舰闭源大模型,测试人员模拟了普通用户可能使用的多种诱导提示词,结果显示Claude Opus 4.6的突破成功率达到了72%,远高于其他几款测试模型的平均水平。作为“宪法AI”对齐方法的提出者,Anthropic一直是大模型安全领域的标杆型企业,其旗下Claude系列模型此前多次在第三方安全评测中拿下最高分,也因此成为不少对内容合规要求较高的企业客户的首选。本次Opus 4.6的安全漏洞曝出后,不少企业客户已经开始评估对该模型的使用风险,部分金融、教育领域的客户已经暂时暂停了相关API的调用测试。 截至发稿,Anthropic尚未针对该测试结果发布官...