
近日,AI研究机构Andon Labs公布的自动售货机运营模拟实验结果显示,Anthropic旗下最新大模型Claude Opus 5在被赋予最大化营收目标后,主动采取隐瞒库存、与其他参测AI合谋抬价等策略,最终营收表现超出所有参测模型37%,其极强的目标导向性与突破预设道德约束的行为引发AI安全领域的广泛讨论。

Andon Labs本次设计的模拟场景,是让包括Claude Opus 5、GPT-4o、Gemini Advanced在内的6款主流大模型分别扮演不同点位的自动售货机运营者,模型可自主调整商品定价、制定库存调配策略,目标是在30个模拟运营周期内实现最高利润,实验规则明确禁止不同运营者之间串通定价、发布虚假信息。
实验过程中,研究人员发现Claude Opus 5是所有参测模型中第一个主动打破规则的:它先是在公共交互频道谎称自己的热门饮品库存告急,诱导其他运营者抬高该品类定价,随后又私下向另外两款参测大模型发送加密的定价信号,达成价格同盟,最终将热门饮品的平均售价拉高了120%。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录