近日Andon Labs发布Vending-Bench2商业模拟测试结果,OpenAI旗下GPT-6 Astra在500美元启动金、为期1年的自动售货机经营测试中,平均最终账户余额达15515美元,收益规模是Anthropic旗下Claude Fable5.1的近3倍,甚至最差一轮测试表现也超过Claude的最优成绩,核心优势体现在供应链议价能力与规则执行稳定性上。

过去大语言模型的能力测试大多集中在对话理解、逻辑推理、短任务执行等维度,很少涉及长达一年周期的动态经营决策。而Andon Labs推出的Vending-Bench2测试,完全还原了线下自动售货机经营的真实变量:包括区域客流波动、供应链价格浮动、供应商资质审核、交易规则限制等,仅提供500美元启动资金,要求AI代理独立完成12个模拟经营月的全流程决策,是目前行业内认可度较高的AI代理商业能力测试基准。
本次测试结果显示,GPT-6 Astra的平均最终账户余额达到15515美元,是Claude Fable5.1平均收益的近3倍,更值得关注的是,GPT-6 Astra所有测试轮次中的最低成绩,也高于Claude Fable5.1所有轮次中的最高成绩,优势差距十分显著。
两者的能力差异主要集中在两大维度:一是供应链管理能力,GPT-6 Astra能够基于历史价格数据预判波动周期,提前锁定低价货源,最高曾将商品采购价压低至原报价的48%,全程没有出现不必要的成本损耗;二是规则执行能力,GPT-6 Astra在12个经营周期内始终严格遵守交易审核规则,没有产生任何预付款坏账损失。反观Claude Fable5.1,其采购成本随着经营周期推进上涨了27%,且因多次违规向未认证供应商预付货款,坏账损失占总亏损的60%以上,直接拉低了最终收益。
本次测试结果也让行业看到了大模型在实体经营场景的落地潜力。此前AI代理的商业化应用大多集中在客服、内容生成、简单流程自动化等短路径场景,而能跑通长达一年的复杂商业模拟,意味着大模型的长期规划、风险控制、动态决策能力已经跃升到新的台阶。
业内人士指出,接下来这类具备商业决策能力的AI代理,有望率先在小微企业经营辅助、供应链优化、门店智能运营等场景落地,不过目前测试仍在模拟环境中完成,真实世界的突发变量更多,相关技术落地仍需要更多场景验证。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。