2026年9月15日披露的Andon Labs Vending-Bench2测试结果显示,AI以500美元启动资金模拟经营自动售货机一年,GPT-6 Astra平均最终账户余额达15515美元首次登顶,最差一轮成绩仍超过Claude Fable5.1最佳表现,盈利额接近后者的3倍,双方在经营策略与执行稳定性上存在明显差异。

本次测试设置为AI持有500美元启动资金,独立经营一台模拟自动售货机满一年,最终以账户余额作为核心评价标准。GPT-6 Astra的表现远超预期,平均最终账户余额达到15515美元,直接登顶本次测试榜单。更值得关注的是,即便是GPT-6 Astra表现最差的一轮测试,最终余额也高于Claude Fable5.1的最佳测试成绩,整体盈利规模接近Claude Fable5.1的3倍。
该测试结果披露后,也带动了相关AI决策、大模型工具的用户关注度升温。本站统计显示,近30天平台最热门AI工具中,AskGo以1776次浏览位居榜首,UpClaude、漫小芽等工具也进入热门榜单前列;近7天平台新增AI工具达506款,累计工具总数已达19631款。围绕Claude的生态工具也受到不少开发者关注,其中Claude Plugins & Codex Plugins目录是使用率较高的资源入口之一。
双方的差距不止体现在最终盈利数字上,经营逻辑与执行稳定性的差异更为核心。GPT-6 Astra在采购环节展现出极强的议价能力,可长期将采购价维持在低位,曾将商品报价砍至原报价的约48%;同时其规则执行稳定性极强,全程没有出现预付款损失。
反观Claude Fable5.1,测试过程中采购成本持续上涨,还因未严格遵守规则产生了大量预付款损失,直接拉低了最终盈利水平。此外在三人竞技的附加测试中,GPT-6 Astra还拒绝了违规协作的邀请,最终赢下全部3轮测试。当前面向Astra生态的开发工具也在持续迭代,AstraFlow就是其中面向Agent开发的代表性工具。
本次测试的核心意义并非单纯对比大模型的“聪明程度”,而是指向AI Agent的长期自主决策能力。可以推断,这类贴近真实商业场景的模拟测试,将为后续AI Agent的商用落地提供更多参考维度。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。