9月16日,B站正式上线“AI无限竞技场”大模型测评平台,将10位UP主对上百个大模型的真实场景实测汇入同一擂台。首轮排名中,GPT-6 Astra拿下榜首并获登顶次数冠军,GLM-5.3紧随其后;前五名中国产大模型占据三席,与海外模型贴身竞争。该榜单不设固定测评维度,按UP主命题实测统计拿榜首次数,目前已累计获得1398万+次观看,收录30多个测评主题。
“AI无限竞技场”的玩法与传统跑分榜有本质区别。它没有设置固定的测评科目和评分权重,而是把不同分区UP主对上百个模型的真实场景实测汇集成一个持续更新的榜单。来自代码、推理、协作、知识等方向的创作者,用真实工作流、专业应用甚至趣味脑洞自行命题,让模型在同一道题面前直接PK。
排名规则也很有意思:榜单不计算平均分或综合分,而是按各模型在单个UP主测评中拿到“榜首”的次数来排序。这意味着,模型不需要在所有科目上均衡发展,只要在足够多的专项测评中做到最好,就能爬上榜首。反过来,某一项能力极度突出、但场景覆盖面窄的模型,也有机会获得靠前的位置。
目前参战阵营已覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流产品,排名实时刷新。按照B站官方数据,该榜单收录的测评主题超过30个,参战模型上百个,累计观看量达到1398万以上。
首轮排行榜上,GPT-6 Astra拿下榜首,同时获得“登顶次数冠军”——意思是它在10位UP主的单场测评中,拿下榜首的次数最多。GLM-5.3次之,Claude Fable 5.1进入前三。更值得留意的是前五名中出现了三款国产大模型,与海外模型形成贴身肉搏的态势。
从榜单形态来看,这些模型并非按统一标准打分排序,而是各凭本事在不同UP主的考题里争夺第一。有的模型在代码场景中碾压同类,有的则更擅长知识问答类任务。B站方面强调,该榜单并非学术意义上的Benchmark,而是把测评话语权交给创作者和真实用户,突出模型在实际应用中的表现差异。
榜单上线后迅速引发讨论,也出现了不同声音。“榜首次数第一”是否等于“综合能力第一”,是争议的焦点。
有媒体梳理发现,GPT-6 Astra在不同UP主的测试中表现差异相当大:代码修复类测评中它几乎断层领先,但在游戏开发、生活决策等场景中也会出现明显失误,甚至翻车。同一个模型,在不同创作者手里得出的结论可能截然相反——这正是真人实测模式的特点:模型表现高度依赖任务场景和出题人的主观倾向。
另一个例子来自UP主“王郁的小站”发起的大模型高考测试。这项测试集结了78个模型,GPT-6 Astra拿下691分,总排名仅第14位;不过它的智力评分拿到断档第一,同时,它以50美元/百万token的价格成为全榜最贵的参测模型。分数和成本的巨大反差,进一步放大了“榜首”含金量的讨论。
分析认为,这类榜单的价值在于提供了一种更接近真实使用的观察视角,但“榜首次数领先”反映的是创作者命题下的表现频次,不等同于模型综合实力。榜单数据也印证了这一点:同一款模型在不同场景中可能时而“封神”、时而“翻车”,用户参考时仍需结合自身需求判断。
在AI无限竞技场之前,B站已是国内AI内容消费的重要阵地。官方披露的数据显示,平台AI内容消费时长同比增长72%,月均观看用户超过1.9亿。海量创作者和真实使用场景,为这种“真人实测”式测评提供了天然土壤。
从行业角度看,这可以被视为大模型评测路径的一次转向:从标准化跑分走向创作者主导的场景化实测。相比MMLU、HumanEval等传统基准测试,真人实测更能反映模型在真实任务中的“体感”,但同时也引入了随机性和主观性。有分析指出,真人实测体现的是“真实感”,与安全性、合规性、成本等采购决策变量仍存在距离。对于普通用户来说,这份榜单提供了一个新入口;而对于行业观察者来说,它的后续排名变化同样值得持续关注。