B站上线“AI无限竞技场”:GPT-6 Astra登顶榜首,前五国产大模型占三席

配图
2026年9月20日,B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布首轮模型排行榜。首轮结果中,OpenAI于9月3日发布的GPT-6 Astra在10个UP主测评中拿下榜首,以“榜首次数冠军”身份压过智谱8月14日推出的GLM-5.3;前五名中,国产大模型占据三席。榜单容纳DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型,排名实时更新。

UP主自主命题,用真实工作流替代传统跑分

与常见的厂商跑分榜不同,“AI无限竞技场”不设固定命题,也不限定测评维度。来自各分区UP主以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中直观呈现各模型的实际表现差异。据B站介绍,该榜单由各领域UP主对上百个大模型进行真实场景实测,测评主题覆盖代码、推理、协作、知识等多个方向。 分析认为,这种以真实工作流为尺度的社区评测,提供了一种有别于传统跑分体系的用户视角参考。模型能力不再只是抽象分数,而是落到具体任务中的实际可用性——这恰好是B站UP主测评区别于实验室基准测试的核心价值。

GPT-6 Astra领跑,国产模型多点开花

首轮排名中,OpenAI最新模型GPT-6 Astra表现抢眼。该模型发布于2026年9月3日,定位为OpenAI“最有能力”的智能体模型,主打编码、研究、计算机使用及多步复杂任务,目前尚未全面开放。在10个UP主测评中,GPT-6 Astra拿下榜首次数冠军,击败了智谱2026年8月14日发布的新一代基座模型GLM-5.3。 GLM-5.3同样不容小觑。该模型据称编程能力较前代GLM-5.2提升50%,在公开基准上达到开源SOTA水平。值得关注的是,前五名中,国产大模型占据三席,展现出国产模型在多场景实测中的整体竞争力。 榜单覆盖范围相当广泛,涵盖了DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型。从上百个大模型的实际表现来看,不同模型在不同领域各有所长,单一维度的“冠军”并不能完全代表综合实力。

AI内容生态爆发,榜单落地有迹可循

“AI无限竞技场”的推出,与B站AI内容生态的快速增长密切相关。数据显示,B站AI知识内容消费时长同比增加72%,月均观看AI内容的用户规模已超过1.9亿。庞大的AI内容消费群体,为基于UP主实测的评测体系提供了天然的土壤。 从上线时间来看,有媒体报道称该榜单于9月16日正式上线,也有媒体在9月20日报道其“宣布上线”;截至9月21日,排名仍处于实时更新状态,并持续面向全站UP主开放报名。另有UP主早前已对GPT-6 Astra进行过实测,结果显示该模型“智力评分断档第一但成本全榜最贵”——这一细节也从侧面反映出,模型能力的领先与使用成本之间,仍然存在需要用户权衡的现实张力。 对于普通用户而言,与其围观抽象的参数对比,不如直接看看UP主们在真实任务中的上手体验。“AI无限竞技场”给出的,正是这样一个更接地气的参考答案。

参考资料

  1. B站上线“AI 无限竞技场”LLM 测评榜:号称“全球百大模型同场竞技”、GPT-6 现居榜首_新浪科技_新浪网 - 新浪财经
  2. - 新浪财经
  3. 快科技官方的微博 - 微博
  4. B站上线“AI无限竞技场”:号称“全球百大模型同场竞技”、GPT-6现居榜首|it之家|测评|豆包|主题|排行榜_新浪新闻 - 手机新浪网
  5. 科技阿铭的微博 - 微博
  6. GPT-6 Astra 智力第一但贵得离谱;大模型高考系列第39期_哔哩哔哩_bilibili - 哔哩哔哩
  7. B站 Launches AI Infinite Arena: Hundreds of Models Compete, GPT-6 Astra Ranks First for Now - AIBase
  8. B站推出AI无限竞技场,国产大模型表现亮眼_测试_测评_用户 - 手机搜狐网
  9. 发布说明 | OpenAI | OpenAI - OpenAI
  10. 新品发布 - 智谱AI开放文档 - 智谱AI
  11. B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首|b站ai|大模型|无限竞技场|测评_手机网易网 - 网易
  12. OpenAI 研究 | 发布 | OpenAI - OpenAI
  13. 智谱发布新一代基座模型GLM-5.3 - 中国科技网
  14. B站推出AI无限竞技场测评榜,GPT-6Astra夺冠引关注 |#游戏资讯# #AI测评# #B站动态#_模型_内容_应用 - 手机搜狐网
  15. B站上线AI无限竞技场测评榜:GPT-6现居榜首 - 搜狐
  16. B站上线“AI 无限竞技场”LLM 测评榜:号称“全球百大模型同场竞技”、GPT-6 现居榜首 - IT之家 - IT之家
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。