在H100上自主优化MLA GPU内核,峰值达到508 TFLOPS;通过自动化后训练,将Qwen3-30B基座的AIME24准确率从53.3%提升至60%——这两则24小时长周期Agent实验,成为阶跃星辰旗舰基座模型Step 5 Preview在2026年9月20日发布时最直观的性能注脚。
从实验到发布:旗舰模型的“计算效率”路线
Step 5 Preview是阶跃星辰继Step 3.5 Flash、Step 3.7 Flash之后推出的第三代旗舰模型。与此前版本相比,这款模型最大的变化在于将技术重心放在“计算效率”上,其设计目标直指AI编程、软件工程、金融分析等需要长时间自主决策的Agentic任务。
据阶跃星辰官方介绍,Step 5 Preview采用稀疏MoE架构,总参数量达600B,每个Token仅激活27B参数,模型共92层Transformer。这种“总参数量大、激活参数小”的设计,使得模型在保持性能上限的同时,大幅降低了推理时的计算开销。
值得关注的是,该模型支持100万Token的超长上下文窗口,并可同时处理文本、图像、视频多种模态输入。针对长上下文场景,阶跃星辰引入了Sparse GQA与Block-wise Token Merging两项优化技术,以控制长序列处理时的成本增长。
定价与Agent成本:1/8的对比优势从何而来
发布当天,Step 5 Preview的API与官方Studio同步开放。定价方面,输入价格为约1.00美元/百万Token,输出约2.70美元/百万Token(人民币计价约20元/百万输出Token),第三方机构Artificial Analysis与Vercel均确认了这一换算价格。
阶跃星辰官方称,Step 5 Preview的单任务成本约为对比旗舰模型的八分之一。Artificial Analysis的实测数据显示,该模型单任务成本为0.71美元,输出速度约为每秒100个Token。在Artificial Analysis的智能指数评测中获得44分,官方表示这一成绩使其进入全球开源模型前三。
评测成绩:从学术基准到长上下文实战
在官方公布的评测数据中,Step 5 Preview在多项基准上表现突出:GPQA Diamond达到93.5%,Terminal-Bench v2.1为85.0%,BrowseComp为88.7%。在AA-LCR长上下文评测中,该模型排名2/171。
这些数据指向一个明确的应用场景:需要长时间连续推理、多步骤交互的复杂任务。无论是最初提到的H100内核优化实验,还是Qwen基座模型的自动化后训练提升,都展示了模型在无人干预条件下自主完成长周期工作的能力。
开源承诺与10月15日节点
需要特别说明的是,尽管发布当天部分外媒将Step 5 Preview称为“开放权重”模型,但事实并非如此。截至发布日,模型的BF16权重并未放出,阶跃星辰仅承诺将于2026年10月15日正式释放权重。
这意味着,当前开发者能够立即使用的是Step 5 Preview的API服务,而真正的开源尚需等待三周。从后续影响来看,10月15日权重能否如期开源,将直接决定这场“计算效率”实验能惠及多大的开发者群体。
可以推断,如果开源承诺兑现,Step 5 Preview将成为全球开源模型生态中一个颇具竞争力的选择——尤其在长周期Agent任务这个依然稀缺的细分赛道上。
参考资料
- 阶跃星辰发布 Step 5 Preview,面向真实世界 Agentic 任务的旗舰基座模型 - OSCHINA - 开源 × AI · 开发者生态社区 - OSCHINA
- 阶跃星辰发布Step5,10月15日将开源模型权重|Token|AI代码生成|成本|官方|索引_手机新浪网 - 新浪财经
- StepFun launches Step 5 Preview with 600B parameters, 1M context, and open weights coming October 15 - Data Studios
- 阶跃星辰发布Step5,10月15日将开源模型权重_新浪科技_新浪网 - 新浪财经
- 德里克文的微博 - 微博
- Step 5 Preview:阶跃星辰 600B MoE 旗舰基座模型 | DataLearner - DataLearner AI
- Step 5 Preview Launches With 600B Parameters, 1M Context and October Open Weights -
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。