曦望首展启望S3,预测Agent Token消耗将超人类

核心摘要

2026年9月23日至27日,第五届数贸会在杭州举行。曦望Sunrise首展原生推理GPU启望S3原型及256卡超节点。徐冰称,Agent单条指令Token消耗已达人类百倍至千倍,预计3至5年内数字与物理世界Agent总消耗将超全人类。厂商称S3较S2推理性能提升约5倍,单位Token成本降约90%。

展会与产品:S3原型首次公开亮相

第五届全球数字贸易博览会于2026年9月23日至27日在杭州举办,主题为“在数贸会遇见AI未来”,近2000家企业参展。展会期间,曦望Sunrise展示了启望S3原型。校对信息显示,这是该原型首次公开展示。

曦望Sunrise系商汤大芯片部门2024年底分拆独立、总部位于杭州的推理GPU企业,徐冰为董事长,其身份为商汤联合创始人。启望S3是专为大模型和Agent打造的原生推理GPU。搭载S3的256卡超节点同步亮相,官方名称为“寰望SC3-256超节点”,媒体称其为“推理巨兽”。

Token需求判断:从百倍千倍到超过全人类

在“数字贸易与人工智能对话”中,徐冰表示,同等任务下,Agent完成一条人类指令所消耗的Token数量已达人类百倍乃至千倍;具身智能作为物理世界的Agent,将7×24小时持续消耗Token。他预计,未来3至5年内,数字与物理世界的Agent对Token消耗总量将超过全人类。

9月28日,新浪科技、潮新闻、钱江晚报等发布后续报道。徐冰在报道中进一步提出“Token经济迎来中国机会”“为新的数字生命造房子”等观点,并指出算力供给呈线性增长、存在刚性约束。

技术路径:精简训练模块,聚焦推理

据曦望方面介绍,启望S3不追求训推一体,而是精简训练模块,将节省的晶体管与功耗预算全部投入推理。官方称,该芯片国内率先采用LPDDR6内存,同时兼容LPDDR5X,并原生支持FP4低精度。

曦望实验室数据显示,相比上一代S2,启望S3推理性能提升约5倍,单位Token推理成本下降约90%。曦望现有产品线包括S1、S2、S3,其中S2已批量供货,S4、S5处于预研阶段。

针对256卡超节点,曦望官网标注“吞吐率提升20倍以上”,并标注数据来源于曦望实验室。该指标目前为厂商自述,缺乏第三方验证。

融资背景:2026年完成两轮战略融资

曦望Sunrise于2026年先后完成10亿+及20亿元战略融资,投后估值约200亿元,投资方包括人保股权、建信股权、九安医疗等,累计融资近60亿元。

主编观察

作者观点:从曦望本次发布看,Agent的Token消耗凸显了推理成本与算力供给的重要性。对使用W-Agent、CogniAgent搭建智能体,或通过AI Agents Listing跟踪应用的团队而言,单位Token成本与集群供给会成为更具体的工程约束;VibeToken、Agent云Token工场等Token相关工具对应的调用与生产环节,最终也要落在底层推理资源上。上述判断仅针对本次发布,不代表行业趋势。

参考资料

  1. 曦望董事长徐冰:为新数字生命造房子,Token经济迎来中国机会_手机新浪网 - 新浪财经
  2. 曦望董事长徐冰:为新数字生命造房子,Token经济迎来机会 - 潮新闻
  3. 第五届全球数字贸易博览会启幕-全球数字贸易博览会 - 全球数字贸易博览会
  4. 曦望董事长徐冰:为新数字生命造房子,Token经济迎来中国机会 - 手机搜狐网
  5. 关于曦望 Sunrise | 专注 AI 推理算力的中国芯片与系统公司 -
  6. 曦望Sunrise(浙江曦望智能)完整信息+九安投资细节公司背景曦望Sunris_财富号_东方财富网 - 财富号
  7. 启望 S3 大模型与智能体推理 GPU -
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。