2026年9月23日至27日,第五届数贸会在杭州举行。曦望Sunrise首展原生推理GPU启望S3原型及256卡超节点。徐冰称,Agent单条指令Token消耗已达人类百倍至千倍,预计3至5年内数字与物理世界Agent总消耗将超全人类。厂商称S3较S2推理性能提升约5倍,单位Token成本降约90%。
第五届全球数字贸易博览会于2026年9月23日至27日在杭州举办,主题为“在数贸会遇见AI未来”,近2000家企业参展。展会期间,曦望Sunrise展示了启望S3原型。校对信息显示,这是该原型首次公开展示。
曦望Sunrise系商汤大芯片部门2024年底分拆独立、总部位于杭州的推理GPU企业,徐冰为董事长,其身份为商汤联合创始人。启望S3是专为大模型和Agent打造的原生推理GPU。搭载S3的256卡超节点同步亮相,官方名称为“寰望SC3-256超节点”,媒体称其为“推理巨兽”。
在“数字贸易与人工智能对话”中,徐冰表示,同等任务下,Agent完成一条人类指令所消耗的Token数量已达人类百倍乃至千倍;具身智能作为物理世界的Agent,将7×24小时持续消耗Token。他预计,未来3至5年内,数字与物理世界的Agent对Token消耗总量将超过全人类。
9月28日,新浪科技、潮新闻、钱江晚报等发布后续报道。徐冰在报道中进一步提出“Token经济迎来中国机会”“为新的数字生命造房子”等观点,并指出算力供给呈线性增长、存在刚性约束。
据曦望方面介绍,启望S3不追求训推一体,而是精简训练模块,将节省的晶体管与功耗预算全部投入推理。官方称,该芯片国内率先采用LPDDR6内存,同时兼容LPDDR5X,并原生支持FP4低精度。
曦望实验室数据显示,相比上一代S2,启望S3推理性能提升约5倍,单位Token推理成本下降约90%。曦望现有产品线包括S1、S2、S3,其中S2已批量供货,S4、S5处于预研阶段。
针对256卡超节点,曦望官网标注“吞吐率提升20倍以上”,并标注数据来源于曦望实验室。该指标目前为厂商自述,缺乏第三方验证。
曦望Sunrise于2026年先后完成10亿+及20亿元战略融资,投后估值约200亿元,投资方包括人保股权、建信股权、九安医疗等,累计融资近60亿元。
作者观点:从曦望本次发布看,Agent的Token消耗凸显了推理成本与算力供给的重要性。对使用W-Agent、CogniAgent搭建智能体,或通过AI Agents Listing跟踪应用的团队而言,单位Token成本与集群供给会成为更具体的工程约束;VibeToken、Agent云Token工场等Token相关工具对应的调用与生产环节,最终也要落在底层推理资源上。上述判断仅针对本次发布,不代表行业趋势。