王湛谈Token经济学:AI普惠的关键在推理成本

2026年9月23日,2026网易未来大会在杭州国际会议中心洲际酒店举行。本届大会以“碳硅相逢,万象启元”为主题,由网易公司主办,杭州市商务局、杭州市经济和信息化局(杭州市数字经济局)、杭州高新技术产业开发区管委会联合指导,五位院士领衔,来自学界、产业界和投资界的嘉宾齐聚一堂。

当多数演讲聚焦模型能力、参数规模与应用想象时,曦望Sunrise联席CEO王湛带来题为《Token经济学:AI时代的成本革命》的主题演讲,把问题拉回到一张更现实的产业账本上:AI能不能真正普及,不只取决于模型是否足够聪明,也取决于每一次调用背后的Token成本能否降下来。

从模型能力到Token成本:一次视角转换

王湛在演讲中提出一个核心判断:Token成本是AI普惠的最后一公里。相比继续追逐参数规模与榜单成绩,他更关注每一次推理调用背后的单位经济性——当AI从展示型工具转向生产型基础设施,Token的边际成本将直接决定应用落地的速度与广度。

这一观点并非孤例。事实上,随着大模型从训练主导转向推理主导,算力消耗的重心已经发生迁移。王湛引用国家数据局的数据进一步指出:日均Token调用量从2024年初的1000亿增至2026年3月的140万亿,较2024年初增长1000多倍。这一增速远超摩尔定律的传统节奏,意味着AI的真实使用强度正在以指数级曲线攀升。

Agent正在改写流量结构

在王湛看来,推动Token需求爆发的核心变量不是人类用户的主动输入,而是智能体(Agent)的自主调用。根据OpenRouter的数据,截至2026年8月10日,Agent类Token用量约7.3万亿,人类直接调用约1.4万亿,Agent用量已达到人类的5倍以上。

这一结构性变化意味着什么?王湛判断,当Agent从“辅助工具”升级为“执行主体”,AI调用将从偶发行为变为持续进程,推理算力的需求将不再线性增长,而是出现爆发式跃迁。他由此提出一个需要警惕的结论:推理算力的结构性缺口可能延续至2028年。

在这一背景下,Token成本的管理不再只是技术优化问题,而是产业能否规模化的前提。围绕成本控制,市场已出现一系列尝试:例如辅助开发者优化调用策略的TokenDance,以及面向Agent场景提供批量Token调度方案的Agent云Token工场,均试图从工具链层面缓解成本压力。此外,VibeToken等第三方平台也在帮助开发者在模型选择与Token消耗之间寻找平衡。

启望S3:用LPDDR打破HBM的高墙

面对推理成本的挑战,王湛给出的技术路线是:以推理专用GPU替代通用GPU,用LPDDR内存替代HBM高带宽内存。他将这一方案概括为“把每一颗Token的成本打下来”——通过硬件架构的重新设计,在不牺牲推理效率的前提下,大幅降低单位Token的算力成本。

这一思路的载体是启望S3。据数贸会官网信息,启望S3是国内首款挂载LPDDR6(兼容LPDDR5X)的GPU,其原型已在第五届全球数字贸易博览会上首次亮相。王湛在演讲中同时表示,该产品性能为上一代的5倍,单Token成本降低90%,算子利用率达99%、效率达98%。需要说明的是,上述性能与成本数据目前属于演讲者单方表述,尚未获得第三方独立佐证。

场景数据与产业落地:一笔待验证的账

为说明Token消耗的规模,王湛在演讲中引用了多组具体场景数据:AI编程约消耗417万Token/任务,可灵V3生成一段15秒720P视频需135万Token、4K版本需450万Token,办公场景单任务则在180万至300万Token之间。这些数据直观地描绘了不同任务对Token资源的吞噬能力,但目前同样未检索到独立第三方来源,属于演讲者引用数据,存疑待核。

值得关注的是,这些场景数据所指向的共同问题是:若Token成本不能快速下降,AI在编程、视频生成、办公等高频场景中的渗透将受到明确制约。这恰好呼应了王湛的核心主张——推理成本不是技术细节,而是决定AI普惠进程的关键变量。

大会生态:从演讲台到数贸会展厅

值得一提的是,王湛的演讲并非孤立事件。2026网易未来大会系第五届全球数字贸易博览会同期活动,两者在杭州形成联动。大会期间,曦望Sunrise在数贸会展区(2号馆2-T015)同步展出了启望S3原型,完成了从“讲概念”到“看实物”的闭环。

与此同时,大会压轴揭晓了“2026网易科技未来大奖”年度系列奖项,涵盖AI创新先锋人物、具身智能先锋企业、行业大模型标杆奖等多个维度。可以看到,从算力芯片到终端应用,从基础模型到具身智能,AI产业的成本革命正在各条战线上同步推进。

作者观点:成本叙事与技术路线的双重变量

作为科技媒体观察者,笔者认为王湛此次演讲的最大价值不在于给出具体数字,而在于将“Token成本”从技术参数提升为产业议题。当行业普遍关注模型能力的上限时,他提醒市场关注推理成本的底线——这一定价逻辑的转换,可能比任何单一产品的发布都更具长期意义。

当然,演讲中部分数据仍有待验证,LPDDR替代HBM的技术路线也需经过大规模商用检验。但至少,在“碳硅相逢”的时代命题下,关于推理成本的讨论已经不再是小众的技术话题,而是关乎AI能否真正走进真实世界的经济学议题。

参考资料

  1. 活动预告 | 第五届全球数字贸易博览会同期活动“2026网易未来大会”报名正式开启-第五届全球数字贸易博览会-热点专题-杭州网 - 杭州网
  2. 倒计时3天!2026网易未来大会议程揭晓:五位院士领衔,产业先锋、00后创业者作答“碳硅相逢”的时代之问|中国工程院|中国工程院院士|创业者|工程院|院士_手机网易网 - 网易
  3. 曦望王湛:Token成本是AI普惠的最后一公里|agent|token|人工智能|智能体|王湛|调用_手机网易网 - 网易
  4. 数贸会嘉宾说 | 浙江曦望智能科技股份有限公司联席CEO王湛-全球数字贸易博览会 - 全球数字贸易博览会
  5. 曦望王湛:Token成本是AI普惠的最后一公里 - 网易新闻客户端
  6. 新闻1+1丨日均词元调用量超140万亿,说明什么?-国家数据局 - 国家数据局
  7. 曦望王湛:Token成本是AI普惠的最后一公里|调用|人工智能|token|agent|智能体_网易科技 - 手机网易网
  8. 曦望王湛:Token成本是AI普惠的最后一公里|agent|token|人工智能|智能体|王湛|调用_手机网易网 - 网易
  9. 2026 网易未来大会 - 网易科技
  10. AI开始替人类调用AI!token用量已是人类5.2倍财经头条新浪财经 - 新浪财经
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。