NCP预训练新范式:8.9B隐空间模型用一半Token追平对手

上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队,近期提出了一种新的预训练任务——“下一个概念预测”(NCP),并推出8.9B参数规模的离散隐空间基座模型NCP-ArchPreview。该模型的完整技术报告以《NCP-ArchPreview Technical Report》为题,于2026年9月9日提交至arXiv(编号2609.10715)。基于5.73T Dolma-3语料,NCP-ArchPreview只消耗了51.3%的Token预算就追平了OLMo-3-7B的最终预训练Loss,等效收敛速度达到1.95倍,计算帕累托效率提升1.74倍。在下游任务中,其综合宏观平均分领先OLMo-3-7B达2.45分,GSM8K数学推理成绩从39.27分提升至45.26分,涨幅接近6分。

从“逐Token”到“下一个概念”,一次预训练范式的转向

大模型预训练长期以来围绕“逐Token预测”展开,但NCP-ArchPreview走出了一条不同路径。该模型的整体架构是一条三段式隐空间概念处理流水线,由Token Encoder、Concept Module与Token Decoder组成。它利用乘积量化(PQ)搭建起128^32规模的离散概念空间,每4个Token压缩为1个概念,配合因果防泄漏反馈机制,让模型在隐空间中完成概念级预测,而非机械地滚动预测每一个词元。
这一设计明显借鉴了视觉领域Latent Diffusion、JEPA等思路。报道指出,该工作被视作“迄今最大规模的隐空间语言模型演示”。从方法论上讲,它把语言模型的学习层级从词汇表面拉高到概念抽象层面,直接改变了预训练阶段的学习目标。

一组刷新效率账本的数据

NCP-ArchPreview交出的成绩单,在预训练效率维度上颇具冲击力。基于5.73T的Dolma-3语料,模型仅用51.3%的Token预算就追平了OLMo-3-7B的最终预训练Loss;等效收敛速度提升1.95倍,计算帕累托效率系统性提升1.74倍。到了下游任务环节,该模型综合宏观平均分领先OLMo-3-7B达2.45分,其中GSM8K数学推理成绩从39.27分跃升至45.26分,提升近6分。
用更直白的方式表述:别人烧完一整箱算力才够到的位置,它半箱油就到了。

社区热度与全链路开源

论文挂出后迅速引发社区关注。9月9日提交arXiv后,NCP-ArchPreview登顶HuggingFace Daily Papers榜首,HuggingPapers官方及多位海外博主对工作进行了转发,科技评论人VISION IA在X上评价称,“可能是未来AI的第一块基石”。
团队同步开放了覆盖全训练阶段的资源:在HuggingFace上发布的ArchSpace集合包含100K至1.2M步的阶段性Checkpoint、评测框架(GitHub: LUMIA-Group/ncp_olmo_eval)以及投机草稿模型权重。模型从预训练到评估的完整链路均可复现,这对后续研究者而言降低了验证成本。

Beyond预训练:17M参数微调与推测解码加分项

NCP架构带来的收益并不止于预训练阶段。配套实验显示,仅微调17M隐空间参数即可超越LoRA效果,且未出现灾难性遗忘;将概念表征注入DFlash2草稿模型后,推测解码的平均接受长度整体提升4.17%,其中代码任务提升7.59%。这表明,隐空间概念建模在推理加速和下游适配层面同样具有撬动作用。
此外,团队还构建了1亿Token专家轨迹的轻量代理筛选机制(100M Proxy),R²最高达到0.999,用于退火配方筛选。这一细节说明,NCP的推进不只是模型架构的变化,训练策略的自动化筛选也在同步跟进。

隐空间语言模型的下一步

从更宏观的视角看,NCP-ArchPreview验证了一条不推翻Transformer、却改变模型“学什么”的技术路线。可以推断,如果隐空间语言模型继续沿此路径推进,大模型在Token效率、推理成本与下游微调机制上的工程范式都有机会被重新检验。至于它能否真正成为评论者口中的“第一块基石”,仍需要更多参数规模与业务场景来验证。但至少,这场由上海AI Lab与上交大LUMIA Lab共同发起的技术实验,已经把大模型训练的讨论,从粗暴堆量拉回到概念理解层面。

参考资料

  1. 机器之心 - 财报,业绩电话会,研报,新闻 - Reportify - Reportify
  2. Shanghai AI Lab & Shanghai Jiao Tong University Propose a Novel Pre-training Task and Open-Source the First 8.9B Latent Space Large Model NCP-ArchPreview - AI - C114Pro - C114Pro
  3. NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction | alphaXiv - alphaXiv
  4. 预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview - 网易新闻客户端
  5. [2609.10715v1] NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction - arXiv
  6. NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction · 有道有据 - 有道学术
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。