商汤联合南洋理工发布NEO-unify:重构多模态,砍掉所有中间编码器

2026年3月7日,商汤科技联合南洋理工大学发布全新多模态模型架构NEO-unify,这一成果彻底摒弃行业长期依赖的视觉编码器(VE)与变分自编码器(VAE),通过混合变换器(MoT)架构实现原生端到端的视觉语言融合,在2B参数规模下性能远超传统多模态范式,为多模态大模型研发带来颠覆性重构方向。

长期以来,多模态大模型的研发始终被“组件拼凑”的范式束缚——视觉编码器(VE)负责将像素转换为标准化特征,变分自编码器(VAE)处理生成任务的中间表征,这些中间环节不仅不可避免地损耗原始信息,更让模型陷入预训练先验固化、参数规模边际效益递减的双重瓶颈。直到NEO-unify的出现,这一延续多年的研发逻辑被彻底推翻。

在商汤科技与南洋理工大学的联合研发中,NEO-unify最具颠覆性的设计,就是彻底砍掉了所有中间编码器——包括行业依赖已久的VE和VAE。不同于传统多模态模型通过“视觉表征转换-语言对齐-生成解码”的多链路流程,NEO-unify直接以近乎无损的像素和文字作为原生输入,回归AI建模的第一性原理,彻底绕过了视觉表征标准之争带来的技术桎梏。

支撑这一设计的核心是混合变换器(MoT)架构。通过在同一个模型体系内融合视觉与语言的处理逻辑,MoT不仅实现了对视觉内容的深度理解,还打通了“理解-生成”的双向能力:既可以精准完成图文检索、视觉问答等感知任务,也能直接生成高保真的图文内容,真正实现了多模态能力的原生统一。

研发团队透露,NEO-unify在仅2B参数规模下,性能就远超传统多模态范式。这一结果打破了“性能依赖参数规模扩张”的行业惯性——传统多模态模型往往需要更大参数体量才能弥补中间编码器带来的信息损耗,而NEO-unify凭借无编码器设计,在保留高保真细节恢复能力的同时,还显著提升了数据与算力的利用效率。

具体来看,NEO-unify无需依赖预训练的视觉编码器进行特征转换,大幅降低了数据预处理的成本;同时端到端的直接建模方式,让每单位算力都能直接作用于核心任务,避免了传统架构中中间环节的算力浪费。

NEO-unify的发布,标志着多模态大模型研发正式进入“重构时代”。此前,行业的主流思路是在现有单模态模型基础上,通过编码器等中间组件实现跨模态融合,本质上是“加法式”的技术迭代;而NEO-unify则从底层架构出发,重新定义了多模态建模的核心逻辑。

这一转变将为下游应用带来深远影响:无论是智能驾驶中的多传感器融合、生成式AI中的高保真内容创作,还是企业级AI系统的效率优化,NEO-unify的原生统一架构都能大幅降低开发成本、提升任务精度,为多模态技术的落地打开新的空间。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。