2026年8月4日,商汤科技正式面向全球开发者社区开源轻量统一多模态模型SenseNova U1.5-Lite-Preview。该模型基于前代SenseNova U1系统性迭代,单一架构融合视觉理解、推理、生成、编辑四大核心能力,仅以8B-MoE参数规模即支持原生4K分辨率输出、真实质感生成与复杂视觉控制,为多模态模型轻量化落地提供了新的技术路径。
在行业普遍通过堆高参数规模实现多模态能力升级的当下,商汤这次推出的开源模型走出了一条完全不同的路线:其参数规模仅为同类4K能力模型的1/4不到,推理算力需求降幅超过60%,直接降低了高规格多模态能力的使用门槛。
当前多模态模型的落地正陷入“能力-成本”的两难困境:要实现4K生成、复杂图像编辑等高阶视觉能力,往往需要30B以上参数的大模型支撑,单卡推理成本居高不下,中小团队甚至普通开发者根本难以负担;而小参数多模态模型大多只支持1080P及以下分辨率,图像质感、指令遵循能力普遍不足,无法满足商用场景需求。
统一多模态架构的出现,原本就是为了打通不同视觉能力的技术栈,降低模型迭代的边际成本,但此前的验证模型参数规模仍然偏高,距离普惠落地还有不小的距离。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录