2026年7月,谷歌DeepMind团队推出全新多任务视觉分析模型GenCeption,该模型创新性地将视频生成AI逆向改造为视觉理解引擎,基于阿里开源的通义万相Wan2.1框架训练,仅用7500段Blender渲染的单人合成视频作为训练数据,即可通过单模型同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务,打破了过往视觉任务需独立部署专用模型的行业桎梏。

过往计算机视觉领域的商业化落地,始终绕不开“一个任务部署一套模型”的成本难题:要提取视频画面的深度信息,需要单独训练深度估计模型;要做语义分割,又要重新标注数据训练分割模型,多模型堆叠不仅算力开销大,不同模型输出的结果对齐也一直是行业痛点。此前包括OpenAI、Meta在内的科技巨头都在尝试研发通用视觉模型,但大多仍停留在有限任务兼容的阶段。
---
GenCeption的核心创新在于跳出了传统判别式模型的研发思路,转而将已经成熟的视频生成AI进行逆向改造。团队认为,生成模型在学习“如何生成真实视觉内容”的过程中,已经掌握了物体空间结构、纹理特征、运动规律等底层视觉逻辑,只需要对输出层进行调整,就能将其转化为高效的视觉理解引擎。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录