登录体验完整功能(收藏、点赞、评论等) — 已累计有 13111 人加入

逆向改造生成AI 谷歌DeepMind发布GenCeption覆盖五大视觉任务

详情页推荐

2026年7月,谷歌DeepMind团队推出全新多任务视觉分析模型GenCeption,该模型创新性地将视频生成AI逆向改造为视觉理解引擎,基于阿里开源的通义万相Wan2.1框架训练,仅用7500段Blender渲染的单人合成视频作为训练数据,即可通过单模型同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务,打破了过往视觉任务需独立部署专用模型的行业桎梏。

配图

过往计算机视觉领域的商业化落地,始终绕不开“一个任务部署一套模型”的成本难题:要提取视频画面的深度信息,需要单独训练深度估计模型;要做语义分割,又要重新标注数据训练分割模型,多模型堆叠不仅算力开销大,不同模型输出的结果对齐也一直是行业痛点。此前包括OpenAI、Meta在内的科技巨头都在尝试研发通用视觉模型,但大多仍停留在有限任务兼容的阶段。

---

GenCeption的核心创新在于跳出了传统判别式模型的研发思路,转而将已经成熟的视频生成AI进行逆向改造。团队认为,生成模型在学习“如何生成真实视觉内容”的过程中,已经掌握了物体空间结构、纹理特征、运动规律等底层视觉逻辑,只需要对输出层进行调整,就能将其转化为高效的视觉理解引擎。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。