
2026年7月,Google DeepMind发布全新通用视觉模型GenCeption,该模型基于阿里巴巴开源预训练视频生成模型Wan2.1开发,可同时覆盖深度估计、图像分割、3D姿态估计等多类经典计算机视觉任务,多项基准测试性能接近或超越Segment Anything、Depth Anything等头部专用模型,训练数据需求远低于传统方案,有望重构现有CV领域技术路线。

在近期公开的12项主流CV基准测试中,GenCeption在8项任务上取得了与当前最优专用模型误差小于2%的成绩,其中3D人体姿态估计任务的精度甚至超出行业主流专用方案3.7个百分点,而它完成全品类任务训练所用的标注数据量,仅为专用模型总训练数据量的11%。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录