
摘要:Google Research于9月24日发布AI视频联合导演研究,基于Gemini与Veo构建统一编排层,由Co-Director、CANVAS、A²RD、VQQA四个智能体框架协同,生成连贯的分钟级长视频,缓解角色与场景漂移。官方自报在GenAD-Bench取得81.4峰值分,论文尚未正式发表。该项目定位为研究工具,并非消费级产品。
9月24日,Google Research 官方博客发布研究文章《Automating coherent long-form video generation》(作者 Yale Song、Yiwen Song),正式介绍其"AI视频联合导演(AI video co-director)"项目。科技媒体 MarkTechPost 于9月27日报道了这一进展。
根据官方说明,这一项目搭建在 Gemini 与 Veo 之上的"编排层(orchestration layer)",采用模型无关(model-agnostic)架构,属于 Google AI 视频生成技术体系的最新研究进展。它把过去各自独立的视频生成环节统一为一个协作系统,以生成连贯的分钟级多镜头视频。
官方指出,现有 AI 视频管线普遍存在四大痛点:语义漂移、级联失败、特征漂移与内容坍缩。这项研究把长视频生成建模为"全局优化 + 世界状态追踪"问题,并设计了四个 agentic 框架:
四个框架协同工作,可缓解视觉漂移与管线错误传播。官方称在评测中"成功生成分钟级视频"。
在评测方面,官方自报该框架在 GenAD-Bench 上取得峰值 81.4 分,并新增 GenAD-Bench、HardContinuityBench、LVBench-C 三个基准。需要指出的是,相关论文尚未正式发表,数据未经同行评审,以上成绩均属于研究自报结果。
在作者看来,这一成绩的价值更多在于验证"多智能体编排"这一技术路径的可行性,而非确立最终的行业标杆。它能否在真实创作场景中稳定复现,仍需等待论文审阅与第三方验证。
官方博客明确,该框架原生继承 SynthID 水印安全机制,为生成内容提供可追溯性,这也延续了 Google 在生成式 AI 内容治理上的一贯做法。
官方强调,该项目被定位为赋能创作者的研究工具,"目标不是取代人类讲故事"。多家媒体在跟进报道中也特别指出,这是一个研究性质的编排系统,并非面向大众的消费级独立产品。
值得关注的是,Google 视频模型产品线近期也有调整:Veo 2.0 已于 2026年6月30日 停用,官方现推荐 Veo 3.1 Preview 及 Gemini Enterprise Agent Platform;Gemini API 目前提供 Gemini Omni Flash 与 Veo 3.1 两类视频生成模型。AI视频联合导演的相关论文将陆续在 COLM 2026、EMNLP 2026 发表,目前处于待发布状态。