谷歌研究发布AI视频联合导演,四框架生成连贯长视频

配图

摘要:Google Research于9月24日发布AI视频联合导演研究,基于Gemini与Veo构建统一编排层,由Co-Director、CANVAS、A²RD、VQQA四个智能体框架协同,生成连贯的分钟级长视频,缓解角色与场景漂移。官方自报在GenAD-Bench取得81.4峰值分,论文尚未正式发表。该项目定位为研究工具,并非消费级产品。

9月24日,Google Research 官方博客发布研究文章《Automating coherent long-form video generation》(作者 Yale Song、Yiwen Song),正式介绍其"AI视频联合导演(AI video co-director)"项目。科技媒体 MarkTechPost 于9月27日报道了这一进展。

根据官方说明,这一项目搭建在 Gemini 与 Veo 之上的"编排层(orchestration layer)",采用模型无关(model-agnostic)架构,属于 Google AI 视频生成技术体系的最新研究进展。它把过去各自独立的视频生成环节统一为一个协作系统,以生成连贯的分钟级多镜头视频。

官方指出,现有 AI 视频管线普遍存在四大痛点:语义漂移、级联失败、特征漂移与内容坍缩。这项研究把长视频生成建模为"全局优化 + 世界状态追踪"问题,并设计了四个 agentic 框架:

  • Co-Director:负责创意全局搜索,采用多臂老虎机策略,将提交至 COLM 2026;
  • CANVAS:通过视觉记忆保持角色、场景与道具的连续性,将提交至 EMNLP 2026;
  • A²RD:负责分段生成,并结合多模态记忆;
  • VQQA:以视觉问答闭环修正提示词,实现质量反馈。

四个框架协同工作,可缓解视觉漂移与管线错误传播。官方称在评测中"成功生成分钟级视频"。

在评测方面,官方自报该框架在 GenAD-Bench 上取得峰值 81.4 分,并新增 GenAD-Bench、HardContinuityBench、LVBench-C 三个基准。需要指出的是,相关论文尚未正式发表,数据未经同行评审,以上成绩均属于研究自报结果。

在作者看来,这一成绩的价值更多在于验证"多智能体编排"这一技术路径的可行性,而非确立最终的行业标杆。它能否在真实创作场景中稳定复现,仍需等待论文审阅与第三方验证。

官方博客明确,该框架原生继承 SynthID 水印安全机制,为生成内容提供可追溯性,这也延续了 Google 在生成式 AI 内容治理上的一贯做法。

官方强调,该项目被定位为赋能创作者的研究工具,"目标不是取代人类讲故事"。多家媒体在跟进报道中也特别指出,这是一个研究性质的编排系统,并非面向大众的消费级独立产品。

值得关注的是,Google 视频模型产品线近期也有调整:Veo 2.0 已于 2026年6月30日 停用,官方现推荐 Veo 3.1 Preview 及 Gemini Enterprise Agent Platform;Gemini API 目前提供 Gemini Omni Flash 与 Veo 3.1 两类视频生成模型。AI视频联合导演的相关论文将陆续在 COLM 2026、EMNLP 2026 发表,目前处于待发布状态。

参考资料

  1. Veo 2.0 | Gemini API | Google AI for Developers - Google AI
  2. Automating coherent long-form video generation - Google Research
  3. Veo 2.0 | Gemini API | Google AI for Developers - Google AI
  4. Pembuatan video di Gemini API | Google AI for Developers - Google AI
  5. Google Reframes Long-Form AI Video as an Orchestration Problem | Siften -
  6. Automating coherent long-form video generation - Google Research
  7. 在 Gemini API 中使用 Veo 3. 1 生成影片 - Google
  8. Google Research dévoile un système multi-agent pour la vidéo longue -
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。