2026年9月9日举办的京东全球科技探索者大会(JDD)上,京东探索研究院发布JoyAI-Echo系列两项AI音视频核心进展:升级后的JoyAI-Echo1.5突破10分钟超长音视频生成门槛,同时开源可交互视听世界模型EchoWM。前者依托音视频Memory Bank架构,推理速度最高提升7.5倍,仅需2张H200显卡即可实现480P分辨率下24帧1:1等时生成。
AI音视频生成赛道诞生以来,时长限制与交互性缺失一直是制约其商业化落地的核心痛点——此前主流文生视频模型的有效生成时长普遍停留在3分钟以内,一旦拉长时长就会出现人物形象崩坏、叙事线索断裂等问题,且生成内容均为单向输出,用户无法参与调整。
从需求端来看,影视制作、电商营销、教育科普等领域对10分钟以上的AI生成音视频需求持续攀升,同时游戏、互动内容赛道对可交互的AI生成世界有明确需求,但现有技术迟迟无法满足商用要求。京东此次推出的两项成果,恰好对准了这两个核心痛点。
此次发布的JoyAI-Echo1.5核心创新点是采用了音视频Memory Bank架构,能够在多镜头、长时程生成过程中保持人物形象、声音特征、叙事线索的一致性,首次将稳定生成时长拉到10分钟以上,彻底突破了行业此前的时长天花板。
模型通过长视频后训练将推理速度最高提升7.5倍,硬件门槛大幅降低:仅需2张H200显卡,就能在480P分辨率下实现平均每秒24帧的输出效率,达到1:1等时生成标准,搭配内置的Director Agent模块,还能支持用户自定义调整镜头语言、叙事节奏。
同步开源的可交互视听世界模型EchoWM则是另一大亮点,该模型首次将原生视听生成能力与用户实时控制能力深度融合,打破了此前AI生成内容只能单向观看的限制,用户可以直接进入生成的视听场景中调整视角、触发剧情,实现从“观看内容”到“探索内容”的体验升级。开源后全球开发者都可以基于该模型二次开发,快速搭建不同场景的互动视听应用。
作为兼具技术能力和落地场景的科技企业,京东的AI音视频技术天然具备丰富的商用场景。目前来看,JoyAI-Echo1.5可直接应用于电商商品长短视频生成、品牌营销内容制作、教育科普长视频批量生产等领域,大幅降低内容生产的时间和人力成本。
而EchoWM的应用场景则更加广阔,可用于互动电商直播、开放世界游戏内容生成、虚拟仿真培训系统搭建等多个赛道,随着开源生态的逐步完善,整个AI音视频赛道的技术迭代速度也将进一步加快。
免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。