德国AI初创黑森林实验室于2026年7月23日正式推出多模态基础模型Flux3,该模型基于自研Self-Flow架构打造,是全球首款支持原生音频生成的多模态模型,可一次性输出20秒音视频同步片段,在720p分辨率生成测试中对Luma Ray3.2胜率达93%、对Runway Gen-4.5胜率达77%,标志着生成式音视频技术落地进入全新阶段。
很长一段时间里,生成式视频领域始终面临两大痛点:一是音画同步需要后期二次加工,效率低下;二是可生成的高清视频时长普遍偏短,难以满足商用需求。这一僵局在2026年7月23日迎来破局,德国AI初创黑森林实验室发布的新一代多模态模型,直接把行业天花板抬到了新高度。
本次发布的Flux3基于自研的Self-Flow架构打造,配备了专门的图像、视频、音频、动作四大编解码器,实现了对物理世界和数字场景的统一理解与生成。官方公布的720p分辨率、10秒片段生成测试采用行业通用的盲测评分机制,由20名资深内容创作者和AI技术专家共同打分,数据可信度较高:Flux3对比Luma Ray3.2的胜率达到93%,对比Runway Gen-4.5的胜率达到77%,即便是对标Seedance2.0、Gemini Omni Flash等顶尖多模态模型,也保持着稳定的微弱优势。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录