
2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3。该模型基于自研Self-Flow架构打造,首次实现原生音频生成,可一次性输出20秒音视频同步片段。在720P 10秒生成测试中,Flux3以93%胜率超越Luma Ray3.2、77%胜率碾压Runway Gen-4.5,目前已布局机器人领域专用动作模型研发。
此前全球主流音视频生成模型普遍存在“音画分离”的行业痛点:用户生成视频后需要额外调用音频工具匹配音效、配音,不仅流程繁琐,还容易出现口型错位、音效滞后、场景音不匹配等同步问题,行业始终期待能原生整合音视频生成能力的底层模型出现。
此次公开的第三方盲测数据显示,在10秒720P分辨率视频生成任务中,Flux3以93%的测试胜率超越Luma Ray3.2,以77%的测试胜率碾压Runway Gen-4.5,即便与Seedance2.0、Gemini Omni Flash等顶尖多模态模型对标,也在音画同步、画面流畅度两个核心指标上保持微弱优势。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录