登录体验完整功能(收藏、点赞、评论等) — 已累计有 13169 人加入

德国黑森林实验室发布Flux3多模态模型 首次支持原生音视频生成

详情页推荐

2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3。该模型基于自研Self-Flow架构打造,首次实现原生音频生成,可一次性输出20秒音视频同步片段。在720P 10秒生成测试中,Flux3以93%胜率超越Luma Ray3.2、77%胜率碾压Runway Gen-4.5,目前已布局机器人领域专用动作模型研发。

此前全球主流音视频生成模型普遍存在“音画分离”的行业痛点:用户生成视频后需要额外调用音频工具匹配音效、配音,不仅流程繁琐,还容易出现口型错位、音效滞后、场景音不匹配等同步问题,行业始终期待能原生整合音视频生成能力的底层模型出现。

此次公开的第三方盲测数据显示,在10秒720P分辨率视频生成任务中,Flux3以93%的测试胜率超越Luma Ray3.2,以77%的测试胜率碾压Runway Gen-4.5,即便与Seedance2.0、Gemini Omni Flash等顶尖多模态模型对标,也在音画同步、画面流畅度两个核心指标上保持微弱优势。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。