
2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3,该模型基于自研Self-Flow架构打造,是全球首个支持原生音频生成的多模态基础模型,可一次性生成20秒音画同步内容,在720p分辨率10秒片段生成测试中,对Luma Ray3.2、Runway Gen-4.5的胜率分别达93%、77%,性能领跑全球同类型产品。
长期以来,AI生成音视频内容始终存在“音视分离”的痛点:大部分模型仅支持视频生成,用户输出视频后还需单独匹配音频素材、手动校对时间轴,不仅拉长了内容生产流程,还经常出现口型错位、音效与画面动作不匹配等问题,大幅拉低了生成内容的可用度。
Flux3的核心突破,在于首次将音频生成能力整合进多模态模型的原生底座中,而非采用此前行业普遍的“视频模型+音频模型拼接”的方案。
其搭载的Self-Flow架构同时配备了专用的图像、视频、音频及动作编解码器,实现了对物理世界与数字环境的统一理解与生成,输出内容时无需经过跨模型对齐,从根源上解决了音画不同步的问题。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录