登录体验完整功能(收藏、点赞、评论等) — 已累计有 13185 人加入

Black Forest Labs推出FLUX 3 多模态模型覆盖音视频及动作预测

详情页推荐

近日,AI生成领域厂商Black Forest Labs正式推出新一代多模态流模型FLUX 3,该模型打破了传统单模态生成的能力边界,可同步实现图像生成、最高20秒带原生音频的视频创作、音频内容输出及机器人动作预测四大核心能力,为AIGC、具身智能等多个领域的落地应用提供了全新技术底座。

近两年来,AIGC赛道的竞争已经从单模态能力的比拼转向多模态融合能力的角力。此前行业内的主流生成模型大多采用独立架构,文生图、文生视频、音频生成、机器人动作预测分属不同技术栈,开发者要实现多模态输出往往需要拼接多个模型,不仅效率低,还容易出现模态对齐误差,比如生成的视频和音频不匹配、动作预测和场景不适配等问题。

这种行业痛点也让统一架构的多模态基座模型成为全球AI厂商研发的核心方向,FLUX 3正是Black Forest Labs针对这一需求推出的落地产品。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。