
近日,AI生成领域厂商Black Forest Labs正式推出新一代多模态流模型FLUX 3,该模型打破了传统单模态生成的能力边界,可同步实现图像生成、最高20秒带原生音频的视频创作、音频内容输出及机器人动作预测四大核心能力,为AIGC、具身智能等多个领域的落地应用提供了全新技术底座。
近两年来,AIGC赛道的竞争已经从单模态能力的比拼转向多模态融合能力的角力。此前行业内的主流生成模型大多采用独立架构,文生图、文生视频、音频生成、机器人动作预测分属不同技术栈,开发者要实现多模态输出往往需要拼接多个模型,不仅效率低,还容易出现模态对齐误差,比如生成的视频和音频不匹配、动作预测和场景不适配等问题。
这种行业痛点也让统一架构的多模态基座模型成为全球AI厂商研发的核心方向,FLUX 3正是Black Forest Labs针对这一需求推出的落地产品。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录