
2026年7月31日,人工智能企业MiniMax正式发布全新全模态生成模型MiniMax H3,同时承诺数日内开源全部模型权重。该模型支持文本、图像、视频、声音任意组合输入,可直接生成带原生双声道音频的高清视频,其采用的H3-Omni Transformer架构使端到端训练吞吐量提升近30%,大幅降低多模态内容创作门槛。

给短视频做后期的创作者大概率都遇到过这样的卡点:用AI生成了视频片段,还要单独找配音、配BGM,不同工具输出的内容节奏不匹配,光调整同步就要耗掉大半天的时间。而MiniMax此次推出的H3模型,直接把多模态内容创作的“最后一公里”给补全了。
过去几年,AI生成内容的能力边界不断拓宽,但主流多模态模型普遍采用“专家模型拆分”的架构:文生图、文生视频、音频生成各由独立的模型负责,用户需要在不同工具间切换,还要花大量时间做内容对齐,不仅效率低,不同模型的能力参差也会拉低最终产出的质量。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录