
2026年7月31日,人工智能公司MiniMax正式推出通用全模态生成模型MiniMax H3。该模型首次实现文本、图像、视频、音频四类模态的统一理解与生成,最高可输出15秒2K分辨率原生双声道音视频内容,生成成本仅为同类主流模型的三分之一,目前已具备广告、电商、游戏等多场景商用落地能力。

从今年4月启动定向邀测至今,MiniMax H3已经在近200家企业客户的试用场景中完成了稳定性验证:电商商品短视频的生成通过率提升47%,品牌广告的素材修改周期从平均3天压缩到2小时,这也是本次MiniMax敢直接将H3推向通用商用市场的核心底气。
过去几年,多模态AI生成赛道长期处于“专人专事”的状态:视频生成模型只能处理画面输出,音频需要单独调用语音合成工具,文本字幕、风格化渲染还要叠加额外的图像模型,企业用户要完成一条合格的商用短视频,往往需要调度3-5个不同的模型,不仅调试成本高,不同模态的适配问题也会大幅拉低产出效率。此前行业内多次尝试推出整合类方案,但都未能解决模态间调度的底层逻辑问题,实际落地效果始终不及预期。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录