MiniMax 近日正式上线 H3 视频生成模型,带来了一项关键升级:支持"全能参考"模式。与此前的首尾帧生成方式不同,H3 允许用户直接输入人物形象、场景素材、音频片段等多模态内容,模型自动理解并生成连贯视频。这种工作流的改变,大幅降低了视频创作的门槛。

以赛博朋克风格游戏 UI 画面为例,H3 生成的视频在帧间衔接上表现精准,画面干净利落,接近 3A 级游戏的视觉标准。对于游戏行业而言,这意味着过场动画、剧情 CG 等高投入内容可以通过 AI 显著降低成本。
评测表现:AA 榜单排名第一
根据公开评测数据,MiniMax H3 在多个 AI 模型排行榜中表现突出,其中在 AA 榜单中取得第一名成绩。这说明其优势不仅在于视觉效果,更体现在模型理解能力、生成稳定性和复杂场景处理上。

在商业场景测试中,H3 生成了一支时尚眼镜产品宣传片:服装质感、造型设计、镜头语言均达到较高水准,AI 生成痕迹不明显。这表明 Seedance 在 AI 视频领域的领先地位正在面临挑战。
核心优势:多模态理解、精准控制、商业内容生成
MiniMax H3 的核心能力集中在三个方向:
- 多模态理解与生成:支持最多 9 张图片、3 段视频、3 段音频混合输入,素材上限 12 个文件,提示词最长 7000 字符。
- 精准编辑与控制:支持基于参考图的精准编辑,可对视频特定区域进行修改。
- 多场景商业内容生成:适用于电商带货、广告宣传片、游戏 CG 等商业场景。
值得注意的是,H3 是目前少数达到顶级水平且选择开源路线的视频模型。对于开发者和 AI 创作者来说,这意味着更低的创作成本和更多的玩法可能性。

实测:多模态输入能力
测试一:音频参考
输入一男一女的角色形象,加上一段女生语音,要求生成的剧情视频中女主角使用该语音的音色。测试结果显示,角色形象严格遵循输入图片,音色与上传音频保持一致。

测试二:复杂动作参考
上传一张舞蹈动作拆解图,让模型参考图中人物动作生成芭蕾舞视频。生成结果中,女主动作与参考图基本一致。值得关注的是,帆布包在旋转过程中遵循物理规律,没有出现穿模或形变。

商用级输出参数
MiniMax H3 的输出规格如下:
- 帧率:24FPS
- 分辨率:最高支持 2K
- 音频:原生双声道
- 时长:最高 15 秒
- 宽高比:21:9、16:9、4:3、1:1、3:4、9:16
2K 分辨率支持是进入商业场景的重要门槛,电商、广告、游戏等行业对画质要求较高。
测试三:视频带货
输入头戴式耳机产品图和角色形象,生成带货视频。细节表现方面,手指动作和透视关系合理,产品展示效果自然。


测试四:游戏场景
生成第一人称中世纪骑士与兽人战斗的游戏 CG 画面。细节表现包括:武器挥动时的泥沙飞扬、地面水坑随视角晃动产生的波纹、兽人倒影、剑上泥沙痕迹、面罩被打飞的过渡动画。在画面精细度和 BUG 控制方面,表现与 Seedance 处于同一水准。
精度编辑与控制
在视频编辑能力测试中,先生成了一段女主跳舞视频,然后上传一张手绘特效参考图,要求在原视频中添加橙黄色手绘涂鸦效果。结果显示,手绘线条随舞蹈动作同步变化,贴合度高,效果灵动自然。


价格优势
MiniMax Hub Pro 会员定价方面,768P 画质视频价格为 0.23 元/秒,2K 画质为 0.4 元/秒。相比同类 AI 视频模型,价格优势明显。

总结
MiniMax H3 的出现标志着开源视频模型正在缩小与商业顶级模型的差距。在画面质量、多模态理解、商业内容生成等核心能力上,H3 已进入第一梯队。更重要的是,开源路线和亲民定价将高质量 AI 视频创作带入了更多普通创作者可及的范围。
目前 MiniMax H3 已上线,使用地址:hub.minimaxi.com