10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声

44分钟前 AI最新动态 0 0

MiniMax 正式开源了新一代通用视频模型 H3。这是一个全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段就具备了广泛的多模态上下文理解与生成能力。

图片 1

输出规格

  • 时长:4–15 秒
  • 宽高比:支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种比例
  • 分辨率:默认短边 768 像素,H3-Regenerate-2K 可实现 2K 分辨率
  • 帧率:24 FPS
  • 音频:32 kHz 立体声
  • 语言:稳定支持 11 种语言(中、英、日、韩、法、德、西等)

两种输入模式

H3-Base-FL2VA(首尾帧模式):支持输入 0/1/2 张图像,分别对应文生视频、首帧生视频、尾帧生视频、首尾帧生视频。

H3-Base-Ref2VA(全模态参考模式):最多 9 张图像 + 3 段视频 + 3 段音频,合计最多 12 个文件。音频必须与图像或视频一同输入。

三大模块架构

H3 系统由三个模块组成:

  • H3-Context-IR:多模态指令理解与提炼系统,将自由形式的输入转换为结构化表示,包含指令解析、跨模态关联、时序理解和复杂逻辑推理
  • H3-Base:根据 Context-IR 的输出生成音频和视频,输出 768p 结果
  • H3-Regenerate-2K:将 768p 结果连同原始上下文送回 H3,以 2K 分辨率重新生成,视觉保真度更高

图片 2

技术架构细节

H3-Encoder:使用 Qwen3-VL-32B 的完整预训练权重,将第 50 层的 hidden states 提供给 H3-Omni-Transformer。Tokenizer 配置中增加了若干 special tokens。

H3-VAE:分为 H3-VisualVAE(视频/图像编码)和 H3-AudioVAE(音频编码),将多模态输入编码为统一表示。

H3-Omni-Transformer:联合预测视频 latent 和音频 latent,随后分别解码为视频和立体声音频。原生支持稀疏注意力训练与推理,首个开源版本提供全注意力推理,稀疏注意力将在后续更新中发布。

图片 3

推荐工作流

完整 2K 工作流:先调用 H3-Context-IR API 处理输入(文本、图像、视频、音频),将返回的结构化表示连同原始素材传给 H3-Base 生成 768p 结果,再使用 H3-Regenerate-2K 将结果升频至 2K。

快速 768p 工作流:如果不需要 2K 分辨率,可以直接将结构化表示传给 H3-Base 完成生成。

MiniMax 还提供了详细的提示词写作指南和视频提示词模板,帮助开发者构建自己的预处理系统。

📦 开源地址:MiniMax-H3 @ Hugging Face | GitHub

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声
#MiniMax #H3 #视频生成 #开源模型 #全模态 
收藏 1
Gander:零权限无广告的 Android 文件查看器,支持 PDF/Office/Markdown
这是最后一篇
推荐阅读
  • Mistral 3 来了:这次只对标中国模型
  • Cline v3.1 更新!Cline + DeepSeek最佳自主的 AI 编程助手来了,Cursor平替
  • Claude Code 正式推出全自动模式 Auto mode:AI 全权接管权限审核,兼顾高自由度与零误操
  • 收到邀请码,我赶紧试了阿里这款会做生意的Accio Agent
  • 即梦AI图片3.0:AI文生图新王诞生!中文海报天花板「影视质感+文字精准+2K高清」
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32899 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29449 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21796 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21496 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
18044 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17539 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
17462 3月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
17020 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16938 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15841 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Kimi K3 对比 DeepSeek V4 Flash:2.8 万亿参数与 50 倍价差的路线之争
2 MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声
3 DeepSeek V4-Flash 正式版:284B 参数九项 Agent 测试全胜,对标 Claude Opus 4.8
4 TRAE Work 上线个人效率工作台:一键复刻、进度可视化、多端适配
5 MiniMax H3视频模型上线:开源路线、多模态输入、0.23元/秒对标Seedance
6 阿里百炼Token Plan限时活动:Qwen3.8-Max夜间0.2折,39元Lite套餐超值体验
7 DeepSeek V4 Flash正式版上线:Agent能力超越GLM5.2,原生适配Codex
8 Agnes AI 2.5发布:2.5 Flash免费编程模型 + 2.5 Pro Alpha复杂工程能力,全模态继续免费
9 GPT-5.6 Luna降价80%:AI自主优化推理成本,OpenRouter再加码五折
10 AI办公智能体三国杀:WorkBuddy月活超2000万,阿里字节紧急整合应对
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联