10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI学习教程

MiniMax H3 本地部署教程:RTX 3060 即可运行,0 成本制作 AI 漫剧

1小时前 AI学习教程 9 0

MiniMax H3 现已上线。作为 33B 参数的开源全模态视频模型,支持最高 2K、24fps、15 秒视频输出,还可原生同步生成立体声音频,依托 Apache2.0 开源协议,RTX4090 这类消费级显卡就能本地部署,调用成本仅为同类闭源产品的三分之一,在视频续写、局部重绘等编辑能力上表现突出。对比字节 Seedance2.0,H3 胜在开源可本地化、价格低廉、多模态编辑灵活;但 Seedance2.0 作为闭源专业向模型,电影级画质、镜头运镜、人物动作流畅度的上限更高。简单来说,H3 更适合批量产出、二次创作、预算有限的场景,Seedance2.0 则更适配商业广告、影视工业化这类对成片质感要求极高的项目,二者实际属于差异化竞争。但是对于漫剧、短剧等大部分AIGC创作来说,H3已绰绰有余,更为关键的是其价格相较后者并非为一个数量级,这篇文章将教会大家从0开始本地化部署MiniMax H3,0成本制作AI漫剧。如果你的显卡性能在N卡GTX3060以下就可以划走了!

第一步、首先先学习几个名词

1. ComfyUI —— AI 生成的 "操作台"

免费开源的 AI 模型运行工具,界面是节点连线的形式。>

人话翻译:就像一个搭好的厨房操作台,灶台、锅碗瓢盆、调料都给你摆好了,你不用自己搭架子,只管调火候、放食材、按开关就行。现成的模板都连好线了,普通人改改参数就能用。

2. 工作流(Workflow)—— AI 生成的 "配方"

一张连好线的节点图,记录了从输入提示词到生成成品的完整流程。>

人话翻译:就像菜谱 —— 先放什么、后放什么、火候多大、炒几分钟,步骤全写死了。加载一个工作流,等于直接拿到一份现成配方,照着做就能出同款效果,不用自己从零摸索。

3. 权重 / 模型文件 —— AI 的 "大脑本体"

后缀是.safetensors 的大文件,是模型真正的核心。比如 H3 视频模型就需要 4 个文件:DiT(负责画画)、文本编码器(负责读懂你写的提示词)、视频 VAE(把内部数据翻译成画面像素)、音频 VAE(翻译成声音波形)。

人话翻译:就像游戏的安装包,没有这个文件,光有操作台和配方都是空的。不同模型画风、能力不一样,换模型等于换个画师给你干活。

4. 量化 —— 给模型 "瘦身"

把大模型压缩变小的技术。bf16 是原版全精度,int8、nvfp4 是压缩版,画质损失微乎其微,但对显存的要求能砍一大截。>

人话翻译:就像把无损音乐压缩成 MP3,普通人耳朵听不出差别,但文件体积小了好几倍。本地跑模型基本都用量化版,不然显卡显存根本扛不住。

5. T2V / I2V / R2V —— 三种生成模式

T2V(文生视频):纯靠文字描述生成视频I2V(图生视频):给一张参考图,让它动起来变成视频R2V(参考生视频):给图 / 视频 / 音频当参考,锁定角色长相、画风或者风格,生成出来的内容保持一致>

人话翻译:相当于三种点菜方式 —— 纯靠描述让厨师做、给张照片照着做、给个样品按这个风格来做。

第二步、硬件配置检查

显卡:NVIDIA 显卡最低 12GB 显存,理想配置 24GB 显存以上。 Windows 查看方式:Ctrl+Shift+Esc 打开任务管理器,性能‑GPU 页面查看专用 GPU 内存;也可以在命令行执行 nvidia‑smi 查询。系统内存:底线 32GB,推荐 64GB。任务管理器‑性能‑内存查看。磁盘空余空间:至少预留 60GB,建议 150GB 以上。模型权重本身约 40GB,再加上生成素材、R2V 参考模型,占用还会持续变大。优先使用 NVMe 固态硬盘。系统环境:Windows10/11 或者 Linux。网络条件:可以正常访问 Hugging Face 或者国内镜像站点,镜像方案后面第 2 步会讲到。 对号入座看自己显卡档位

教程截图 1

ComfyUI 官方开发者给出的最低运行门槛:RTX3060 12GB + 32GB 内存 + NVMe 固态,这套配置可以跑 480P 分辨率。12GB 显存可以跑,但有对应的妥协玩法,对照自己硬件找准定位。

教程截图 2

跨硬件档位通用注意事项 有两点不受显卡档次影响,不管你是什么配置都需要留意:系统内存、固态硬盘的重要性不亚于显卡。H3 能够在消费级显卡上运行,依靠的是分层加载机制,显存放不下的数据会调用系统内存来兜底。32GB 内存是硬性底线,64GB 才能流畅稳定运行;哪怕显卡显存很大,但系统内存只有 16GB,依然会出现无法运行的情况。 模型首次加载需要从磁盘读取数据,如果把权重文件放在机械硬盘,每次启动都会额外等待数分钟。全部模型权重一定要存放在 NVMe 固态硬盘当中。另外 30/40 系与 50 系英伟达显卡存在一处关键差异:NVFP4 量化格式仅 50 系 Blackwell 架构具备硬件原生支持。 如果在 3090、4090 这类老卡上加载 nvfp4 权重,ComfyUI 会启用软件模拟模式:虽然能够减少磁盘占用与显存占用,但运算前需要重新解压回高精度,并不会缩短生成耗时。 因此硬件选型建议:50 系显卡可以直接选用社区 NVFP4 版本 DiT 模型,体积更小、生成速度更快;30、40 系显卡优先选择 INT8 / FP8 量化版本,实际收益更高。

第三步:部署 ComfyUI

硬性版本要求:ComfyUI 版本必须 ≥0.30.0。 MiniMax H3专属4个节点与官方工作流模板,在2026‑08‑03合并进 Comfy‑Org/ComfyUI#15224。旧版本没有对应节点,导入任何H3工作流都会直接报错无法运行。 场景A:从零全新安装(小白优先选) 前往ComfyUI官网,下载对应操作系统的桌面版安装包。 双击运行安装程序,全程保持默认选项即可。桌面安装包会自动配齐Python、PyTorch、CUDA全套依赖,省去新手配置环境的麻烦。 安装完成后启动程序,首次开启会执行初始化,等待全部流程结束。 场景B:电脑上已经装有ComfyUI 桌面版:打开软件菜单,执行更新,升级至最新稳定版本。Git手动部署版:进入ComfyUI项目文件夹,执行 git pull 拉取更新,接着运行 pip install -r requirements.txt 更新依赖库。第三方整合包(秋叶包等):等待整合包作者同步更新内核,或者在启动器内执行内核更新。提示:桌面版、各类整合包跟随正式稳定版发布,部分仅夜间开发版(nightly)拥有的功能,会滞后数日才推送过来。 校验是否安装正确 启动完成,浏览器访问 http://127.0.0.1:8188,桌面版一般会自动弹出画布页面。 点开左下角齿轮【设置】→【关于】,核对版本号大于等于0.30.0。 版本不达标一定要回去更新,不要强行跑工作流。高频报错「缺少 MiniMaxH3ImageToVideo 节点」,99%根源就是版本过低。

第四步:获取模型权重文件

模型存放于Hugging Face仓库:Comfy‑Org/MiniMax‑H3⚠️重要提醒:不要直接clone完整仓库。完整仓库总大小约318GB,本地部署只需要其中4个文件即可。 国内加速下载技巧 将Hugging Face链接域名 huggingface.co 替换为 hf‑mirror.com,即可调用国内镜像,下载速度会大幅提升。 20GB级别大文件,建议使用支持断点续传的下载工具,例如IDM、aria2,也可以用浏览器自带断点下载,网络中断之后无需从头下载。熟悉命令行的用户,可以直接执行命令精准下载所需的4个模型文件。- - - - - - -

pip install -U huggingface_hubhf download Comfy-Org/MiniMax-H3 \ diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \ text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \ vae/minimax_h3_video_vae_fp16.safetensors \ vae/minimax_h3_audio_vae_fp32.safetensors \ --local-dir ComfyUI/models/下载必需的 4 个文件:文件大小约为 39.6 GB,两个 VAE 都必须下

教程截图 3

全部安装完成后你的目录应该像我一样: - - - - - - - - -

ComfyUI/├── models/│ ├── diffusion_models/│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors│ ├── text_encoders/│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors│ └── vae/│ ├── minimax_h3_video_vae_fp16.safetensors│ └── minimax_h3_audio_vae_fp32.safetensors桌面版用户特别提示 桌面版的模型存放目录,取决于你安装时自定义的路径。可以在设置里搜索 model paths,核对确认实际模型文件夹位置。省事方案:可以先不手动下载模型,直接跳到第3步。加载官方模板之后,ComfyUI会弹窗提示缺失的权重,附带一键下载按钮,点击就能自动保存到正确目录。手动下载的优势:支持镜像站点、断点续传。网络波动大的用户,优先手动下载。 官方全部模型变体(按需挑选,大部分版本普通用户无需下载) Diffusion模型(DiT,选其一;要使用R2V功能额外下载ref2va系列)- minimax_h3_fl2va_pruned_int8_convrot(19.5 GB)✅首选,T2V/I2V画质、显存占用综合最优

  • minimax_h3_fl2va_pruned_fp8_scaled(19.5 GB)备选量化版本
  • minimax_h3_fl2va_int8_convrot(31.7 GB)未剪枝标准INT8
  • minimax_h3_fl2va_bf16(61.7 GB)全精度,仅用于微调场景
  • minimax_h3_ref2va_pruned_int8_convrot(19.5 GB)R2V参考模式专用,第6步会用到
  • minimax_h3_ref2va_bf16(61.7 GB)R2V全精度权重
  • 文本编码器(选其一)
  • qwen3vl_32b_minimax_h3_nvfp4_awq(14.6 GB)✅通用推荐,全系列显卡均可运行
  • qwen3vl_32b_minimax_h3_int8_convrot(25.3 GB)INT8量化版本
  • qwen3vl_32b_minimax_h3_bf16(48.0 GB)全精度版本

两个底层小知识点 H3显存占用大户不是DiT,而是文本编码器。编码器复用Qwen3‑VL‑32B完整权重,bf16模式下占用甚至高于DiT模型。它在链路里只承担解析提示词的工作,所以普通推理优先选用高压缩的nvfp4版本。网上流传编码器51.5GB属于错误信息,一切以HuggingFace官方仓库文件体积为准。pruned = 剪枝版本,移除13B大小的AdaLN分支。这部分分支输出可以预计算缓存,纯生成推理完全不需要加载;只有做模型微调训练,才需要下载非剪枝完整权重。 按显卡选择社区量化版本(进阶可选) 官方组合 pruned_int8 + nvfp4_awq 属于万能搭配,无论什么硬件,建议先用这套把流程跑通。 跑通之后,如果追求更快速度、更低显存占用,可以再更换社区第三方量化模型。

教程截图 4

注意:社区版本并非官方产出,画质表现、授权协议请自行查阅对应仓库README,ComfyUI原生可直接加载使用。

第五步:成功生成第一条视频(T2V文生视频)

载入官方模板 打开ComfyUI,点击顶部菜单栏「工作流」→「浏览模板」,进入视频分类,搜索关键词MiniMax H3。会出现6套模板,区分清楚,不要选错:- MiniMax H3 Text to Video — 本地:文生视频,新手优先运行这个

  • MiniMax H3 Image to Video — 本地:图生视频,支持首帧、尾帧约束
  • MiniMax H3 Reference to Video — 本地:R2V参考生成,需要额外下载ref2va权重
  • api_minimax_h3_t2v / r2v / flf2v:API云端调用版本,需要填写充值后的API密钥,本地部署暂时忽略

打开Text to Video模板。弹出缺失模型弹窗:直接点击弹窗内下载按钮获取权重; 第2步已经手动放置好模型:直接就绪。如果模型没有被识别出来,重启ComfyUI即可,模型文件只会在程序启动阶段扫描读取。 熟悉工作流核心节点

教程截图 5

导入模板之后画布会生成整套节点链路,只需要掌握下面几个关键节点即可:UNETLoader:DiT模型选择,下拉确认选用 minimax_h3_fl2va_pruned_int8_convrot.safetensors文本编码器加载节点:选定 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors两个VAE Loader:分别载入视频VAE、音频VAE文件Resolution Selector:控制输出分辨率,依靠宽高比、Megapixels参数计算实际画面尺寸;模板默认是快速预览参数,首次测试不要修改正向提示词输入框:填写你的视频生成描述时长/帧数输入模块:设置视频总长度,参数规则参考第4步SaveVideo:最终输出MP4文件的输出节点首次测试建议保持模板默认分辨率、采样参数,先保证完整跑通出片,再去调画面、时长参数。点击 Run(运行)按钮启动生成。 正常运行现象 进度条会先停留在模型加载阶段,大约34GB模型数据从磁盘载入显存/内存,之后才开始逐步采样运算。第一次运行速度慢属于正常现象:RTX4090 48G:首次完整运行644秒(包含模型加载);缓存热启动后425秒;768×432小分辨率热跑仅99秒RTX5090:生成5秒视频约108秒16GB显存显卡(4090移动版):960×540分辨率5秒片段约182秒12GB显存显卡:依靠内存分层加载,864×480、90帧片段大约6分钟所有显卡首次运行,都要在上述时长基础上额外加上几分钟模型加载时间,耐心等待即可。生成完成后,SaveVideo节点会出现视频预览窗口,输出画面+同步音频。 H3的画面与声音是在一轮运算中同步生成,和那些"先生成画面、后期额外配音"的模型有本质区别。控制台出现提示:-

Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead这不属于报错,官方文档标注为正常日志,代表部分运算层回退为标准attention逻辑,不会影响最终生成效果。能够成功输出带声音的视频,代表本地部署全部完成。接下来从"跑通"进阶到熟练调参使用。

第六步:帧数、分辨率硬性约束

下面两条规则来自ComfyUI H3节点源码,属于硬性限制,并非主观经验。规则一:帧数必须符合 17k+5 的网格,节点会自动静默吸附修正数值 核心源码逻辑:- -

while n % 17 != 5: n += 1

教程截图 6

教程截图 7

填60秒时长参数最终只会输出15.08秒视频。想要更长镜头,需要拆分成多段分镜头生成,后期剪辑拼接。 节点提示原文:trained range is ~124‑362, longer is untested。帧数小于124帧依旧可以运行,但属于模型训练分布以外,画面质量没有保障。帧数取值从5、22、39……网格递增。实际创作直接查阅帧数参数表选取,不要随意填写数字;你设置的6秒,实际输出可能是6.58秒,对于卡点剪辑项目会直接出问题。规则二:分辨率原生画布为短边768 模型训练约束:短边768,最大面积768×1344,宽高两个维度必须是32倍数。快速调试:使用模板自带预览规格768×432,单条生成约99秒,适合快速迭代提示词。正式出片:Resolution Selector中Megapixels设置约1.0,16:9比例得到1344×768,为模型原生最优画布,画质表现最好。硬性下限:256p及更低分辨率会直接生成失败,属于模型本身限制,并非硬件故障。强行输出大于原生画布的分辨率可以跑通,但性价比极低。有5090实测跑1920×1088,10秒视频耗时58分钟。 社区最优方案:原生768P生成成片,再使用LTX2.3 / Wan2.2‑5B工作流做本地超分升级至1080P。同等1080P成品,耗时从700秒压缩至161秒,速度提升6倍,画质接近直接大图生成。 想要官方原生2K效果,调用MiniMax云端API重生成。三种方案取舍参考文末本地/API对比。 显存与耗时实测规律

教程截图 8

显存瓶颈来自模型权重,而非画面分辨率。768×432 和1152×640峰值显存几乎无差别,差距小于1%。 48G显卡实测:采样阶段稳定占用约19GB;VAE编解码瞬时峰值冲到32GB。小显存显卡依靠动态内存交换同样可以运行,代价就是生成速度变慢。结论:如果模型权重能够加载进硬件,原生画布内随便调分辨率;一旦OOM爆显存,降低分辨率无法解决,需要更换压缩程度更高的量化权重。像素放大性价比高;视频时长增加成本极高像素维度属于次线性开销:1152×640像素是768×432的2.22倍,生成耗时仅增加1.86倍,放大画幅比想象更划算。 时间维度是超线性开销:注意力计算随token数量暴涨,视频时长翻倍,耗时会远超两倍。4090 48G + SageAttention cuda++ 实测参考: 5秒视频≈5分钟,10秒≈12分钟,满上限15秒≈19分钟。 1536×864对比1152×640像素提升1.8倍,耗时几乎翻倍,大画幅下次线性增益消失,不建议超过原生画布。 可复现验证:同一参数隔日复测,320.11s /322.05s,误差仅0.6%。

第七步:图生视频 I2V

用途:静态图片生成动态视频;或者输入首尾两张参考图,模型插值生成中间连贯运动。在模板库打开MiniMax H3 Image to Video,DiT权重沿用T2V的 fl2va 系列,无需额外下载模型。LoadImage节点上传素材图片,接入MiniMaxH3ImageToVideo节点的 first_frame 输入。last_frame 为可选输入:仅填写首帧:从这张图像开始推演后续画面运动首帧+尾帧同时输入:模型插值两张图片之间的过渡,适合产品旋转、姿态变化

教程截图 9

仅填写尾帧:模型反向推导前置画面,最终定格在尾帧图片I2V提示词需要在正文前增加首帧对齐指令,参考第7.6章节。输入图片会自动适配输出分辨率。建议提前裁剪图片,与输出视频保持一致宽高比,避免构图被裁切变形。

第八步:参考生视频 R2V(H3最强、复杂度最高)

作用:锁定角色外貌、画风、动作运镜、音色,复用至全新视频。 前期准备 R2V使用独立 ref2va 权重,和T2V/I2V的fl2va不通用。 前往HuggingFace仓库下载 minimax_h3_ref2va_pruned_int8_convrot.safetensors(19.5GB),放入 diffusion_models 文件夹。 文本编码器、视频&音频VAE直接复用,不用重新下载。 模板选择MiniMax H3 Reference to Video,UNETLoader切换为ref2va权重。

教程截图 10

使用约束 素材上限:最多9张参考图、3条参考视频、3条参考音频。素材按照接入顺序分配标签:第一张图 ,第二条视频 ,提示词必须使用标签调用素材。务必明确指定每个参考素材承担的任务:控制人脸、画风、动作还是音效,笼统堆砌素材效果很差。ref_image_size 参数:match(默认):参考素材缩放至输出分辨率,速度快,日常优先使用max:短边最高保留2048px,人物五官还原更强;但每一步采样都处理大参考图,速度会大幅下降。人脸频繁崩坏时再开启。 R2V六段式固定提示词结构,顺序不可调换 subject_definitions → summary → retention_analysis → detailed_description → overall_soundscape → non_diegetic_music标签区分::复用人物、场景、服装、动作风格:用作关键帧、构图锚点:视频续写、剪辑节奏参考:音色、音效参考关键易错:如果图片只是用来定义角色样貌,不要使用 ,写进 ; 专门用于"该图就是视频某一帧"场景。summary:方括号标记任务类型,多任务用 + 连接。例如 [reference generation];只有修改原视频本体才写 video editing。retention_analysis:为每个标签指定保留强度:图像:fully_preserved / partially_preserved / attribute_transfer / weak_reference;音频:fully_copy / partially_copy / reference / weak_reference。提示词格式来自官方付费Context‑IR模块,本地手写这套格式等价复刻该模块能力。新手不要硬背,直接复制模板自带示例,替换素材和描述,保存自定义模板反复修改。核心逻辑:每个素材在subject_definitions定义标签,后续全部段落引用该标签,明确保留程度。

第九步:提示词完整编写指南 ★

H3拥有官方结构化提示语法,简单大白话可以生成;多镜头、人物对白、精准运镜、卡点,必须严格遵守格式。除中文台词、画面文字,其余描述全部英文。 9.1 基础三字段模板 - - -

integrated_multimodal_description: [Shot 1] ...overall_soundscape: ...non_diegetic_music: ...integrated_multimodal_description:主体,写画面、动作、镜头运动、人物对白、画内音效。overall_soundscape:1‑4句,环境音、物体动作音效。不要写对白、画内歌曲。完全静音才填写 N/A。non_diegetic_music:1‑3句,配乐描述,只写乐器、节奏速度,禁止写"悲伤、宏大"这类主观情绪形容词。无配乐写 N/A。

教程截图 11

9.2 镜头切换 [Shot N] [Shot1] 写开篇画面,不带时间戳。可以指定画面风格:Cinematic、live‑action、2D‑animated、3D CG、vintage film。 后续镜头必须写精确切换时间:[Shot 2] At 00:03.500, the camera cuts to...切换动词:the camera cuts to / the shot transitions to / the shot switches to;仅特殊需求使用淡入淡出 cross‑dissolve、fade、wipe。单纯推拉摇移运镜不要切镜头;镜头切换代表场景、主体、视角发生实质性变化。 9.3 运镜写法(完整英文句子,拒绝标签堆砌)

教程截图 12

格式:镜头动作 + 幅度 + 速度。中等幅度、正常速度参数直接省略。 示例:- - -

The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.The camera pans right with large amplitude at fast speed, revealing the open doorway.The camera holds a static shot as the runner exits the frame.9.4 对白规则 标签 角色分配固定ID:(S1)(S2),多人齐声 (S1,S2),跨镜头ID保持不变。不出声角色无需编号。角色身份、音色、动作写在 外侧; 内部只放语言标记+原始台词,不做修改翻译。

第十步:性能加速 SageAttention + Cache

建议先完整跑通流程,再配置加速,两套加速手段可以叠加。 SageAttention:提升每一步采样运算速度;Cache节点:跳过部分采样步骤。

教程截图 13

SageAttention 2.x 下载与本机PyTorch、CUDA版本匹配的wheel预编译包,执行 pip install xxx.whl。桌面版用户使用内置终端,确保安装到ComfyUI内置Python环境。必须使用2.x版本。源码编译注意:40系显卡sm_89架构编译需要CUDA≥12.4。安装ComfyUI‑KJNodes自定义节点包。接线:UNETLoader.model → Patch Sage Attention KJ → BasicGuider.model。 模式直接选 auto,自动适配显卡架构。50/40系:自动启用fp8 cuda++内核30系Ampere:自动切换int8路径二选一:要么接入节点,要么启动参数添加 --use‑sage‑attention 全局开启。不要同时启用,会重复补丁,速度反而下降。 Cache跳步加速 EasyCache(无需额外安装)串联进model链路,reuse_threshold 默认0.2;数值越大,跳步越多,速度越快,画质损失上升。保守测试建议0.1。TeaCache(H3专用)安装:Icyoung/ComfyUI‑MiniMaxH3‑TeaCache,不要安装通用版TeaCache,不兼容H3。 参数 rel_l1_thresh 控制跳步强度。实测4090,362帧长视频:- 仅SageAttention:1183.6s

  • SageAttention + EasyCache:899.5s
  • SageAttention + TeaCache:500.5s

⚠️重要风险:Cache会改变生成画面,不是单纯加速。同一个seed,开启Cache和关闭Cache画面不一样。TeaCache提速最强,但画面容易出现静止发呆帧,SSIM只有0.78。适合大批量创意草稿筛选,不要用来产出最终成片。EasyCache损失更小SSIM≈0.96,适合对画质有一定要求的场景。正式交付成片:只用SageAttention,关闭全部Cache;或者使用EasyCache调低阈值。

常见故障排查

1.缺少MiniMaxH3ImageToVideo节点 ComfyUI版本低于0.30.0,升级,重启软件。 CUDA out of memory 爆显存OOM ①优先使用 pruned_int8_convrot + nvfp4_awq 官方轻量化组合,不要用bf16; ②关闭其他占用显存软件; ③系统内存最低32GB,推荐64GB; ④依旧崩溃,更换社区INT4量化权重。显存瓶颈来自模型,降低分辨率无法解决OOM。 2.导出视频没有声音 视频VAE、音频VAE两者全部加载,工作流包含 VAEDecodeAudio 节点接入SaveVideo。优先使用官方模板,自定义工作流极易误删音频链路。 3.视频实际时长和填写参数不一致 帧数被17k+5网格自动吸附,H3单次最大输出15.08秒,直接从帧数表格选择合法数值。 4.R2V提示找不到权重 R2V使用独立ref2va权重,和T2V/I2V不通用,需要单独下载。 5.R2V运行速度极慢 检查 ref_image_size 被设置为 max;日常创作切换回 match。 6.人物口型不对,台词被篡改 台词完整放在 标签内部,语言标记写正确,描述内容放在标签外面。 7.3090速度慢,显存跑不满 Ampere架构无原生FP8硬件;H3内存调度保守,显存跑不满属于已知现象。开启SageAttention auto模式,加大系统内存。 8.16GB显卡启动直接崩溃 Device memory is nearly full ①系统内存升级至64GB; ②启动参数添加 --cache‑none --disable‑smart‑memory; ③关闭浏览器硬件加速; ④更换更小体积量化权重。 9.声音效果预期 H3原生输出32kHz立体声,并非单声道复制。声场属于窄空间立体声,不支持极强左右声道定位。最大优势:画面、音效、对白、配乐在一次前向传播同步生成,唇形同步是原生能力,不是后期配音对齐。

本地部署 VS MiniMax 官方API成本对比

API官方定价:768P:0.5元/秒;2K:0.8元/秒;768P重生成2K:0.3元/秒768P草稿+云端升2K,总价等于直接生成2K,没有价格优惠。大量试错迭代:优先本地部署,省去API试错开销。定稿高清方案:A:本地768P生成,LTX2.3/Wan2.2‑5B本地超分到1080P,免费。注意超分工作流需要调低sigmas,防止人脸、口型崩坏。 B:调用API重生成2K,0.3元/秒,属于模型原生重绘,细节文字还原更强,适合商业交付。

教程截图 14

用户选型建议 简单体验:直接网页版,不用本地部署。商业交付、需要原生2K、追求效率:直接API。拥有12GB以上N卡,大量出片,愿意折腾:本地部署,草稿本地跑,定稿按需API升分辨率。如果这篇文章对你有帮助请不要吝啬你的点赞哦!感谢各位小伙伴的支持!!!#本地部署#Minimax #AIGC#AI漫剧#AI短剧

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:MiniMax H3 本地部署教程:RTX 3060 即可运行,0 成本制作 AI 漫剧
#MiniMax H3 #本地部署 #ComfyUI #AI漫剧 #视频生成 #教程 
收藏 1
DeepSeek V4 Flash 内置联网搜索:Responses API 原生支持 web_search,Codex 可直接调用
微软开源 Skill Recorder:录制操作自动生成 AI Agent SKILL.md
推荐阅读
  • 零基础上手 VSCode + Claude Code + GLM-4.6 保姆级安装配置教程
  • Agent Eval 系统构建指南:概念、评估方法与落地路线
  • 手把手教你用 VMware 虚拟机部署OpenClaw 实战教程,轻松打造你的本地全能 AI 助理
  • 手把手教你用Everywhere + 智谱免费API实现真正的看得见,能操作的多模态桌面 AI 助理
  • MiniMax-M2.7 量化版本地部署指南:Unsloth 22 个版本选择 +3 种部署方式详解
评论 (0)
请登录后发表评论
分类精选
Cursor永久免费攻略:无限邮箱注册+重置机器码+Cursor试用期重置工具实现永久免费使用
50714 1年前
手把手教你如何使用扣子Coze搭建“文生图” AI Bot
21818 2年前
n8n新手入门指南:5 分钟本地部署 + 中文汉化 + 快速启动,玩转工作流(Docker版)
20250 1年前
安装字节Trae登录提示App Unavailable(应用程序不可用)解决办法,这份官方指南请收好!
19453 1年前
零基础上手 VSCode + Claude Code + GLM-4.6 保姆级安装配置教程
18154 9月前
Gemini CLI 装好了,登录异常怎么办?手把手教你解决 Gemini CLI 登录问题
17397 1年前
手把手教你用国内VISA信用卡直接订阅ChatGPT、Claude、Google Gemini等海外AI服务
17269 6月前
AI 概念篇:Token是什么?一文讲清楚Token分词、窗口、计费与常用计算工具
16597 7月前
一文搞懂什么是 Vibe Coding?Vibe Coding工具推荐及Cursor编程开发实践
15990 1年前
手把手教你使用 Gemini 2.5 Pro 免费 API搭建本地知识库,一键接入 Gemini!
15165 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 MiniMax H3 本地部署教程:RTX 3060 即可运行,0 成本制作 AI 漫剧
2 Cherry Studio V2 进阶玩法:Agent 自主执行、MCP 集成与 Skill 生态
3 Modal 每月免费 30 美元:轻松部署 Kimi K3 等开源模型
4 Claude Code 接入免费 Kimi K3,Modal 平台每月 30 美元额度教程
5 DeepSeek V4-Flash 接入 Codex:一行命令配置,性价比对标 GPT-5.6 Luna
6 Trae官方知识库开源:40万字场景化教程覆盖30+工作场景
7 用 TRAE Work 搭建科技媒体研究助理:规则+技能+自动化
8 Cline.bot 免费 API 接入指南:1M 超长上下文,三款模型任选
9 WorkBuddy 系统教程:从安装登录到自动化任务,50 张图手把手教你上手 AI 桌面助手
10 WorkBuddy 内置 9 款模型比价:B2B 营销人省积分选型指南
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联