MiniMax 正式开源了全新一代全模态生成系统 MiniMax H3。它不仅支持文本、图像、视频、音频、角色参考、镜头运动及语音克隆的统一调度,更能实现 32kHz 立体声的音画同步输出。
本篇保姆级教程将带你从零开始,完整走一遍 MiniMax H3(含越狱模型)的下载、显存适配选择、ComfyUI 环境搭建 到工作流实测的完整流程。
一、 核心配置与显存适配指南
在动手下载之前,请先根据自己的显卡硬件对号入座,选择最适合的量化方案:
硬件基准实测参考:
24G 显存及以上: 推荐 Q8 官方 INT8 或 NVFP4 满血版。
16G 显存: 推荐 Q5 或 Q4 量化版本。
12G 显存(较舒适起点): 实测配合 32G 系统内存与 NVMe 高速固态,可稳定运行 Q4 量化版,生成 5 秒 480p 视频。
8G 显存(极限挑战): 必须使用更激进的量化(Q3 或混合精度 Q2 版本),系统内存必须 32G 起步,并严格从 480p、20 步、5 秒开始尝试。
第二部分:ComfyUI 准备与环境升级
H3 需要较新版本的 ComfyUI 支持原生节点。
升级 ComfyUI: 务必将 ComfyUI 桌面版或整合包更新至 0.27 或更高版本(老版本无法识别 H3 模型)。【点击下载】
目录与文件摆放规范:
下载好主模型、文本编码器及 VAE 后,需严格放置在 ComfyUI 的指定目录下:hugging face下载: 【点击前往】
避坑提示: 音频 VAE 必须使用 fp32 版本,若误用 fp16 会导致音画不同步或全程无声音。
第三部分:加载工作流与节点检查
获取 H3 对应的 工作流 JSON 文件(如 MiniMax FL2V GGUF 工作流)。工作流文件:【点击下载】,越狱工作流节点:【点击下载】
将文件直接拖入 ComfyUI 界面加载。
检查以下核心节点是否连接正确:
Unet Loader (GGUF): 勾选下载对应的主模型。
CLIP Loader (GGUF): 勾选 qwen3vl 文本编码器。
VAE Loader: 区分视频 VAE 与音频 VAE,切勿接反。
初始参数建议: 首次测试分辨率设为 480p,时长 5 秒,步数 20。
第四部分:H3 提示词高阶编写技巧
H3 能够深度理解复杂的镜头语言和多模态要素,传统的标签堆砌效果较差。
错误写法(标签流):
一个女人,咖啡馆,下雨,电影感,8k,高质量
正确写法(分镜描述流):
黄昏的咖啡馆靠窗位置,窗外下着小雨。一位穿米色针织衫的女性正低头搅拌咖啡,镜头从她的手部特写缓慢上摇至面部,她抬头看向窗外,嘴角微微上扬。暖色调室内灯光,窗外冷色调环境光形成对比。背景音:雨声、咖啡杯轻碰声、隐约的爵士乐。
核心技巧:
镜头运动术语: 直接使用
dolly in、pan left、crane shot或中文的“推、拉、摇、移”。角色一致性 (Ref2VA): 支持输入最多 9 张(推荐 3-5 张不同角度)同一角色的参考图,配合语音参考,完美实现跨镜头同人同声。
第五部分:常见问题排查 (FAQ)
Q:找不到对应节点或报错?
A:检查 ComfyUI 是否已更新至最新版,或是否漏装 ComfyUI-GGUF 插件。
Q:加载时直接爆显存崩溃?
A:更换更低量化的模型(如 Q3),并在启动参数中加入
--lowvram。
Q:生成速度慢到无法忍受?
A:确认模型是否放置在 NVMe 固态硬盘上,机械硬盘会导致动态调度速度慢数倍。
评论区