一、先搞懂:本地模式能干嘛
- ComfyUI:搭积木式的 AI 工具,拖节点连起来就能生成图/视频,不用写代码。
- MiniMax H3:顶尖 AI 视频模型,给文字/图片就能生成带声音的短视频(最高 2K、16 秒、原生立体声)。
- 本地模式:把 H3 的模型权重下到自己电脑跑,完全离线、不花 API 钱、数据不出本机。只需要你有一张独立显卡。
前提:ComfyUI 版本必须 ≥ 0.30.0,H3 原生节点从这一版才开始支持。二、装 ComfyUI(两种方式,选一个,链接在下面)方式 A:桌面版(推荐纯新手)
- 官方一键安装器,自动配 Python / PyTorch / CUDA,自动更新,内置模板库。
- 支持 Windows / macOS(不支持 Linux),目前 Beta。
- 下载地址
- 装完在界面里能直接搜 MiniMax H3 模板、能一键更新到最新版。
- 免安装,下载 .7z 解压即用,环境打包在文件夹里,模型目录一眼可见。仅支持 Windows。
- 下载地址:https://github.com/comfyanonymous/ComfyUI/releases
- 进页面拉到 Assets 区,按显卡选:NVIDIA 20 系及以上 → ComfyUI_windows_portable_nvidia.7zNVIDIA 10 系及更早 → ComfyUI_windows_portable_nvidia_cu126.7zAMD → ..._amd.7z;Intel → ..._intel.7z
- 解压后双击 run_nvidia_gpu.bat 启动;若低于 0.30.0,跑 update\update_comfyui_stable.bat 升级。
启动后浏览器开 http://127.0.0.1:8188 即成功。
三、下载并放置 H3 模型(本地模式最关键的一步)
去哪下:Hugging Face 仓库 Comfy-Org/MiniMax-H3(链接:https://huggingface.co/Comfy-Org/MiniMax-H3),按下面清单下文件。(打不开或不会下载直接丢给workbuddy它会帮你搞定一切)
ComfyUI 桌面版内置"中国镜像"(自动下模型,零操作)
- 安装时勾"启用中国镜像",首次启动自动下载 H3 模型(pruned 阉割版),不用手动找文件。
显存先认清(决定你能不能跑、跑多快)
- H3 全精度要 123GB 显存,普通人跑不了。
- 官方做了量化 + 动态显存卸载的精简版:最小约 42.5GB,靠"把算力卸到内存",连 RTX 3060(12GB)这种消费卡都能跑(慢但能跑)。
- 分档:12GB 卡(3060/4060)→ 量化版 + 卸载,先跑 5 秒小样;24GB 卡(4090)→ 较流畅;多卡 / 80GB 卡 → 可冲 2K。
模型文件清单与放置目录
ComfyUI/models/├── diffusion_models/│ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors # T2V/I2V 用│ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 用(单独约19.5GB)├── text_encoders/│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors # 两种模式共用└── vae/├── minimax_h3_video_vae_fp16.safetensors # 共用└── minimax_h3_audio_vae_fp32.safetensors # 共用- 只下一套也行文生/图生视频下 fl2va;参考生视频下 ref2va。文本编码器 + 双 VAE 两种模式共用,必须下。
- 路径差异:桌面版:C:\Users\你的用户名\AppData\Roaming\ComfyUI\models便携版:解压目录里的 ComfyUI/models(就在眼前)
- 在 ComfyUI 模板库搜下面关键词,导入对应 JSON:MiniMax H3 T2V → 文生视频(只写文字)MiniMax H3 I2V → 图生视频(给首帧图)MiniMax H3 R2V → 参考生视频(给图/视频/音频)
- 不填 API Key(本地模式就是不用它),确认模型节点已选中你放的权重。
- 在提示词框写内容(写法见第五节),可选传首帧图,点运行 / Queue Prompt
- 等进度跑完,右端节点输出带声音的视频文件。
- 帧数小知识:H3 按 24 帧/秒,帧数需满足"除以 17 余 5"(如 124 帧≈5 秒),没有正好 6 秒的视频。
万能公式:场景 + 主体动作 + 镜头运动 + 声音。
- 反面:一只猫(太懒,出片随机)
- 正面:雨后的城市天台,穿深色夹克的人从电脑前起身,镜头从显示器侧后方缓慢推近到半身,衣角被风吹动。保留键盘敲击声、远处城市环境声,不要字幕和 Logo。
参考生视频(R2V)用标签绑定素材:第 1 张参考图、 第 1 段参考视频:
以 的人物作为主体,借鉴 的运动方式,人物开口说话,镜头缓缓推近。
六、常见坑(一眼排查)
- 节点缺失→ ComfyUI 版本太低,升级到 0.30.0+。
- 找不到模型→ 放错目录,对照第三节结构重放(注意 fl2va / ref2va 别混)。
- 显存爆了→ 用量化版 + 动态卸载;先跑 5 秒小样,别一上来长视频。
- 页面空白→ 点右下角Load Default
- R2V 切模式报错→ 只下了一套权重就别乱切另一套。
比如一台Windows + RTX 3060(12GB)台式机:
- 桌面版(comfy.org)或便携版(GitHub Releases 下 nvidia.7z)装好,确认 ≥ 0.30.0。
- 从 Hugging Face 下量化模型,放进 models 对应目录。
- 导入 MiniMax H3 T2V,填提示词,先跑 5 秒小样验证链路通。
#ComfyUI #MiniMaxH3 #AI 视频本地部署 #AI 视频生成 #开源大模型 #本地 AI 部署 #AI 教程 #文生视频
热门跟贴