一、先搞懂:本地模式能干嘛

  • ComfyUI:搭积木式的 AI 工具,拖节点连起来就能生成图/视频,不用写代码。
  • MiniMax H3:顶尖 AI 视频模型,给文字/图片就能生成带声音的短视频(最高 2K、16 秒、原生立体声)。
  • 本地模式:把 H3 的模型权重下到自己电脑跑,完全离线、不花 API 钱、数据不出本机。只需要你有一张独立显卡。
前提:ComfyUI 版本必须 ≥ 0.30.0,H3 原生节点从这一版才开始支持。
二、装 ComfyUI(两种方式,选一个,链接在下面)方式 A:桌面版(推荐纯新手)
  • 官方一键安装器,自动配 Python / PyTorch / CUDA,自动更新,内置模板库。
  • 支持 Windows / macOS(不支持 Linux),目前 Beta。
  • 下载地址
  • 装完在界面里能直接搜 MiniMax H3 模板、能一键更新到最新版。
方式 B:便携版(想要完全掌控环境时选)
  • 免安装,下载 .7z 解压即用,环境打包在文件夹里,模型目录一眼可见。仅支持 Windows。
  • 下载地址:https://github.com/comfyanonymous/ComfyUI/releases
  • 进页面拉到 Assets 区,按显卡选:NVIDIA 20 系及以上 → ComfyUI_windows_portable_nvidia.7zNVIDIA 10 系及更早 → ComfyUI_windows_portable_nvidia_cu126.7zAMD → ..._amd.7z;Intel → ..._intel.7z
  • 解压后双击 run_nvidia_gpu.bat 启动;若低于 0.30.0,跑 update\update_comfyui_stable.bat 升级。

启动后浏览器开 http://127.0.0.1:8188 即成功。

三、下载并放置 H3 模型(本地模式最关键的一步)

去哪下:Hugging Face 仓库 Comfy-Org/MiniMax-H3(链接:https://huggingface.co/Comfy-Org/MiniMax-H3),按下面清单下文件。(打不开或不会下载直接丢给workbuddy它会帮你搞定一切)

ComfyUI 桌面版内置"中国镜像"(自动下模型,零操作)

  • 安装时勾"启用中国镜像",首次启动自动下载 H3 模型(pruned 阉割版),不用手动找文件。

显存先认清(决定你能不能跑、跑多快)

  • H3 全精度要 123GB 显存,普通人跑不了。
  • 官方做了量化 + 动态显存卸载的精简版:最小约 42.5GB,靠"把算力卸到内存",连 RTX 3060(12GB)这种消费卡都能跑(慢但能跑)。
  • 分档:12GB 卡(3060/4060)→ 量化版 + 卸载,先跑 5 秒小样;24GB 卡(4090)→ 较流畅;多卡 / 80GB 卡 → 可冲 2K。

模型文件清单与放置目录

ComfyUI/models/├── diffusion_models/│   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors   # T2V/I2V 用│   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 用(单独约19.5GB)├── text_encoders/│   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors      # 两种模式共用└── vae/├── minimax_h3_video_vae_fp16.safetensors             # 共用└── minimax_h3_audio_vae_fp32.safetensors             # 共用
  • 只下一套也行文生/图生视频下 fl2va;参考生视频下 ref2va。文本编码器 + 双 VAE 两种模式共用,必须下。
  • 路径差异:桌面版:C:\Users\你的用户名\AppData\Roaming\ComfyUI\models便携版:解压目录里的 ComfyUI/models(就在眼前)
四、导入工作流,出第一支视频
  1. 在 ComfyUI 模板库搜下面关键词,导入对应 JSON:MiniMax H3 T2V → 文生视频(只写文字)MiniMax H3 I2V → 图生视频(给首帧图)MiniMax H3 R2V → 参考生视频(给图/视频/音频)
  2. 不填 API Key(本地模式就是不用它),确认模型节点已选中你放的权重。
  3. 在提示词框写内容(写法见第五节),可选传首帧图,点运行 / Queue Prompt
  4. 等进度跑完,右端节点输出带声音的视频文件。
  5. 帧数小知识:H3 按 24 帧/秒,帧数需满足"除以 17 余 5"(如 124 帧≈5 秒),没有正好 6 秒的视频。
五、提示词怎么写(小白最容易卡的一步)

万能公式:场景 + 主体动作 + 镜头运动 + 声音。

  • 反面:一只猫(太懒,出片随机)
  • 正面:雨后的城市天台,穿深色夹克的人从电脑前起身,镜头从显示器侧后方缓慢推近到半身,衣角被风吹动。保留键盘敲击声、远处城市环境声,不要字幕和 Logo。

参考生视频(R2V)用标签绑定素材:第 1 张参考图、 第 1 段参考视频:

以 的人物作为主体,借鉴 的运动方式,人物开口说话,镜头缓缓推近。

六、常见坑(一眼排查)

  • 节点缺失→ ComfyUI 版本太低,升级到 0.30.0+。
  • 找不到模型→ 放错目录,对照第三节结构重放(注意 fl2va / ref2va 别混)。
  • 显存爆了→ 用量化版 + 动态卸载;先跑 5 秒小样,别一上来长视频。
  • 页面空白→ 点右下角Load Default
  • R2V 切模式报错→ 只下了一套权重就别乱切另一套。
七、个人环境举例(仅举例)

比如一台Windows + RTX 3060(12GB)台式机:

  1. 桌面版(comfy.org)或便携版(GitHub Releases 下 nvidia.7z)装好,确认 ≥ 0.30.0。
  2. 从 Hugging Face 下量化模型,放进 models 对应目录。
  3. 导入 MiniMax H3 T2V,填提示词,先跑 5 秒小样验证链路通。

#ComfyUI #MiniMaxH3 #AI 视频本地部署 #AI 视频生成 #开源大模型 #本地 AI 部署 #AI 教程 #文生视频