> 本机实测环境:Windows + ComfyUI + 显卡 RTX 5080 16G。以下操作均在我自己的机器上跑通,节点名称来自工作流真实节点,不虚构参数。

之前发了几篇都是排错类,很多人后台问我:能不能先给一个"装上就能出片"的版本?这篇就做这件事。

我用的是一份叫「全能多参生视频自用版+人物场景类特效」的工作流。它把模型加载、提示词、参考图、采样、出片全部串好了,普通用户导入后真正要手动动的就两三处,适合做连载漫剧开头先跑通流程。

▍ 一、先把模型放对位置(一次性)

H3 的模型不是丢进 models/checkpoints 就能认的,官方目录是分开的:

  • 扩散模型(UNET 本体)放到 ComfyUI/models/diffusion_models/
  • 文本编码器(CLIP)放到 ComfyUI/models/text_encoders/
  • VAE 放到 ComfyUI/models/vae/

工作流里的 UNETLoader、CLIPLoader、VAELoader 三个节点就是分别去这三个目录读文件的。放错目录会直接报"找不到模型",这是新手第一个卡点。

我本地用的是 INT8 量化版 + nvfp4_awq 4bit 组合,不开启加速 LoRA 时,RTX 5080 16G 实测峰值显存约 12.5GB,跑 10 秒视频总耗时约 483 秒(约 8 分钟)。如果搭配工作流内 4 步加速 LoRA,同等硬件条件下,10 秒视频生成时间缩短至 65-100 秒(实测 64-99 秒区间),生成效率大幅提升。以上均为本机实测,不同硬件速度会浮动,仅供参考。16G 显存基本能稳住,不必急于做分片处理。

▍ 二、导入工作流,认准这几个节点

打开网易新闻 查看精彩图片

工作流关键节点截图:加载图像、提示词、H3 参考生视频、分辨率与 LoRA

双击 json 加载进 ComfyUI 后,画面节点很多,但你要动手的只有几块:

  1. MiniMaxH3ReferenceToVideo —— H3 的核心节点,参考图变视频就靠它。它的输入口接参考图、提示词、模型,输出口接后面的解码和成片。
  2. Input Text (Prompt) —— 提示词输入框,写你的画面描述(角色外貌、动作、场景)。这是你每天做不同镜头主要改的地方。
  3. LoadImage —— 参考图输入,把你的角色立绘或关键帧拖进去。
  4. ResolutionSelector —— 分辨率选择,新手保持默认别动。
  5. LoraLoaderModelOnly / Load Lora —— 已经挂好的风格 LoRA,我一般先不动;想换画风再调。

剩下 KSampler、BasicScheduler、BasicGuider、SamplerCustomAdvanced 这些采样相关节点,工作流作者已经调好了步数和调度器,第一次跑先全不动,出片满意了再微调。

▍ 三、跑通第一个镜头的三步

第一步:在 LoadImage 放一张角色参考图(正面、全身或半身都行,背景干净更好)。参考图不需要 4K 高清,分辨率控制在 1024 以内就够用,图片过大只会白白拉高显存消耗,新手别直接丢大图进去。

第二步:在 Input Text (Prompt) 写一句话描述这个镜头,例如"少女站在窗边看雨,头发被风吹起,夜晚城市灯光虚化在背景"。不用写太长,H3 对短句理解不差。

第三步:点「Queue Prompt」运行。链路会走 MiniMaxH3ReferenceToVideo → VAEDecode / VAEDecodeAudio 解出视频和音频 → CreateVideo / SaveVideo 写成片。

出片默认在 ComfyUI 的 output 目录,工作流里 solarL_SaveImagesToZip 节点会自动打包图片序列,方便后续剪辑。如果你的工作流没有这个自定义节点,直接忽略即可,完全不影响视频输出。

打开网易新闻 查看精彩图片

H3 生成的漫剧成片帧示例,含清晰二次元人物主视觉与场景,用于佐证"导入即出片"效果

▍ 四、做连载怎么"少调节点"

连载最怕每集都要重调一遍。这份工作流的思路是:把"固定项"和"变动项"分开。

固定项(建好一次就别碰):模型路径、ResolutionSelector、采样步数、SAGE注意力补丁KJ(加速用,开着能省时间)。

SAGE注意力补丁KJ 可以明显降低显存占用、加快生成,但高动态、大动作的镜头偶尔会蹦出雪花噪点。如果某次生成的画面出现色块、雪花,可以临时绕过这个节点,代价是显存占用暴涨、生成时间翻倍。日常安静镜头开着就行,遇到强动作镜头再关。

变动项(每集改):LoadImage 的参考图、Input Text (Prompt) 的镜头描述。

我自己的做法是:第一集跑顺后,直接「Save (API Format)」把这份工作流存成"我的连载母版.json",之后每集只换参考图和提示词,节点基本不用再调。连续做了十几集,没再因为调参翻车。

▍ 五、两个容易踩的小坑

参考图太花:背景杂物多,生成的人物容易带进奇怪元素。参考图尽量用干净立绘。

提示词中英混写:H3 对中文提示词支持可以,但专有名词(比如特定画风名)保留英文原词更稳,不必硬翻。

跑起来之后,下一步就是批量生成多镜头再进剪映剪辑,那部分是另一篇的事了。先把"导入就能出片"这关过掉,后面都是加法。

另外也要客观说下模型本身的局限:大动作的武打、高速旋转这类强动作镜头,即便这套工作流,依旧容易出现人物五官漂移、肢体崩坏。遇到高动态场景,建议拆成 5 秒以内短镜头,后期剪辑拼接,不要指望单段长视频完成大动作。