斜杠中年斜杠中年AI × 沟通 × 商业 × 人生
AI 研究

本地跑 MiniMax H3 视频生成:ComfyUI 无 API 全攻略

不用 API key,不用云端,用自己显卡本地跑 MiniMax Hailuo-03 视频生成。完整流程 + T2V/I2V/R2V 三种模式实测,记录踩过的坑和真正能跑的 workflow。

2026-08-05更新: 2026-08-058 分钟阅读Wesley Chong
#MiniMax#H3#Hailuo#ComfyUI#本地部署#视频生成#AI
本地跑 MiniMax H3 视频生成:ComfyUI 无 API 全攻略|AI 研究 封面图

摘要

MiniMax H3(Hailuo-03)是目前开源视频生成模型里效果最好的一档,但官方 API 有用量限制。其实它已经可以本地跑了——ComfyUI Desktop 预置了所有模型,用 Hermes Agent 搭好 skill 之后,一行命令生成视频,不用信用卡,不用等配额。

一句话答案

MiniMax H3 已经可以在本地跑,ComfyUI Desktop 自带所有模型,用 Hermes 搭好的 skill 一行命令生成 T2V/I2V/R2V 视频,不用 API key。

为什么想本地跑

MiniMax 的 API 体验其实不差,但我有两个不满:视频长度受限于积分,以及生成内容受平台审核。本地跑没有这些问题,而且 RTX 5080 的算力不用白不用。

第一次成功跑出视频的时候,我的感觉是:原来视频生成已经到这个地步了。

环境准备

路径结构(Windows)

C:\Users\<user>\AppData\Local\Comfy-Desktop\
├── ComfyUI-Installs\ComfyUI\ComfyUI\   ← 核心程序
├── ComfyUI-Shared\
│   ├── models\                          ← 所有模型文件
│   │   ├── diffusion_models\
│   │   │   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   │   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   │   ├── text_encoders\
│   │   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   │   └── vae\
│   │       ├── minimax_h3_video_vae_fp16.safetensors
│   │       └── minimax_h3_audio_vae_fp32.safetensors
│   └── output\                          ← 生成结果输出

Desktop 版本装完模型就全在这里,不需要额外下载,也不需要 Hugging Face token。

启动服务器

ComfyUI 需要以 headless 模式启动,不是开桌面程序:

cd "C:\Users\<user>\AppData\Local\Comfy-Desktop\ComfyUI-Installs\ComfyUI\ComfyUI"

# 关键:清除 PYTHONPATH,否则 venv 会导入错误的 Pillow
env -u PYTHONPATH ".venv\Scripts\python.exe" main.py \
  --listen 127.0.0.1 --port 8188 \
  --extra-model-paths-config "C:\Users\<user>\AppData\Local\hermes\scripts\minimax_h3_extra_paths.yaml" \
  --output-directory "C:\Users\<user>\AppData\Local\Comfy-Desktop\ComfyUI-Shared\output"

健康检查:

curl http://127.0.0.1:8188/system_stats

Workflow 节点链

官方 ComfyUI 模板是 subgraph 格式,直接 POST 到 /prompt API 会报 missing_node_type 错误。本地跑必须用标准节点构建 workflow。

正确的节点连接

MiniMaxH3ImageToVideo / MiniMaxH3ReferenceToVideo
  output[0] = CONDITIONING  ← 别接这里
  output[1] = LATENT        ← 接这里才对

LATENT ──► VAEDecode (samples=[H3, 1], vae=video_vae) ──► IMAGE
         ──► VAEDecodeAudio (samples=[H3, 1], vae=audio_vae) ──► AUDIO
                                                    AUDIO ──► CreateVideo (images, fps, audio, bit_depth=8)
IMAGE ────────────────────────────────────────────────► CreateVideo
CreateVideo output ──► SaveVideo ──► .mp4

踩过的坑:

坑 1:接错 output 索引。 H3 节点输出 CONDITIONING(索引0)和 LATENT(索引1)。我第一次接的是 [node_id, 0],结果报 received_type(CONDITIONING) mismatch input_type(LATENT)

坑 2:CLIPLoader 缺少 type 参数。 普通 SDXL 的 CLIPLoader 不需要 type,但 H3 用的 qwen3vl_32b_minimax_h3_nvfp4_awq 必须加 type: "minimax",否则报错 required_input_missing: type

坑 3:CreateVideo 的 bit_depth 是 INT。 我一开始传的是字符串 "auto",报错 invalid literal for int() with base 10: 'auto'。正确值是 8(8bit)或 10(10bit)。

三种模式实测

T2V — 纯文字生成

python run_h3.py \
  --mode t2v \
  --prompt "A sleek red sports car races through a neon-lit night city. Rain on the asphalt. Cinematic slow motion. Camera follows from behind." \
  --seconds 5 \
  --aspect 16:9 \
  --mp 0.4 \
  --seed 12345

输出:MiniMax_H3_00010_.mp4,1.2MB,864×480,124帧(~5秒)。

I2V — 起始图引导

python run_h3.py \
  --mode i2v \
  --first-frame "C:\path\to\character.png" \
  --prompt "The character walks confidently toward the camera. Cinematic. Audio: footsteps, city ambience." \
  --seconds 5 \
  --aspect 16:9 \
  --seed 42

加上 --last-frame 可以做首尾帧插值(FL2VA),让模型在两张图之间生成过渡帧。

R2V — 参考资料引导

python run_h3.py \
  --mode r2v \
  --ref-image "C:\path\to\char_ref.png" \
  --ref-image "C:\path\to\style_ref.png" \
  --prompt "The character walks confidently toward the camera. Cinematic." \
  --seconds 5

支持最多 9 张参考图、3 段参考视频、3 段参考音频。ref_image_size 参数控制参考图尺寸策略:"match" 缩放到生成尺寸(保持宽高比),"max" 用 2048px 短边(identity 保真度最高,但速度慢几倍)。

分辨率和时长参数

H3 有固定的帧率(24fps)和网格对齐约束。

| 秒数 | 帧数 | 说明 | |------|------|------| | 5s | 124帧 | 17×7+5,最接近 5 秒的网格点 | | 10s | 175帧 | 17×10+5 | | 15s | 192帧 | 17×11+5 | | 20s | 209帧 | 17×12+5 |

时长用 --seconds 传,脚本会自动换算成帧数。也可以直接用 --length 124 指定帧数。

分辨率参数:

| megapixels | 16:9 输出 | 9:16 输出 | |------------|-----------|-----------| | 0.2(预览) | 864×480 | 480×864 | | 0.98(原生) | 1344×768 | 768×1344 | | 2.0(Full HD) | 1920×1088 | 1088×1920 |

H3 限制短边最大 768px,超过会自动缩放。

生成效果

RTX 5080 单次 T2V 5秒视频实测耗时约 2-3 分钟(取决于场景复杂度)。

效果方面,H3 的强项是镜头运动和场景一致性。能看出 AI 生成的痕迹,但在文字 prompt 描述准确的情况下,输出的视频已经可以直接用在概念展示、素材参考和早期创意验证阶段。

延伸

常见问题

MiniMax H3 本地跑需要什么显卡?

实测 RTX 5080 16GB 可以跑 1344x768 5秒视频(124帧)。H3 官方说支持 124-362 帧,超过 362 帧(~15秒)效果没测试过。RTX 4070 或 3080 应该也能跑,只是会更慢。

ComfyUI Desktop 自带模型吗?

带。ComfyUI Desktop 安装后,所有 MiniMax H3 模型(FL2VA、Ref2VA)、VAE(视频+音频)、Qwen3VL 32B 文本编码器都已经下载好,在 ComfyUI-Shared/models/ 目录下。首次安装 Desktop 之后不需要额外下载任何东西。

T2V、I2V、R2V 有什么区别?

T2V(Text-to-Video)是纯文字生成;I2V(Image-to-Video)需要一张起始图,模型会在图的基础上生成运动;R2V(Reference-to-Video)支持多张参考图、参考视频、参考音频,适合保持角色或场景一致性。

为什么我用官方模板 JSON 提交到 API 会报错?

因为官方 ComfyUI 模板用的是 subgraph(子图),内部节点定义不完整,REST API 无法处理。解决方法是直接用节点类型构建 workflow,不要用 subgraph 模板。具体节点连接方式见文章内 workflow 链。

分享这篇文章 / Share Article
Wesley Chong

作者

Wesley Chong

来自马来西亚居銮的软件开发者、数字顾问、Toastmasters 讲员。

专注帮助普通人用 AI 升级沟通、表达、商业与人生。

相关阅读