---
title: MiniMax-H3-Ref2VA-Pruned
canonical_url: "https://www.modelscope.cn/models/junwenlu/MiniMax-H3-Ref2VA-Pruned"
md_url: "https://www.modelscope.cn/models/junwenlu/MiniMax-H3-Ref2VA-Pruned.md"
repository: junwenlu/MiniMax-H3-Ref2VA-Pruned
chinese_name: MiniMax-H3-Ref2VA-Pruned
last_updated: 2026-09-05
license: other
pipeline_tag: image-to-video
tasks:
  - image-to-video
base_model:
  - MiniMax/MiniMax-H3
base_model_relation: quantized
parameters: 17.8B
tensor_type:
  - BF16
  - F32
  - I8
  - F16
  - F8_E4M3
  - U8
library_name:
  - gguf
  - safetensors
language:
  - zh
  - en
downloads: 424
stars: 9
tags:
  - video-generation
  - audio
  - ComfyUI
  - GGUF
  - minimax
---

# MiniMax-H3-Ref2VA-Pruned

> MiniMax-H3-Ref2VA-Pruned - junwenlu 在 ModelScope 开源的模型。MiniMax H3 原生视频+音频联合生成模型的 ComfyUI 量化整合包。包含 Ref2VA 精简版 GGUF 量化 DiT 权重（Q4_K_M / Q5_K_M）、Qwen3-VL-32B heretic 文本编码器（nvfp4）、视频 VAE（fp16）与音频 VAE（fp32），并附 ComfyUI…

junwenlu/MiniMax-H3-Ref2VA-Pruned 是 ModelScope 魔搭社区上的 17.8B 参数image-to-video模型，采用 other 许可，基于 MiniMax/MiniMax-H3 构建。

- **Repository**: junwenlu/MiniMax-H3-Ref2VA-Pruned
- **License**: other
- **Tasks**: image-to-video
- **Parameters**: 17.8B
- **Base model**: MiniMax/MiniMax-H3
- **Tags**: video-generation, audio, ComfyUI, GGUF, minimax
- **Downloads**: 424
- **Stars**: 9
- **Last updated**: 2026-09-05

Source: https://www.modelscope.cn/models/junwenlu/MiniMax-H3-Ref2VA-Pruned

---

# MiniMax H3（ComfyUI 量化整合版）

MiniMax H3 是原生支持**视频与音频联合生成**的 packed-DiT 模型，在 ComfyUI 中已获原生支持。本仓库整理了在本地运行该模型所需的全部权重文件（量化版）与配套工作流。

## 模型特点

- **音画同生**：单次推理同时生成视频画面与 32kHz 音轨，无需额外配音模型
- **三种生成模式**：
  - `t2va`：纯文本提示词生成视频+音频
  - `fl2va`：指定首帧/尾帧生成视频+音频
  - `ref2va`：参考图 / 参考视频 / 参考音频驱动生成（本仓库权重即为此模式的精简版）
- **规格**：24 fps；画布短边 768，最大面积约 768×1344

## 文件清单

| 文件 | 大小 | 放置路径 |
|---|---|---|
| MiniMax-H3-Ref2VA-Pruned-Q4_K_M.gguf | 10.77 GB | `models/unet/` |
| MiniMax-H3-Ref2VA-Pruned-Q5_K_M.gguf | 13.10 GB | `models/unet/` |
| qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors | 14.61 GB | `models/text_encoders/` |
| minimax_h3_video_vae_fp16.safetensors | 4.85 GB | `models/vae/` |
| minimax_h3_audio_vae_fp32.safetensors | 0.56 GB | `models/vae/` |
| Vantage-Minimax-H3_Q4K_M_Ref2VA.json | 62 KB | `user/default/workflows/` |
| Vantage-Minimax-H3_Q5K_M_Ref2VA.json | 62 KB | `user/default/workflows/` |
| ComfyUI-Spectrum-MiniMax-H3.zip | 0.41 MB | 解压到 `custom_nodes/` |
| ComfyUI-sol-attn.zip | 0.06 MB | 解压到 `custom_nodes/` |

> Q4_K_M 与 Q5_K_M 为同一权重的不同量化等级：Q5_K_M 质量略高、显存占用更大，按显卡选择其一即可。
>
> 权重请**平铺**放入上表目录，不要挪进子文件夹、不要改名：工作流按裸文件名引用模型（如 `qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors`），放进子目录后文件名会变成 `子目录/文件名`，与工作流记录不一致，节点会报模型缺失。

## 使用方法

1. 更新 ComfyUI 至最新版（内置 MiniMax H3 相关节点：Empty MiniMax H3 AV Latent、MiniMax H3 Image to Video、MiniMax H3 Reference to Video 等）
2. 安装依赖的自定义节点：
   - **加速节点（未上架 Registry，需手动安装）**：从本仓库 `custom_nodes/` 目录下载两个 zip，解压到 `ComfyUI/custom_nodes/`
     - `ComfyUI-Spectrum-MiniMax-H3.zip`：采样加速（SpectrumApplyMiniMaxH3，减少采样时的 transformer 评估次数）
     - `ComfyUI-sol-attn.zip`：SoL 注意力内核补丁（MiniMaxH3ChunkFeedForward / FusedModulation / MemoryEfficientSolAttentionPatch），依赖 **Triton**：Windows 用户需安装 [triton-windows](https://github.com/woct0rdho/triton-windows)（`pip install triton-windows`），Linux 用户 `pip install triton`
   - **常规节点（可通过 [ComfyUI Manager](https://github.com/Comfy-Org/ComfyUI-Manager) 安装）**：[ComfyUI-GGUF](https://github.com/city96/ComfyUI-GGUF)（加载 GGUF 权重）、ComfyUI-KJNodes（SageAttention 补丁、图像缩放）、rgthree-comfy
3. 按上表将文件放入对应目录
4. 使用仓库附带的工作流：`workflows/Vantage-Minimax-H3_Q4K_M_Ref2VA.json` 或 `workflows/Vantage-Minimax-H3_Q5K_M_Ref2VA.json`

### ref2va 提示词写法

参考素材按“图片 → 视频（含其音轨）→ 独立音频”的固定顺序进入模型，提示词中用 `<Picture 1>`、`<Video 1>`、`<Audio 1>` 引用对应素材。

## 注意事项

- 帧数建议保持在训练范围内（124~362 帧），更长时长未经验证
- 分辨率宽高需为 32 的倍数，超出最大面积会自动等比缩放
- 可选加速：配合 [ComfyUI-Spectrum-MiniMax-H3](https://github.com/xmarre/ComfyUI-Spectrum-MiniMax-H3) 可减少采样时的 transformer 评估次数
- 工作流引用的示例素材（音频 / 视频 / 图片）为原作者的本地文件，加载工作流后请替换为自己的素材

## 声明

模型版权归 MiniMax 及原权重发布方所有，请遵守其模型许可协议使用。本仓库仅做量化格式整理与搬运。
