---
title: MiniMax-H3-16G-HiFi
canonical_url: "https://www.modelscope.cn/models/l1ngzi/MiniMax-H3-16G-HiFi"
md_url: "https://www.modelscope.cn/models/l1ngzi/MiniMax-H3-16G-HiFi.md"
repository: l1ngzi/MiniMax-H3-16G-HiFi
chinese_name: "MiniMax H3 混合高精度量化(16G显存优化版)"
last_updated: 2026-09-15
pipeline_tag: image-to-video
tasks:
  - image-to-video
  - image-text-to-text
  - text-to-video-synthesis
  - text-to-audio-synthesis
  - any-to-any
base_model:
  - MiniMax/MiniMax-H3
base_model_relation: quantized
parameters: 68.8B
tensor_type:
  - F16
  - U8
  - F32
  - BF16
  - I8
library_name:
  - safetensors
language:
  - zh
downloads: 11161
stars: 121
---

# MiniMax-H3-16G-HiFi

> MiniMax-H3-16G-HiFi - l1ngzi 在 ModelScope 开源的模型。我们针对16G显存消费级显卡和32G内存的硬件情况专门规划，使用BF16/ConvRot INT8混合量化，大批量扫参取最优配置，充分利用计划资源，达到接近原生满血BF16的精度，同时不会因为fast-disk NVMe卸载掉速。量化损失比ComfyUI官方推荐量化版低约30%。详情见模型卡/README。

l1ngzi/MiniMax-H3-16G-HiFi 是 ModelScope 魔搭社区上的 68.8B 参数image-to-video、image-text-to-text、text-to-video-synthesis模型，基于 MiniMax/MiniMax-H3 构建。

- **Repository**: l1ngzi/MiniMax-H3-16G-HiFi
- **Tasks**: image-to-video, image-text-to-text, text-to-video-synthesis, text-to-audio-synthesis, any-to-any
- **Parameters**: 68.8B
- **Base model**: MiniMax/MiniMax-H3
- **Downloads**: 11161
- **Stars**: 121
- **Last updated**: 2026-09-15

Source: https://www.modelscope.cn/models/l1ngzi/MiniMax-H3-16G-HiFi

---

# 🎉 感谢大家的使用!
## 更新
> **8月23日**: 同时支持FL2VA和Ref2VA双模式权重和对应基础工作流, 请注意区分 

## 接下来
> ComfyUI官方的Sol-attn: 暂时还处于实验性阶段, 我们将跟进并在其表现稳定之后更新基础工作流

> Minimax Regenerate 2K / Minimax 稀疏注意力: 官方还未开源

## 遇到问题?
> 如果您没有技术基础, 请**仔细阅读模型卡**, 并按照使用指南进行配置

> 请移步**讨论区**, 大家反馈很积极, **您的问题很可能其它用户也遇到了**, 目前所有技术问题已经全部有详细解答

> 如果找不到已有的解决方案, 请随时新建讨论或Issue, 我们都会尽快回复😀

---

## 目标硬件环境

- **16GB 消费级显卡**（安全余量 2GB）——没有使用 NVFP4 量化, 无需最新的(Blackwell架构)显卡也可以正常运行
- **32GB 内存**（安全余量 10GB）
- **NVMe 固态硬盘**——理论上我们的权重不会卸载到磁盘, 但仍推荐固态

## 使用说明

本量化为**质量保守型**, 旨在保画质而非通过量化提速(尽管如此, ComfyUI会自动处理ConvRot INT8的层, 使用w8a8提供局部的2x加速, 我们的权重端到端提供相对原生BF16的约20%加速). 推荐的基础加速工作流也是经实测对精度损失肉眼难辨的保守型加速（**2.2x**）

我们的量化体积经过规划, **不会有权重卸载到磁盘上**, 在如上的硬件条件下, 可获得**接近原生 BF16 的高精度体验**

尽管我们完全支持最高画质的 15s 视频生成, 但在 16GB 消费级显卡的算力限制下, 这会带来约**2 小时/条**的生成耗时（以 5070Ti 为例）, 即使使用了我们的基础加速工作流, 也需要 **50–60 分钟/条**

因此推荐使用 **960×544 及以下分辨率 + 10s 及以下时长**的设置进行生成和快速迭代（预估可接受的生成耗时为**最多约 10 分钟/条**）

请根据您自身的使用情况和对单条视频生成耗时的需求调整合适的分辨率和时长组合

## 快速开始

| 生成模式 | 需要下载的 DiT | 配套基础加速工作流(可选) |
|---|---|---|
| **Ref2VA**（参考图模式） | `diffusion_models/minimax_h3_ref2va_dit_16g.safetensors`(原`minimax_h3_dit_16g.safetensors`) | `workflow_ref2va_fast.json` |
| **FL2VA**（首尾帧模式） | `diffusion_models/minimax_h3_fl2va_dit_16g.safetensors` | `workflow_fl2va_fast.json` |

1. 根据上方表格选择所需模式, 只下载对应的一个 DiT 权重(除非您想两个都试试); `text_encoders/` 和 `vae/` 为两种模式共用
2. 将下载的 `diffusion_models/`, `text_encoders/`, `vae/` 三个目录原样并入 `ComfyUI/models/`
3.  **（可选）** 通过我们的基础加速工作流一站式启动——Ref2VA 使用 `workflow_ref2va_fast.json`, FL2VA 使用 `workflow_fl2va_fast.json`

环境：ComfyUI ≥ 0.31, PyTorch cu130, 如果想使用我们的加速工作流, 还需下载 [ComfyUI-sol-attn](https://github.com/Saganaki22/ComfyUI-sol-attn) 自定义节点

## 文件

| 文件 | 大小 | 内容 |
|---|---|---|
| `diffusion_models/minimax_h3_ref2va_dit_16g.safetensors` | 26.5 GB | Ref2VA DiT 主模型 |
| `diffusion_models/minimax_h3_fl2va_dit_16g.safetensors` | 26.5 GB | FL2VA DiT 主模型 |
| `text_encoders/qwen3vl_text_encoder.safetensors` | 30.6 GB | Qwen3-VL 文本/图像编码器, 量化精度损失小于1% |
| `vae/minimax_h3_video_vae_fp16.safetensors` | 4.9 GB | 视频 VAE |
| `vae/minimax_h3_audio_vae_fp32.safetensors` | 0.6 GB | 音频 VAE |
| `workflow_ref2va_fast.json` | — | 推荐工作流（可选, 参考图生视频, 加速已配置） |
| `workflow_fl2va_fast.json` | — | 推荐工作流（可选, 首尾帧生视频, 加速已配置） |

## 常见量化版比较

指标是池化 relative L2（越低越好）, 速度是无其他加速手段下的, 权重原生提供的加速. Ref2VA 和 FL2VA 分别以对应任务的官方 BF16 权重为基准

> 除了综合视频/音频误差, 我们还着重优化了最大单点误差以及不同输入, 时间步之间的误差波动, 以 FL2VA 为例, 相比全层 INT8 ConvRot：
>
> 1. 视频/音频最大单点误差由 **13.99% / 6.93%** 降至 **6.81% / 5.99%**, 分别降低 **51.3% / 13.6%**
> 2. 视频/音频单点误差方差由 **9.48 / 1.30** 降至 **2.34 / 1.06**, 分别降低 **75.3% / 18.5%**
> 
> 多步生成会将前一步的偏差带入后续计算, 因此, 使用我们的权重时, 生成轨迹更不容易被某一步的量化误差尖峰带偏, 出品更加稳定, 也更不容易出现明显劣化的次品

### Ref2VA

| 方案 | 体积 | 视频误差 | 音频误差 | 说明 | 速度(估计) |
|---|---|---:|---:|---|---|
| 官方 BF16 原版 | 61.7 GB | 基准 | 基准 | 适用于算力充裕的环境, 例如有5090/Pro 6000或更好的显卡 | 1.0x |
| **本仓库 Ref2VA** | 26.5 GB | **2.42%** （cos 0.99971） | **4.23%** （cos 0.99911） | 本仓库目标硬件条件下最优 | 1.2x |
| 全层 INT8 ConvRot（官方 pruned int8 同配方） | 21 GB | 3.25% | 6.05% | 广泛适用 | 1.4x |
| 全层 NVFP4（社区 ~11.7G 档同规格） | 11.7 GB | 14.1% | 23.0% | 适用于硬件更受限的环境 | 仅对于50系显卡更快, 其余反而更慢 |
| 全层 INT4 ConvRot（社区 W4A4 档同规格） | 9.0 GB | 21.2% | 41.8% | 适用于硬件极端受限的环境 | 20/30/40系更快, 50系仍约等于INT8档(1.4x) |

### FL2VA

| 方案 | 体积 | 视频误差 | 音频误差 | 说明 | 速度(估计) |
|---|---|---:|---:|---|---|
| 官方 BF16 原版 | 61.7 GB | 基准 | 基准 | 适用于算力充裕的环境, 例如有5090/Pro 6000或更好的显卡 | 1.0x |
| **本仓库 FL2VA** | 26.5 GB | **2.92%** | **3.80%** | 本仓库目标硬件条件下最优 | 1.2x |
| 全层 INT8 ConvRot（官方 pruned int8 同配方） | 21 GB | 3.99% | 3.93% | 广泛适用 | 1.4x |
| 全层 NVFP4（社区 ~11.7G 档同规格） | 11.7 GB | 17.33% | 26.64% | 适用于硬件更受限的环境 | 仅对于50系显卡更快, 其余反而更慢 |
| 全层 INT4 ConvRot（社区 W4A4 档同规格） | 9.0 GB | 25.44% | 45.14% | 适用于硬件极端受限的环境 | 20/30/40系更快, 50系仍约等于INT8档(1.4x) |

## 速度

时长和分辨率的影响都是**超线性**的：token 数随时长/画幅线性增长, 耗时按 **token^1.48** 增长（实测拟合）

**时长翻倍约 2.7 倍耗时**——出一条 15 秒样片的时间够出五条 5 秒样片. 所以调参抽卡建议用 **960×544 + 5 秒短片**（视您实际情况而定）, 满意后再上原生分辨率出正片

完全支持自行配置的 LoRA 加速节点
