---
title: MOSS-TTS-v1.5-W4GPTQ-w1
canonical_url: "https://www.modelscope.cn/models/baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1"
md_url: "https://www.modelscope.cn/models/baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1.md"
repository: baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1
last_updated: 2026-09-12
license: apache-2.0
pipeline_tag: text-to-speech
tasks:
  - text-to-speech
model_type:
  - moss_tts_delay
architectures:
  - MossTTSDelayModel
base_model:
  - OpenMOSS-Team/MOSS-TTS-v1.5
base_model_relation: finetune
library_name:
  - safetensors
  - pytorch
frameworks:
  - pytorch
language:
  - zh
  - en
  - yue
  - ja
  - ko
  - de
  - fr
  - es
  - ru
  - ar
downloads: 1
stars: 0
tags:
  - text-to-speech
  - tts
  - quantized
  - int4
  - gptq
  - w4
  - moss-tts
---

# MOSS-TTS-v1.5-W4GPTQ-w1

> MOSS-TTS-v1.5-W4GPTQ-w1 - baicai1145 在 ModelScope 开源的模型。MOSS-TTS-v1.5-W4GPTQ-w1 — 独立（自包含）W4-GPTQ 量化版

baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1 是 ModelScope 魔搭社区上的text-to-speech模型，采用 apache-2.0 许可，基于 OpenMOSS-Team/MOSS-TTS-v1.5 构建。

- **Repository**: baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1
- **License**: apache-2.0
- **Tasks**: text-to-speech
- **Base model**: OpenMOSS-Team/MOSS-TTS-v1.5
- **Tags**: text-to-speech, tts, quantized, int4, gptq, w4, moss-tts
- **Downloads**: 1
- **Stars**: 0
- **Last updated**: 2026-09-12

Source: https://www.modelscope.cn/models/baicai1145/MOSS-TTS-v1.5-W4GPTQ-w1

---

# MOSS-TTS-v1.5-W4GPTQ-w1 — 独立（自包含）W4-GPTQ 量化版

**MOSS-TTS-v1.5** 的 int4 GPTQ 量化权重，**自包含单目录**：下载本目录即可推理，**不再需要 16.6 GB 的
bf16 基座检查点**。

*Standalone int4 (GPTQ) weights for MOSS-TTS-v1.5. This directory is
self-contained — the 16.6 GB bf16 base checkpoint is **not** required.
Requires the minimal inference runtime `moss_min` (this repository) and a
separate audio-codec checkpoint.*

| 项 / Item | 值 / Value |
|---|---|
| 档位 / preset | `w1` (default tier；权重由 preset `w1p` 构建 — W1 + 4 个 `down_proj` 精确 GPTQ 重量化，无新增 bf16 保护项) |
| 量化 / quantization | GPTQ, int4, group size **32**, I32 payload + BF16 scales/zeros |
| 量化投影数 / quantized projections | 216 |
| 保 bf16 / kept in bf16 | 36 projections kept bf16 — v_proj (36 layers) |
| 权重文件 / weight file | `quantized.safetensors` — 7.11 GiB, 679 tensors |
| sha256 | `9108bc324981012c736fcbc147eebb34e6b9c4a7c413b8499b425a466b2aacbe` |
| 导出时间 / exported | 2026-09-11T17:55:11Z (torch 2.9.1+cu129) |
| 基座 / base | [OpenMOSS-Team/MOSS-TTS-v1.5](https://huggingface.co/OpenMOSS-Team/MOSS-TTS-v1.5) |

---

## 1. 这是什么

这是 MOSS-TTS-v1.5（Qwen3-8B 骨干 + 32 路音频码本 + 33 个输出头）的**逐层 GPTQ 校准量化**版本：
骨干 36 层的 `q/k/o/gate/up/down` 六个投影被压成 int4（group 32），**最敏感的
`v_proj` 全 36 层保留 bf16（与 W1 完全相同的保护项集合，本档未新增任何 bf16 张量）**；嵌入、输出头、各类归一化全部保持 bf16。

推理内核与未量化的 `--quant w4` 档**完全相同**（`torch._weight_int4pack_mm`，
`inner_k_tiles=8`，offset-binary nibble 打包），因此量化只改变权重数值、不引入任何运行时开销。

## 2. 量化方法

* **校准语料**：6 层分层设计（纯文本 / 语流 / 边界 / 长静音 / 收尾 / 深段），约 6200 个位置，
  由 bf16 模型自回归生成，覆盖 RTN 失效的病灶区。
* **GPTQ 核心**：经典逐列（block 128）惰性批更新，`H = XᵀX` 带 0.1% 阻尼的 Cholesky 逆
  （Hessian 数值秩亏，零阻尼不可解）；误差按列补偿。
* **逐层顺序量化**：第 L 层的 Hessian 由"已量化"的前 L−1 层产生的激活统计，
  使校准分布与部署分布一致（error-propagated）。
* **保护项选择**：由三路独立证据（校准相对误差排名、held-out 相对误差、llama.cpp Q4_K_M 配方）
  取交集 → `v_proj` 全 36 层（本档 w1）。
* **保护项的第二批**：本档**不新增** bf16 保护项：与 W1 同为 151.0 M bf16 参数、同体积、同速度档（81.55 步/s、8.28 GiB）。提升来自对 W1 基线中承担 95.6% 绝对局部平方误差的4 个张量（`down_proj` 第 35/6/16/33 层，分别占 73.6%/15.6%/4.2%/2.2%）改用**精确 GPTQ**（`block_size = K`，不做块近似）在 W1 自身校准语料上重量化；其余 212 个量化项与 36 个 bf16 保护项与 W1 **逐位相同**。消除块近似使这 4 个张量的“按列误差补偿”完整传播，实测把十语言 pooled top-25 cover 从 99.10% 提到 99.52%（+0.441 pt，95% CI [+0.385,+0.504]，p>0=1.000），mean|Δlogit| 从 0.820 降到 0.631，且**十种语言全部改善**、最弱语言（粤语）从 98.43% 提到 99.12%。
* **细分组**：g32 是内核支持的最细粒度（g16/g8 内核报错）。

## 3. 指标（A10G-24G, torch 2.9.1+cu129；数据源 w1 档门禁实测）

| 指标 / Metric | 本档 / This preset | bf16 参考 / Reference |
|---|---|---|
| **音频 top-25 命中率（tie-robust `cover`）**：主指标，40 步 / 1280 位置 | **98.64%** | 100% |
| 音频 top-25 命中率（CUDA topk 口径，原门禁口径） | 90.08% | 100% |
| **语言分层 tie-robust `cover` 增益**（4 语言 × 4 段，相对 W1：g32+v_proj 保护） | **+0.396 pt** | — |
| **情感文本 tie-robust `cover` 增益**（6 项，同样相对 W1） | **+0.455 pt** | — |
| 音频 logit 平均绝对偏差 mean\|Δ\|（越低越好） | **0.3542** | 0.0006 |
| 文本 argmax 一致率 | 100.0% | 100% |
| 解码速度（稳态） | **81.5 步/s** | ~36 步/s |
| 显存驻留峰值 | **8.28 GiB** | ~17.0 GiB |
| runaway（12 种子长文本，看门狗关闭） | **0/12** | 0/12（配看门狗） |
| 权重体积 | 7.11 GiB | 16.6 GiB |

GPTQ 档在同 12 个种子上修掉了 RTN int4 的近静音 runaway（RTN：3/12），
长静音 / 收尾段的相对误差约为 RTN g128 的 1/50。

### 3.1 关于 top-25 数字的口径（重要）

**音频 top-25 命中率高度依赖并列（tie）的打破方式，报数必须注明口径。**
参考分布上 63.9% 的声道 top1==top2、20.1% 的声道有 ≥25 个值并列在最大值；
在这种分布上"参考 argmax 是否落在候选的前 25 大之内"这句话本身是不唯一的：
同一份 logits，仅改并列打破方式，分数可以从 80.2% 变到 100%（一个与参考**逐位相同**的
模型也会被打成 86.8%）。本卡因此同时报两个口径：

* **tie-robust `cover`**（推荐）：取候选的前 25 大**集合**，看参考 argmax 的值是否 ≥ 第 25 大的值
  —— 并列一律算命中，与任何排序实现无关，可复现、可跨实现比较；
* **CUDA `topk` 口径**：历史上的门禁口径（`torch.topk` 在 CUDA 上的并列顺序），
  与旧版本报告可直接对照。

两个口径的方向一致；**幅度不可跨口径比较**（tie 主导时旧口径会把同等真实增益放大约 7 倍）。
评估方法、并列证据与全部口径对照见仓库内 `gencheck-1-lang-emo.md`。

### 跨语言验证 / Cross-language validation

基座声明支持 31 种语言；本档已在其中 **10 种语言 × 4 条轨迹 = 40 条轨迹**上完成 teacher-forced
跨语言验收（zh / en / fr / ja / de / ko / yue / ru / es / ar，覆盖**拉丁、汉字、西里尔、阿拉伯、
韩文**五种文字系统）。语料与口径与既有发布**完全一致**（同 40 条轨迹、同一套 tie-robust `cover` /
mean\|Δlogit\| 口径），仅把本档这一侧的数字更新如下（基线为发布档 `w1`）：

| 指标（口径） | W1 基线 | **本档 w1p** | 变化 |
|---|---:|---:|---:|
| golden prompt，tie-robust `cover`（40 步 / 1280 位置） | 98.32% | **98.64%** | +0.33 pt |
| 十语言 + 情感 pooled `cover`（全 54 项电池，位置加权） | 99.10% | **99.52%** | +0.42 pt |
| 十语言 pooled `cover`（10 语言等权，40 轨迹） | 99.13% | **99.56%** | +0.43 pt |
| 最弱语言 / weakest language（粤语 yue，位置加权） | 98.43% | **99.12%** | +0.70 pt |
| pooled mean\|Δlogit\|（全 54 项电池，越低越好） | 0.820 | **0.631** | −0.19 |
| golden prompt mean\|Δlogit\|（越低越好） | 0.389 | **0.354** | −0.04 |
| 轨迹一致改善 / trajectories improving（40 条语言轨迹） | — | **cover 40/40 上升，mean\|Δ\| 40/40 下降** | — |

逐语言明细（位置加权单元；cover 单位 %，mean\|Δlogit\| 越低越好）：

| 语言 | W1 cover | 本档 cover | Δ | 本档 mean\|Δ\| | Δ |
|---|---:|---:|---:|---:|---:|
| ar | 99.108 | 99.477 | +0.369 | 0.7493 | -0.1771 |
| de | 99.067 | 99.474 | +0.407 | 0.6073 | -0.1460 |
| en | 99.525 | 99.801 | +0.276 | 0.4230 | -0.1271 |
| es | 99.190 | 99.520 | +0.329 | 0.6558 | -0.2767 |
| fr | 99.464 | 99.818 | +0.354 | 0.5559 | -0.1921 |
| ja | 99.350 | 99.736 | +0.386 | 0.6160 | -0.2312 |
| ko | 99.019 | 99.436 | +0.417 | 0.6863 | -0.1948 |
| ru | 99.046 | 99.426 | +0.381 | 0.6310 | -0.2692 |
| yue | 98.425 | 99.121 | +0.695 | 0.7544 | -0.2617 |
| zh | 99.174 | 99.795 | +0.621 | 0.6213 | -0.2027 |

**统计**：十语言等权 pooled `cover` 增益 **+0.425 pt**，配对轨迹自助（每种语言内重采样 4 条轨迹，
4000 次）95% CI **[+0.395, +0.456]**，p(Δ>0)=1.000；
mean\|Δlogit\| 变化 **-0.2108**，95% CI **[-0.2433, -0.1816]**。
情感材料（6+6 项）tie-robust `cover` 增益 **+0.455 pt**。
runaway **0/12**（en4 长文本 12 种子、看门狗关闭），
稳态 **81.5 步/s**、驻留显存 **8.28 GiB**（与 W1 同档：
151.0 M bf16 参数、同体积、同速度）。

*Cross-language validation: 10 languages x 4 trajectories = 40 trajectories
(zh/en/fr/ja/de/ko/yue/ru/es/ar, spanning Latin, Han, Cyrillic, Arabic and Hangul
scripts).  The corpus and the conventions are identical to the previously
published validation (the same 40 trajectories, tie-robust `cover` and
mean |Deltalogit|); only this preset's side of the numbers is updated, against the
released `w1` as baseline.  Golden-prompt tie-robust `cover` 98.64%
(W1 98.32%); full 54-item battery pooled `cover` 99.52%
(W1 99.10%) with pooled mean |Deltalogit| 0.631
(W1 0.820); ten-language pooled `cover` (equal language weight)
99.56% (W1 99.13%), gain **+0.425 pt**
(paired trajectory bootstrap over the 40 trajectories, 95 % CI
[+0.395, +0.456], p>0=1.000); the weakest language
(yue) improves from 98.43% to 99.12%.  Tie-robust `cover` rises on
**40/40** trajectories and mean |Deltalogit| falls on **40/40**.
Runaway **0/12** on the 12-seed long-form battery (watchdog off), at
81.5 steps/s and 8.28 GiB resident VRAM.*

## 4. 使用方法

```bash
# 1) 运行时依赖（仅 4 个第三方包）
pip install torch --index-url https://download.pytorch.org/whl/cu128   # torch>=2.9, CUDA 12.x
pip install numpy soundfile pyyaml

# 2) 本目录（TTS 主模型）
hf download <用户名>/MOSS-TTS-v1.5-W4GPTQ-w1 --local-dir ./MOSS-TTS-v1.5-W4GPTQ-w1
# 或 ModelScope 集合 OpenMOSS-Team/MOSS-TTS；音频 codec 是**独立**检查点，需另行下载：
hf download OpenMOSS-Team/MOSS-Audio-Tokenizer --local-dir ./MOSS-Audio-Tokenizer

# 3) 推理（--model-dir 指向本目录；目录内含 meta.json 时会自动识别量化档）
python -m moss_min "你好，欢迎收听这段试音。" -o out.wav \
    --model-dir ./MOSS-TTS-v1.5-W4GPTQ-w1 \
    --codec-dir ./MOSS-Audio-Tokenizer
# 等价显式写法：
python -m moss_min "Hello, this is a test." -o out_en.wav --language English \
    --model-dir ./MOSS-TTS-v1.5-W4GPTQ-w1 --quant w4gptq
```

Python API：

```python
from moss_min.export import load_standalone_model       # 装配（自动读 meta.json）
from moss_min.fast import generate_fast
from moss_min.prompt import build_tts_prompt

model, fast = load_standalone_model("./MOSS-TTS-v1.5-W4GPTQ-w1")   # (MossTTSModel, GptqMossTTS)
prompt = build_tts_prompt("你好，欢迎收听。")
res = generate_fast(fast, prompt, seed=1234)              # 之后交给 moss_min.codec 解码
```

## 5. 目录内容 / Files

| 文件 / File | 说明 / Description |
|---|---|
| `quantized.safetensors` | int4 打包权重（`layers.{i}.{proj}.q` / `.qsz`）+ 全部保 bf16 张量（沿用原检查点 key 名） |
| `meta.json` | 格式版本、量化参数、逐项 group size、bf16 保留清单、基座溯源（含 sha256）、指标 |
| `README.md` | 本模型卡 |
| `config.json`, `configuration*.py`, `modeling_moss_tts.py`, `processing_moss_tts.py` | 原模型配置与参考实现（provenance / 互操作） |
| `tokenizer.json`, `vocab.json`, `merges.txt`, `tokenizer_config.json`, `added_tokens.json`, `special_tokens_map.json`, `chat_template.jinja` | 分词器全套（`moss_min` 只需要 `vocab.json`/`merges.txt`/`tokenizer.json`） |
| `LICENSE` | Apache-2.0（继承自基座） |

## 6. 限制声明 / Limitations

* **量化质量权衡**：int4 不是 bf16 的位级等价物。音频 top-25 命中率
  98.64%（tie-robust 口径）／90.08%（CUDA topk 口径，见 §3.1），
  主观质量接近但不能等同于 bf16；对音质极端敏感的场景请使用未量化权重。
* **速度余量很窄**：稳态 81.5 步/s，距离本项目 78 步/s 的硬底线只有约 0.6%。
  再加任何 bf16 保护项（每 4 个投影约 −3.8%）会跌破底线，需先重新验收速度。
* **仅 CUDA**：int4 kernel（`_weight_int4pack_mm`）与 CUDA Graph 路径要求 NVIDIA GPU
  （Ampere/sm_80 及以上）；没有 CPU 回退。
* **codec 不在本目录**：音频解码器 MOSS-Audio-Tokenizer(1.6B) 是独立检查点（~3.6 GB），
  需另行下载；仅下载本目录无法出声。
* **看门狗默认开启**：连续低能量超过 ~5.12 s（或超长段落尾部已静音）会强制收尾，
  以避免失控生成；需要长静音时可调大 `--watchdog-silence-frames` 或 `--no-watchdog`。
* **Windows 未实测**：仅在 Linux + A10G-24G（torch 2.9.1, CUDA 12.x）上验证；
  Windows/WSL 与其它 GPU 架构未做验收测试。
* **语言覆盖**：基座声明支持 31 种语言，本量化版已在其中 **10 种**上完成跨语言验收（见上文“跨语言验证”小节），其余 21 种未逐一验证。
* **许可证继承**：本量化产物继承基座 Apache-2.0，署名 OpenMOSS-Team；商用请遵循原模型许可与使用条款。

## 7. 基座溯源 / Provenance

| 基座分片 / Base shard | 大小 | sha256 |
|---|---|---|
| `model-00001-of-00004.safetensors` | 4.59 GiB | `749b82d07cebea77…` |
| `model-00002-of-00004.safetensors` | 4.58 GiB | `4d891c8adb8bf9c1…` |
| `model-00003-of-00004.safetensors` | 4.64 GiB | `111013e05174e677…` |
| `model-00004-of-00004.safetensors` | 2.00 GiB | `951ee88cf85996ee…` |

* 基座仓库 / base repo：[OpenMOSS-Team/MOSS-TTS-v1.5](https://huggingface.co/OpenMOSS-Team/MOSS-TTS-v1.5)
* 本地导出源 / exported from：`models/MOSS-TTS-v1.5`
* 权重文件 sha256：`9108bc324981012c736fcbc147eebb34e6b9c4a7c413b8499b425a466b2aacbe`
* 导出时间 / exported at：2026-09-11T17:55:11Z（A10G-24G, torch 2.9.1+cu129）
* 量化状态文件 / GPTQ state：`w1p.pt`（sha256 `24cd5765b36c3a2cf19c23e371d95f3648b840f3e8413d5828aec25545029145`）
* 复现脚本 / regeneration：`python -m moss_min.export --model-dir models/MOSS-TTS-v1.5 --gptq-state w1p.pt --out <dir> --preset w1`

## 8. English summary

This is a **self-contained int4 GPTQ quantization** of
[MOSS-TTS-v1.5](https://huggingface.co/OpenMOSS-Team/MOSS-TTS-v1.5) (Qwen3-8B backbone + 32 audio
codebooks + 33 heads, 31 languages). The six backbone projections per layer
(`q/k/o/gate/up/down`) are int4 (group 32, GPTQ with six-stratum
calibration and error-propagated sequential quantization) while the most
sensitive projections (36 projections kept bf16 — v_proj (36 layers)) stay bf16; embeddings, heads and norms
are bf16. Runtime kernel is identical to the non-GPTQ `w4` tier, so the
quantization costs nothing at inference.

Measured on an A10G-24G with torch 2.9.1+cu129: audio top-25 membership
**98.64%** (tie-robust `cover`) / **90.08%** (CUDA topk convention,
see §3.1 — the two are not comparable in magnitude), text argmax 100.0%,
**81.5 steps/s**, **8.28 GiB** resident VRAM, runaway **0/12**
(12 seed long-form battery, watchdog off), 7.11 GiB on disk.

Install `torch`/`numpy`/`soundfile`/`pyyaml`, download the separate
MOSS-Audio-Tokenizer codec, then:

```bash
python -m moss_min "Hello, this is a test." -o out.wav \
    --language English --model-dir <this directory>
```

Limitations: int4 quality trade-off (not bit-equivalent to bf16), CUDA-only
int4 kernel, codec checkpoint not included, run-away watchdog on by default
(~5.12 s of consecutive low-energy frames forces an audio end), validated on
Linux + A10G only (Windows untested), license inherited from the Apache-2.0
base model (attribution: OpenMOSS-Team).
