---
title: Qwen3.8-27B-lynn-NF4-ninfer
canonical_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-NF4-ninfer"
md_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-NF4-ninfer.md"
repository: mrwan0410/Qwen3.8-27B-lynn-NF4-ninfer
chinese_name: "EfficientThink 27B · NInfer NVFP4 版"
last_updated: 2026-09-23
downloads: 2
stars: 0
---

# Qwen3.8-27B-lynn-NF4-ninfer

> Qwen3.8-27B-lynn-NF4-ninfer - mrwan0410 在 ModelScope 开源的模型。Qwen3.8-27B-lynn-NF4-ninfer

- **Repository**: mrwan0410/Qwen3.8-27B-lynn-NF4-ninfer
- **Downloads**: 2
- **Stars**: 0
- **Last updated**: 2026-09-23

Source: https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-NF4-ninfer

---

# Qwen3.8-27B-lynn-NF4-ninfer

**NInfer 引擎专用格式（.ninfer v3）· NVFP4 权重版**，权重来自 Lynn 老师（HuggingFace: **nerkyor**）的 **EfficientThink** 后训练模型
（Qwen3.8-27B · SFT → SimPO · Uncensored）与作者官方发布的 **W4A4 NVFP4** 量化（ModelOpt 0.43 导出），
由我在本地用 NInfer 官方转换工具整合转出，源文件全部通过作者仓库 SHA256SUMS 校验。

> 致敬与感谢：感谢 Lynn（nerkyor）老师开放高质量的 EfficientThink 权重与 FP4/FP8/DFlash2/MTP 全套组件。
> 本仓库是"把作者的 NVFP4 量化 + BF16 视觉 + 两套投机头装进 NInfer 单容器"的转换搬运，能力与贡献全部归属原作者。
> 底座为 Qwen3.8-27B（Apache-2.0）。

## 这个文件里有什么

单个 `.ninfer` 容器，内含四个组件（运行时 `--spec` 只能选一个投机后端，未选中的不占显存）：

| 组件 | 内容 | 量化 |
|---|---|---|
| text | 64 层混合骨干（48 GDN + 16 全注意力），262K 原生上下文 | **NVFP4 W4A4**（全部 400 个投影，作者官方编码逐位导入，激活 FP4） |
| vision | 27 层视觉编码器（作者 BF16 主 shard） | 随主源 |
| dflash2 | DFlash2 草稿头（5 层） | Q8（作者 FP8 头解码重量化） |
| mtp | 原生 MTP 投机头 | Q8 |

词表嵌入 Q8、输出头 Q6（作者 lm_head 未量化，按官方 recipe 词表处理）。

## DF2 / MTP / NF4 三个仓库怎么选

| 仓库 | 主干格式 | 投机解码 | 适用 GPU | 一句话 |
|---|---|---|---|---|
| lynn-DF2-ninfer | groupwise Q4/Q5 | DFlash2 | RTX 40 系（4080S 实测 157–160 t/s）/ 50 系 | Ada 卡首选 |
| lynn-MTP-ninfer | groupwise Q4/Q5 | MTP | 同上（4090D 实测 195–203 t/s） | SM 多的 Ada 卡更划算 |
| **lynn-NF4-ninfer**（本仓库） | **NVFP4 W4A4** | **DF2 + MTP 双挂**（`--spec` 二选一） | **RTX 50 系**（5090 / Pro 6000，sm_120a） | FP4 tensor core 快路径 |

**关键区别**：NVFP4 的 W4A4 需要 Blackwell 第 5 代 tensor core 的 FP4 硬件指令，
**RTX 40 系（含 4080S/4090）没有该硬件，无法使用本文件**——Ada 卡请用 DF2/MTP 版。
Blackwell 上本文件主干权重比 groupwise 版更省显存、A4 激活路径吞吐更高。

投机头与主干格式相互独立：DFlash2/MTP 组件仍是 Q8，`--spec dflash2` 或 `--spec mtp` 启动时各取一个。

## 运行引擎（重要）

本仓库文件是 `.ninfer` **v3** 产物（NVFP4 权重需 Blackwell FP4 硬件执行）：

- **[QilinWan/Ninfer-Blackwell-Ada](https://github.com/QilinWan/Ninfer-Blackwell-Ada)**——我们维护的双架构引擎
  （sm_89 RTX 40 系 / sm_120a RTX 50 系，v3 全测试通过；本产物用其 sm_120a 路径运行）
- NInfer 官方引擎（sm_120a）同样可加载本文件

## 适用硬件与启动

- ✅ RTX 5090 / RTX PRO 6000（NVFP4 W4A4 需 Blackwell FP4 tensor core）
- ❌ RTX 40 系 / 30 系（无 FP4 硬件——请取 DF2/MTP 版，配双架构引擎在 Ada 上跑得动）
- ❌ 不用于 llama.cpp / vLLM / SGLang——NInfer 引擎专有格式

```bash
ninfer run qwen3.8-27b-lynn-nf4.ninfer --spec dflash2 --vision   # 或 --spec mtp
```

## 转换与复现

```bash
python3 -m tools.convert --model <作者 BF16/> \
  --recipe qwen3_8_27b_nvfp4 \
  --source quantized=<w4a4_ct.safetensors> \
  --source dflash2=<BF16/DFlash2-FP8> --source mtp=<FP8/mtp-bf16.safetensors> \
  --override nvfp4_lyn_all.py \
  --components text,vision,dflash2,mtp --proposal \
  --name qwen3.8-27b-lynn-nf4 --device cpu --out qwen3.8-27b-lynn-nf4.ninfer
```

说明：作者的 W4A4 是 **ModelOpt 命名**（`weight`+`weight_scale`+`weight_scale_2`+`input_scale`，
且比官方 recipe 更激进——全部 400 个投影都是 FP4，含 attention 与 GDN），与 NInfer 内置的
compressed-tensors 读取约定（`weight_packed`/`weight_global_scale=1/scale_2`/`input_global_scale`）
不一致；用了一个预处理脚本重命名+取倒数（语义已对 BF16 原值反解实测吻合），
再用 override 把 512 个投影绑定统一指到全 FP4 路线。

## 校验

```
SHA256: faf551e2c782022606e0ffd382e8d015cec574914a9476ca6007f346c4c53268
文件:   qwen3.8-27b-lynn-nf4.ninfer (19,345,900,804 bytes)
```

## 许可

遵循上游：EfficientThink 权重与 Qwen3.8-27B 均为 Apache-2.0。本转换产物同样以 Apache-2.0 发布。
