---
title: Qwen3.8-27B-lynn-MTP-ninfer
canonical_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-MTP-ninfer"
md_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-MTP-ninfer.md"
repository: mrwan0410/Qwen3.8-27B-lynn-MTP-ninfer
chinese_name: "EfficientThink 27B · NInfer MTP 版"
last_updated: 2026-09-23
pipeline_tag: image-text-to-text
tasks:
  - image-text-to-text
downloads: 0
stars: 0
---

# Qwen3.8-27B-lynn-MTP-ninfer

> Qwen3.8-27B-lynn-MTP-ninfer - mrwan0410 在 ModelScope 开源的模型。Qwen3.8-27B-lynn-MTP-ninfer

- **Repository**: mrwan0410/Qwen3.8-27B-lynn-MTP-ninfer
- **Tasks**: image-text-to-text
- **Downloads**: 0
- **Stars**: 0
- **Last updated**: 2026-09-23

Source: https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-MTP-ninfer

---

# Qwen3.8-27B-lynn-MTP-ninfer

**NInfer 引擎专用格式（.ninfer v3）**，权重来自 Lynn 老师（HuggingFace: **nerkyor**）的 **EfficientThink** 后训练模型
（Qwen3.8-27B · SFT → SimPO · Uncensored），由我在本地用 NInfer 官方转换工具转出，源权重 29 个文件全部通过作者仓库 SHA256SUMS 校验后转换。

> 致敬与感谢：感谢 Lynn（nerkyor）老师开放高质量的 EfficientThink 权重、完整的 BF16/DFlash2/MTP 组件与详尽的评测记录。
> 本仓库仅是"给 NInfer 引擎换一种封装格式"的搬运转换，模型能力与贡献全部归属原作者。底座为 Qwen3.8-27B（Apache-2.0）。

## 这个文件里有什么

单个 `.ninfer` 容器（**16.96 GiB**），内含三个组件：

| 组件 | 内容 | 量化 |
|---|---|---|
| text | 64 层混合骨干（48 GDN 线性注意力 + 16 全注意力），262K 原生上下文 | groupwise Q4/Q5 + Q8 词表（官方 recipe） |
| vision | 27 层视觉编码器（官方 BF16 原版） | 随主源 |
| mtp | 原生 MTP 投机头（作者 FP8/mtp-bf16.safetensors，15 个 BF16 张量） | Q8 |

运行时用 `--spec mtp --vision` 启动；未选中的组件不占显存。

## DF2 / MTP / NF4 三个仓库怎么选

| 仓库 | 主干格式 | 投机解码 | 适用 GPU | 一句话 |
|---|---|---|---|---|
| lynn-DF2-ninfer | groupwise Q4/Q5 | DFlash2 草稿头 | RTX 40 系（4080S 实测）/ 50 系 | Ada 卡首选，作者草稿头接受率高（~66–67%） |
| **lynn-MTP-ninfer**（本仓库） | groupwise Q4/Q5 | 原生 MTP 头 | 同上 | SM 多的卡更划算（同引擎在 4090D 实测 MTP7 达 195–203 t/s） |
| lynn-NF4-ninfer | **NVFP4**（W4A4） | DF2 + MTP 双挂 | **仅 Blackwell**（RTX 5090 / RTX PRO 6000） | FP4 tensor core 专属快路径，RTX 40 系硬件不支持 |

- 文件体积：MTP 版最小（MTP 头只有 ~0.8 GiB，DFlash2 草稿头 ~2.3 GiB）；
- 同一容器可共存多种投机后端，本仓单独出 MTP 版是为了按需下载、少占磁盘。

## 适用硬件

- ✅ **RTX 4080 SUPER 32GB**（社区 fork 引擎；同引擎在官方底模上 MTP 档实测 78+ t/s，DFlash2 档 157–160 t/s）
- ✅ RTX 5090 / RTX PRO 6000（官方引擎，NInfer sm_120a 原生支持）
- ✅ RTX 4090 / 4090D 等 sm_89 卡走对应社区 fork
- ❌ 不用于 llama.cpp / vLLM / SGLang——这是 NInfer 引擎专有格式

## 转换与复现

```bash
python3 -m tools.convert \
  --model <作者 BF16/ 目录> \
  --recipe qwen3_8_27b \
  --source mtp=<作者 FP8/mtp-bf16.safetensors> \
  --override mtp_bridge.py \
  --components text,vision,mtp --proposal \
  --name qwen3.8-27b-lynn-mtp --device cpu \
  --out qwen3.8-27b-lynn-mtp.ninfer
```

说明：作者 BF16 主 shard 不含 MTP 张量（官方 recipe 假设 MTP 与主源同源），
故用一个 15 行的小 override 把 mtp/* 逻辑参数的源指向作者的 mtp-bf16.safetensors。

## 校验

```
SHA256: 7970ac0f6263f666ff21bc0ec891ec78976a2fbbc33281aefce6b147ebe73958
文件:   qwen3.8-27b-lynn-mtp.ninfer (18,210,703,360 bytes)
```

## 许可

遵循上游：EfficientThink 权重与 Qwen3.8-27B 均为 Apache-2.0。本转换产物同样以 Apache-2.0 发布。
