---
title: Qwen3.8-27B-lynn-DF2-ninfer
canonical_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-DF2-ninfer"
md_url: "https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-DF2-ninfer.md"
repository: mrwan0410/Qwen3.8-27B-lynn-DF2-ninfer
chinese_name: "EfficientThink 27B · NInfer DFlash2 版"
last_updated: 2026-09-23
pipeline_tag: image-text-to-text
tasks:
  - image-text-to-text
downloads: 0
stars: 0
---

# Qwen3.8-27B-lynn-DF2-ninfer

> Qwen3.8-27B-lynn-DF2-ninfer - mrwan0410 在 ModelScope 开源的模型。Qwen3.8-27B-lynn-DF2-ninfer

- **Repository**: mrwan0410/Qwen3.8-27B-lynn-DF2-ninfer
- **Tasks**: image-text-to-text
- **Downloads**: 0
- **Stars**: 0
- **Last updated**: 2026-09-23

Source: https://www.modelscope.cn/models/mrwan0410/Qwen3.8-27B-lynn-DF2-ninfer

---

# Qwen3.8-27B-lynn-DF2-ninfer

**NInfer 引擎专用格式（.ninfer v3）**，权重来自 Lynn 老师（HuggingFace: **nerkyor**）的 **EfficientThink** 后训练模型
（Qwen3.8-27B · SFT → SimPO · Uncensored），由我在本地用 NInfer 官方转换工具转出，与作者发布权重逐文件 SHA256 对齐后转换。

> 致敬与感谢：感谢 Lynn（nerkyor）老师开放高质量的 EfficientThink 权重、完整的 BF16/DFlash2/MTP 组件与详尽的评测记录。
> 本仓库仅是"给 NInfer 引擎换一种封装格式"的搬运转换，模型能力与贡献全部归属原作者。底座为 Qwen3.8-27B（Apache-2.0）。

## 这个文件里有什么

单个 `.ninfer` 容器（**18.6 GiB**），内含三个组件：

| 组件 | 内容 | 量化 |
|---|---|---|
| text | 64 层混合骨干（48 GDN 线性注意力 + 16 全注意力），262K 原生上下文 | groupwise Q4/Q5 + Q8 词表（官方 recipe） |
| vision | 27 层视觉编码器（官方 BF16 原版） | 随主源 |
| dflash2 | 5 层滑窗草稿头 + 候选选择器（作者的 FP8 草稿，经桥接转 Q8） | Q8 |

运行时用 `--spec dflash2 --vision` 启动；未选中的组件不占显存。

## 适用硬件

- ✅ **RTX 4080 SUPER 32GB**（社区 fork，实测该组合 DFlash2 K=7 代码类 ~157–160 t/s、prefill ~1,371 t/s，INT8 KV 可满 262K）
- ✅ RTX 5090（上游官方版支持）；RTX 4090/4090D 等 sm_89 卡走对应社区 fork
- ❌ 不用于 llama.cpp / vLLM / SGLang——这是 NInfer 引擎专有格式

> 速度数字引自 4080S 社区 fork 在官方底模上的实测，微调后模型的实际接受率/速度可能略有出入。

## 三个 lynn-ninfer 仓库的区别（规划中）

| 仓库 | 主干格式 | 投机解码 | 适用 GPU | 一句话 |
|---|---|---|---|---|
| **lynn-DF2-ninfer**（本仓库） | groupwise Q4/Q5 | DFlash2 草稿头 | RTX 40 系（4080S 实测）/ 50 系 | Ada 卡首选，作者草稿头接受率高（~66–67%） |
| lynn-MTP-ninfer | groupwise Q4/Q5 | 原生 MTP 头 | 同上 | SM 多的卡（4090D/5090）上 MTP 更猛（4090D 实测 195–203） |
| lynn-NF4-ninfer | **NVFP4**（W4A4） | DFlash2 + MTP 双挂 | **仅 Blackwell**（5090 / Pro 6000，sm_120a） | FP4 tensor core 专属快路径，Ada 卡跑不了 |

## 转换与复现

```bash
python3 -m tools.convert \
  --model <作者 BF16/ 目录> \
  --recipe qwen3_8_27b \
  --source dflash2=<作者 BF16/DFlash2-FP8/> \
  --override dflash2_fp8fix.py \
  --components text,vision,dflash2 --proposal \
  --name qwen3.8-27b-lynn-df2 --device cpu \
  --out qwen3.8-27b-lynn-df2.ninfer
```

说明：作者的 DFlash2 草稿按 compressed-tensors **tensor 级** FP8 存储，NInfer 内置读取器只认 per-row，
故加了一个 20 行的小桥接（解码回 float 后按官方 Q8 目标重量化）。桥接脚本与转换报告（conversion.json）可向本仓库索取。

## 校验

```
SHA256: d6d1425c23ca3ea2f93d898d247c4df523199543c3eb6462176c0b03f62754f4
文件:   qwen3.8-27b-lynn-df2.ninfer (19,986,249,216 bytes)
```

源权重 29 个文件全部通过作者仓库 SHA256SUMS 校验后转换。

## 许可

遵循上游：EfficientThink 权重与 Qwen3.8-27B 均为 Apache-2.0。本转换产物同样以 Apache-2.0 发布。
