---
title: Qwen3.8-27B-NInfer-wwt
canonical_url: "https://www.modelscope.cn/models/wangcanace/Qwen3.8-27B-NInfer-wwt"
md_url: "https://www.modelscope.cn/models/wangcanace/Qwen3.8-27B-NInfer-wwt.md"
repository: wangcanace/Qwen3.8-27B-NInfer-wwt
chinese_name: "Qwen3.8-27B NInfer 专用模型"
last_updated: 2026-09-17
license: apache-2.0
pipeline_tag: image-text-to-text
tasks:
  - image-text-to-text
base_model:
  - Qwen/Qwen3.8-27B
base_model_relation: quantized
downloads: 28
stars: 7
tags:
  - ninfer
  - qwen3.8
  - multimodal
  - conversational
  - cuda
  - rtx-4090
---

# Qwen3.8-27B-NInfer-wwt

> Qwen3.8-27B-NInfer-wwt - wangcanace 在 ModelScope 开源的模型。Qwen3.8-27B groupwise-int .ninfer 构件（RTX 4090 适配，单文件 16.96GiB）

wangcanace/Qwen3.8-27B-NInfer-wwt 是 ModelScope 魔搭社区上的image-text-to-text模型，采用 apache-2.0 许可，基于 Qwen/Qwen3.8-27B 构建。

- **Repository**: wangcanace/Qwen3.8-27B-NInfer-wwt
- **License**: apache-2.0
- **Tasks**: image-text-to-text
- **Base model**: Qwen/Qwen3.8-27B
- **Tags**: ninfer, qwen3.8, multimodal, conversational, cuda, rtx-4090
- **Downloads**: 28
- **Stars**: 7
- **Last updated**: 2026-09-17

Source: https://www.modelscope.cn/models/wangcanace/Qwen3.8-27B-NInfer-wwt

---

# Qwen3.8-27B for NInfer (RTX 4090 / sm_89)

> **本仓库是 NInfer 专用 `.ninfer` 构件，不是 vLLM/GGUF/Transformers 权重。**
> 只能用 [NInfer](https://github.com/charlesarcher/ninfer-4090) 运行时加载。
> 适配层 / 补丁仓库（作者维护）：[IamWWT/ninfer-4090-fix](https://github.com/IamWWT/ninfer-4090-fix)

## Artifact

| 字段 | 值 |
|---|---|
| 文件 | `qwen3_8_27b.ninfer` |
| 大小 | 18,210,531,328 bytes（约 16.96 GiB） |
| SHA-256 | `eec39564993d6e9c7d5e383382a760f093465c9d163ec9a1bd6b80199514bf3e` |
| 模型 | Qwen3.8-27B |
| 权重布局 | `groupwise-int` |
| NInfer target | `qwen3_8_27b` |
| recipe | `qwen3_8_27b-v1` |
| 目标 GPU | NVIDIA RTX 4090（sm_89） |

## 校验

```bash
printf '%s  %s\n' \
  'eec39564993d6e9c7d5e383382a760f093465c9d163ec9a1bd6b80199514bf3e' \
  'qwen3_8_27b.ninfer' | sha256sum --check
```

## 相关仓库与补丁

- 适配层仓库（作者）：**https://github.com/IamWWT/ninfer-4090-fix**
  包含构建/运行脚本（`scripts/`）、配置模板（`configs/`）、本构件的构建与验证记录（`docs/`、`results/`），以及下述补丁。
- 上游运行时仓库：[charlesarcher/ninfer-4090](https://github.com/charlesarcher/ninfer-4090)，分支 `feat/rtx-4090-sm89-native`，基线 commit `264f42bfe049f543f7431009de57b29f8ca401d3`。

### 补丁（相对上游 commit `264f42b`）

补丁目录：https://github.com/IamWWT/ninfer-4090-fix/tree/master/patches
补丁说明（含背景、验证与用法）：https://github.com/IamWWT/ninfer-4090-fix/blob/master/patches/README.md

| 补丁 | 作用 | 原始文件 |
|---|---|---|
| `0001-tool-call-parser-compat-im-start-and-partial-recovery.patch` | 工具调用解析兼容 `<tool_call>` 前缀；坏块不再导致整段 fallback（有效兄弟块保留） | [raw](https://github.com/IamWWT/ninfer-4090-fix/raw/master/patches/0001-tool-call-parser-compat-im-start-and-partial-recovery.patch) |
| `0002-serve-max-input-tokens-hard-limit.patch` | `ninfer-serve --max-input-tokens <N>` 输入阶段硬限制，超限提前返回 `400 context_length_exceeded`，避免超长 prefill 中途失败 | [raw](https://github.com/IamWWT/ninfer-4090-fix/raw/master/patches/0002-serve-max-input-tokens-hard-limit.patch) |

在上游仓库克隆中应用（需重新构建 `ninfer-serve` 并重启服务后生效）：

```bash
git apply --check <patch 文件>   # 先干跑校验
git apply <patch 文件>
```

## 加载与运行（NInfer）

```bash
# CLI
ninfer qwen3_8_27b.ninfer \
  --prompt "用三句话解释 prefill 和 decode 的区别。" \
  --max-context 16384 --max-new 128 \
  --spec mtp --draft-tokens 3 --lm-head-draft

# HTTP 服务（OpenAI 兼容）
ninfer-serve qwen3_8_27b.ninfer \
  --host 0.0.0.0 --port 8881 --vision \
  --max-context 369144 --kv-capacity 369144 --kv-dtype rk2v4-e8 \
  --kv-managed --spec mtp --draft-tokens 4 --max-concurrency 1 \
  --default-max-tokens 192000 --max-input-tokens 167236
```

- OpenAI Base URL：`http://<host>:8881/v1`
- 模型名：`qwen3.8-27b`
- 支持文本、图片、多模态、MTP 投机解码、thinking/reasoning

## 一张卡能跑什么（支持矩阵与历史实测）

> 测试环境：RTX 4090 24GB（sm_89）· i9-13900K · 94GB 内存 · Driver 580.178.04 / CUDA 12.8 · 单卡单后端。
> **本构件要求 RTX 4090（24GB）**：上游运行时可为 3090（sm_86）编译，但本构件与下列数据只适用 4090；20.4GB 的 DFlash2 构件是 RTX 5090（sm_120a）专线，不可混用。

| 能力 | 单卡 4090 支持 | 说明 |
|---|---|---|
| 文本生成 | ✅ | CLI + HTTP（OpenAI/Anthropic 兼容，端口 8881） |
| 图片问答 | ✅ | 启动加 `--vision`；视频未验证 |
| 工具调用 | ✅ | 需配合 0001 补丁（见上文"相关仓库与补丁"） |
| MTP 投机解码 | ✅ | `--spec mtp --draft-tokens 3~4`，实测接受率 52%–88% |
| thinking/reasoning | ✅ | 按请求选 `reasoning_effort`：none/low/medium/xhigh |
| 上下文长度 | ✅ | 纯显存上限 **380K**；开 `--kv-managed`（KV 溢出内存）到 **378144** |
| 多卡 / GGUF / 其它权重 | ❌ | 单卡设计，仅加载 `.ninfer` |

### 历史实测要点（全部 4090 单卡）

- **纯显存（无 `--kv-managed`）上下文上限：380K tokens**（视觉开、24GB 显存占满后仅剩 249.81 MiB）；381K 起启动失败。**推荐安全值 350K**（留 551 MiB 余量）。
- **decode 速度**：短输入 ~67 tok/s；100K 输入 ~52；160K 输入 ~49；367K 输入 ~50.5（managed 模式）。
- **prefill**：~2000 tok/s（1K 输入）→ ~1280 tok/s（160K 输入）；TTFT 从 0.5s 线性升到 125s。
- **长输入/超限**：200,063 token 输入 ✅；367,558 token + 8 输出 ✅；超过 `--max-input-tokens` 在输入阶段即返回标准 `400 context_length_exceeded`（不浪费 prefill）。
- **权重加载**：16.62 GiB，约 2.7–3.8 s。
- **显存**：378K managed 配置启动后显存基本占满（headroom ≈ 0），单卡必须单后端、单并发。

## 怎么配置（建议）

| 场景 | 推荐配置 | 说明 |
|---|---|---|
| **长上下文 + 长输出**（代码/长文档，输入 100K+、输出到 190K） | 上节"加载与运行"的默认命令：`--max-context 378144 --kv-capacity 378144 --kv-managed --max-input-tokens 167236 --default-max-tokens 192000` | 单卡能容纳 200K 输入 + 190K 输出的唯一组合；要求宿主内存 ≥ 64GB（KV 溢出内存） |
| **长输入、短输出**（阅读/总结，输出 ≤ 32K） | 纯显存：`--max-context 350000 --kv-capacity 350000`（**不加** `--kv-managed`），`--default-max-tokens 32768`，`--max-input-tokens ≈ 300000` | 不占宿主内存、CUDA Graph 可用、decode 更快；显存余量 551 MiB |
| **日常对话 / 短文本** | `--max-context 32768 --kv-capacity 32768`（不加 managed） | TTFT < 0.5s，decode 65+ tok/s |
| **Agent / 工具调用密集** | 在以上基础上 `--default-max-tokens 8192`；工具调用格式不稳时按请求降 `reasoning_effort` 到 medium/low | 0001 补丁已降低坏块概率 |

通用要点：

- 保持 `--max-concurrency 1`（单卡 + MTP 已足够），不要与其他 GPU 后端（如 llama-server）同卡并存。
- 采样默认对齐 Unsloth thinking preset（xhigh / temperature 1.0 / top_p 0.95 / top_k 20）；`temperature/top_p/top_k/max_tokens/reasoning_effort` 等可按请求覆盖，**无需重启**；改上下文/KV/MTP/并发才需要重启。
- `--kv-managed` 会把 KV 溢出到宿主内存：长上下文 decode 略慢且关闭 CUDA Graph——能进纯显存就优先纯显存。
- 调小 `--max-context` 时，`--max-input-tokens` 要同步调小（≈ 上下文 − 输出预算 − 5% 余量），否则服务端输入阶段会提前拒绝请求。

## 来源与转换

- 原始基座：`Qwen/Qwen3.8-27B`（Apache-2.0）
- 转换器：`charlesarcher/ninfer-4090` 的 `tools/convert/qwen3_8_27b/convert.py`
- 量化：Q4/Q5/Q6 groupwise-int，embedding/head 保持 W8，视觉/MTP 一并打包
- 本机实测：RTX 4090 上加载 16.62 GiB，短请求 decode 90~113 tok/s，367K 输入 decode 约 50 tok/s（managed 模式）

## 说明

- 该 `.ninfer` 与本仓库 README 声明的 SHA 一致，属确定性转换产物；
- Linux 版无 Windows DirectStorage/D3D12/WDDM 能力，性能不可照搬 Windows 数据；
- 新版 DFlash2 artifact（20.4GB / sm_120a）面向 RTX 5090，与本 sm_89 构件不同，勿混用。
