---
title: Eagle3-Qwen3-8B-zh
canonical_url: "https://www.modelscope.cn/models/Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh"
md_url: "https://www.modelscope.cn/models/Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh.md"
repository: Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh
last_updated: 2025-12-15
license: "Apache License 2.0"
pipeline_tag: text-generation
tasks:
  - text-generation
model_type:
  - llama
architectures:
  - LlamaForCausalLMEagle3
base_model:
  - Qwen/Qwen3-8B
base_model_relation: adapter
library_name:
  - pytorch
frameworks:
  - Pytorch
inference_backends:
  - "deploy_task text"
  - "sglang 0.5.2"
downloads: 64
stars: 2
tags:
  - speculative-decoding
  - eagle
---

# Eagle3-Qwen3-8B-zh

> Eagle3-Qwen3-8B-zh - Zjcxy-SmartAI 在 ModelScope 开源的模型。Eagle3-Qwen3-8B-zh 基于开源的 Qwen3-8B 模型再训练所得，可用于 Eagle-3 投机解码算法，具备中/英文本加速能力，旨在加速语言大模型在解码阶段的推理速度。该模型使用中英文混合数据集进行训练，提高了中文接受率，适用于处理中/英文本的推理任务。

Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh 是 ModelScope 魔搭社区上的text-generation模型，采用 Apache License 2.0 许可，基于 Qwen/Qwen3-8B 构建，可用 deploy_task text、sglang 0.5.2 部署。

- **Repository**: Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh
- **License**: Apache License 2.0
- **Tasks**: text-generation
- **Base model**: Qwen/Qwen3-8B
- **Inference backends**: deploy_task text, sglang 0.5.2
- **Tags**: speculative-decoding, eagle
- **Downloads**: 64
- **Stars**: 2
- **Last updated**: 2025-12-15

Source: https://www.modelscope.cn/models/Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh

---

# Eagle3-Qwen3-8B-zh

## 💡 介绍

**Eagle3-Qwen3-8B-zh** 基于开源的 [**Qwen3-8B**](https://www.modelscope.cn/models/Qwen/Qwen3-8B) 模型再训练所得，可用于 Eagle-3 投机解码算法，具备**中/英文本加速能力**，旨在加速语言大模型在解码阶段的推理速度。该模型使用中英文混合数据集进行训练，提高了中文接受率，适用于处理中/英文本的推理任务。

为降低训练成本，我们基于 Eagle 和 SpecForge 框架，搭建了一套面向消费级显卡和一体机生产环境的 Eagle-3 训练工具。其可在 NVIDIA RTX 4090 一体机上运行端到端的训练流程，且优化了运行效率，约用**3天时间**完成此次训练。

值得说明的是，我们用约 **135k** 条数据训练所得的草稿模型，其加速性能优于当前已开源的同类权重（英文加速表现略优，中文加速显著提升）。经实测，在单卡 NVIDIA RTX 4090 上，MT-bench(-zh)上单并发输出吞吐**中英文均达 🚀 2.5 倍**的解码加速。

> 注：项目内配置文件基于 SGLang 框架进行配置，如若用于 vLLM 等其他框架，请自行修改相关配置。

## ⚙️ 训练配置

在硬件资源有限的条件下，我们基于 [**Eagle**](https://github.com/SafeAILab/EAGLE) 和 [**SpecForge**](https://github.com/sgl-project/SpecForge) 开源项目，搭建了一套面向消费级显卡的低成本 Eagle-3 权重训练工具，支持常用规模的大语言模型在一体机环境中的高效 Eagle-3 训练。

- 数据集：使用 ShareGPT-68K（英文）和 ShareGPT-Chinese-English-90k（中文）构建了 135K 条文本的训练数据集。训练数据集的 prompt 部分使用原数据集内容，output 部分则由 Qwen3-8B 模型重新生成。
- 训练环境：在 4 卡 24G 显存的 NVIDIA RTX 4090 显卡上展开训练，训练时长约 3 天。

## 🖥️ 推理命令

sglang 启动 eagle-3 算法服务

```shell
python3 -m sglang.launch_server \
--model-path Qwen/Qwen3-8B \
--speculative-algo EAGLE3 \
--speculative-draft Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh \
--speculative-num-steps 5 \
--speculative-eagle-topk 4 \
--speculative-num-draft-tokens 16 \
--mem-fraction 0.7  \
--dtype float16 \
--port 30000 \
--cuda-graph-max-bs 8 \
--cuda-graph-bs {1,2,3,4}
```

sglang 启动原始模型服务(用于对比实验)

```shell
python3 -m sglang.launch_server \
--model-path Qwen/Qwen3-8B \
--dtype float16 \
--port 30000 \
--mem-fraction 0.7 \
--cuda-graph-max-bs 8 \
--cuda-graph-bs {1,2,3,4}
```

## 🌟 性能测评
在单卡 NVIDIA RTX 4090 上，我们基于 Eagle-3 算法，在以下数据集上对开源权重进行了系统性的测试：
- MT-bench ：该数据集包含了 80 条英文多轮高质量的对话，涵盖了不同领域。
- MT-bench-zh：中文版本的 MT-bench 数据集是通过[通义千问](https://www.tongyi.com/qianwen/)官网的服务处理后，再经过人工修正所得。
- C-Eval：从 C-Eval 数据集的每个类别中各抽取了 2 条数据，共构成了 104 条样本。
- GSM8K：从 GSM8K 数据集中随机抽取了 100 条数据。
> 注：所有测试均在 4 并发下进行。MT-bench 生成 token 数设置上限为 512，C-Eval 与 GSM8K 为 2048

为确保结论的充分性，我们在不同的投机解码超参配置和请求采样参数配置下展开了大量实验。

### 🧪 实验一
设置每次推理进行 5 步投机解码迭代，保留 top-4 最高概率的 token 进行推测，最多选取 16 个草稿 token 进行并行验证。
```shell
--speculative-num-steps 5 \
--speculative-eagle-topk 4 \
--speculative-num-draft-tokens 16 \
```
<table>
  <thead>
    <tr>
        <th>&nbsp</th><th>&nbsp</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench-zh</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">C-Eval</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">GSM8K</th>
    <tr><th>Temperature</th><th>Model</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th></tr>
  </thead>
  <tbody>
    <!-- <tr><td colspan="12" style="text-align: center; vertical-align: middle;"><strong>Temperature=0</strong></td></tr> -->
    <tr><td rowspan="6"><strong>T=0</strong></td>
      <td>Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh</td><td><b>2.16x</b></td><td><b>3.44</b></td><td><b>2.27x</b></td><td><b>3.62</b></td><td><b>2.25x</b></td><td><b>3.38</b></td><td><b>2.81x</b></td><td><b>4.18</b></td></tr>
    <tr> <td>AngelSlim/Qwen3-8B_eagle3</td><td>0.79x</td><td>1.25</td><td>2.18x</td><td>3.52</td><td>0.83x</td><td>1.21</td><td>2.27x</td><td>3.32</td></tr>
    <tr><td>Tengyunw/qwen3_8b_eagle3B</td><td>0.72x</td><td>1.12</td><td>2.23x</td><td>3.51</td><td>0.77x</td><td>1.13</td><td>2.67x</td><td>3.95</td></tr>
      <tr><td>RedHatAI/Qwen3-8B-speculator.eagle3</td><td>0.88x</td><td>1.33</td><td>2.03x</td><td>3.12</td><td> - </td><td> - </td><td> - </td><td> - </td></tr>
  </tbody>
</table>

### 🧪 实验二
设置每次推理进行 6 步投机解码迭代，保留 top-10 最高概率的 token 进行推测，最多选取 32 个草稿token进行并行验证。(该配置为目前常用配置)

```shell
--speculative-num-steps 6 \
--speculative-eagle-topk 10 \
--speculative-num-draft-tokens 32 \
```

<table>
  <thead>
    <tr>
        <th>&nbsp</th><th>&nbsp</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench-zh</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">C-Eval</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">GSM8K</th>
    <tr><th>Temperature</th><th>Model</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th></tr>
  </thead>
  <tbody>
    <!-- <tr><td colspan="12" style="text-align: center; vertical-align: middle;"><strong>Temperature=0</strong></td></tr> -->
    <tr><td rowspan="3"><strong>T=0</strong></td>
      <td>Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh</td><td>2.13x</td><td>3.9</td><td><b>2.25x</b></td><td><b>4.11</b></td><td>2.26x</td><td>3.86</td><td><b>2.85x</b></td><td><b>4.8</b></td></tr>
    <tr><td>AngelSlim/Qwen3-8B_eagle3</td><td> - </td><td> - </td><td>2.16x</td><td>4.01</td><td> - </td><td> - </td><td>2.21x</td><td>3.72</td></tr>
    <tr><td>Tengyunw/qwen3_8b_eagle3B</td><td> - </td><td> - </td><td>2.21x</td><td>4</td><td> - </td><td> - </td><td>2.66x</td><td>4.5</td></tr>
    <tr><td rowspan="3"><strong>T=1</strong></td>
      <td>Zjcxy-SmartAI/Eagle3-Qwen3-8B</td><td>1.46x</td><td>3.57</td><td><b>1.58x</b></td><td><b>3.89</b></td><td>1.5x</td><td>3.42</td><td><b>1.99x</b></td><td><b>4.52</b></td></tr>
    <tr><td>AngelSlim/Qwen3-8B_eagle3</td><td> - </td><td> - </td><td>1.53x</td><td>3.84</td><td> - </td><td> - </td><td>1.55x</td><td>3.54</td></tr>
    <tr><td>Tengyunw/qwen3_8b_eagle3B</td><td> - </td><td> - </td><td>1.56x</td><td>3.51</td><td> - </td><td> - </td><td>1.85x</td><td>4.26</td></tr>
  </tbody>
</table>

### 🧪 实验三
在常用配置的基础上，基于 Qwen3-8B 官方推荐的采样参数配置，Temperature=0.6，TopP=0.95，TopK=20 和 MinP=0 。我们也进行了相关测试。

<table>
  <thead>
    <tr>
        <th>&nbsp</th><th>&nbsp</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench-zh</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">MT-bench</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">C-Eval</th>
        <th colspan="2" style="text-align: center; vertical-align: middle;">GSM8K</th>
    <tr><th>Temperature</th><th>Model</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th><th>Speedup</th><th>τ</th></tr>
  </thead>
  <tbody>
    <!-- <tr><td colspan="12" style="text-align: center; vertical-align: middle;"><strong>Temperature=0</strong></td></tr> -->
    <tr><td rowspan="6"><strong>T=0.6</strong></td>
      <td>Zjcxy-SmartAI/Eagle3-Qwen3-8B-zh</td><td>1.73x</td><td>3.82</td><td><b>1.83x</b></td><td><b>4.06</b></td><td>1.79x</td><td>3.69</td><td><b>2.32x</b></td><td><b>4.73</b></td></tr>
    <tr> <td>AngelSlim/Qwen3-8B_eagle3</td><td> - </td><td> - </td><td>1.78x</td><td>3.97</td><td> - </td><td> - </td><td>1.79x</td><td>3.67</td></tr>
    <tr><td>Tengyunw/qwen3_8b_eagle3B</td><td> - </td><td> - </td><td>1.81x</td><td>3.97</td><td> - </td><td> - </td><td>2.17x</td><td>4.45</td></tr>
    <tr><td>RedHatAI/Qwen3-8B-speculator.eagle3</td><td> - </td><td> - </td><td>1.61x</td><td>3.43</td><td> - </td><td> - </td><td> - </td><td> - </td></tr>
  </tbody>
</table>

## ✏️ 实验结论

通过对比，我们获得如下结论:
- 综合来看，在训练数据规模为 **135k** 的条件下，模型在各项评测中均展现出不错的性能。与当前同规模的开源权重相比，本模型的猜词能力和加速效果**在维持英文任务优势的基础上，在中文任务上取得了显著进步**。实验进一步表明，在单卡 NVIDIA RTX 4090 显卡上，模型在中英文场景中的推理效率最高均可提升近 **2.5 倍**。


## 🔑 相关链接

Qwen3-8B 开源权重: https://www.modelscope.cn/models/Qwen/Qwen3-8B

Eagle 开源仓库：https://github.com/SafeAILab/EAGLE

SpecForce 训练框架：https://github.com/sgl-project/SpecForge
