---
title: TinySage-4B
canonical_url: "https://www.modelscope.cn/models/chensongpoixs/TinySage-4B"
md_url: "https://www.modelscope.cn/models/chensongpoixs/TinySage-4B.md"
repository: chensongpoixs/TinySage-4B
chinese_name: TinySage-4B
last_updated: 2026-06-15
model_type:
  - qwen3
architectures:
  - Qwen3ForCausalLM
base_model:
  - Qwen/Qwen3-4B
base_model_relation: finetune
parameters: 4.0B
tensor_type:
  - BF16
library_name:
  - transformer
  - safetensors
language:
  - zh
  - en
downloads: 11
stars: 0
tags:
  - tiny
  - distilled
  - qwen
  - lora-merged
  - ai-infra
---

# TinySage-4B

> TinySage-4B - chensongpoixs 在 ModelScope 开源的模型。基于 GPT、Claude 和 Gemini 的多教师蒸馏小语言模型，AI 基础设施（音视频编解码、流媒体协议、GPU/CUDA 等）

chensongpoixs/TinySage-4B 是 ModelScope 魔搭社区上的 4.0B 参数机器学习模型，基于 Qwen/Qwen3-4B 构建。

- **Repository**: chensongpoixs/TinySage-4B
- **Parameters**: 4.0B
- **Base model**: Qwen/Qwen3-4B
- **Tags**: tiny, distilled, qwen, lora-merged, ai-infra
- **Downloads**: 11
- **Stars**: 0
- **Last updated**: 2026-06-15

Source: https://www.modelscope.cn/models/chensongpoixs/TinySage-4B

---

# TinySage: 多教师蒸馏小语言模型

TinySage 是基于 Qwen3 家族的多规格小模型，使用自研蒸馏训练框架 **PolyDistill** 
统一调度 GPT、Claude、Gemini 等商业 API 教师模型与学生模型的训练。
支持 0.6B / 1.7B / 4B / 8B 四规格，修改 config.yaml 中 model_id 即可切换。

### 学生模型规格对比

| 规格 | 参数量 | 层数 | hidden_size | BF16 显存 | 推荐 GPU | 适用场景 |
|------|--------|------|-------------|----------|---------|---------|
| **TinySage-0.6B** | 0.6B | 28 | 1024 | ~1.2 GB | 8GB+ | 端侧部署/快速原型/实时推理 |
| **TinySage-1.7B** | 1.7B | 28 | 2048 | ~3.4 GB | 16GB+ | 服务器部署/较高回答质量 |
| **TinySage-4B** | 4B | 36 | 2560 | ~7.6 GB | 16GB+ | 平衡质量与速度，性价比之选 |
| **TinySage-8B** | 8B | 36 | 4096 | ~16 GB | 24GB+ | 接近生产级效果，强推理能力 |

> 训练显存需求显著高于 BF16 模型大小（需激活值+梯度+优化器状态）。
> 训练峰值估算：0.6B~4GB / 1.7B~8GB / 4B~14GB / 8B~22GB。

PolyDistill 核心能力：
- 支持跨架构商业大模型的黑盒蒸馏
- 多教师回答生成与融合机制
- 大规模教师语料的高效流式处理
- 灵活的训练策略（逻辑层蒸馏、指令蒸馏等）

最终产出的 TinySage 集三家之长，体量 0.6B/1.7B/4B/8B 可选，可灵活部署至端侧或服务器。

**训练框架**：PolyDistill（本仓库提供）  
**模型**：TinySage（0.6B / 1.7B / 4B / 8B 四规格）


---

## 评测报告

本仓库同时提供完整的评测数据，方便用户快速了解模型能力边界：

- **`eval_report.md`**  
  可读性评估摘要。基于 AI Infra 领域指令遵循、通用知识（MMLU）、中文语言理解（C-Eval/CMMLU）及代码生成（HumanEval）等基准，列出各数据集上的准确率、生成质量指标及简要分析，帮助快速掌握模型强项与待提升方向。

- **`eval_report.json`**  
  结构化评测数据。包含所有评测任务的详细结果，如：  
  - 数据集名称、样本数量  
  - 准确率/Pass@k、BLEU、ROUGE-L 等指标  
  - 生成延迟（p50/p95）  
  便于直接用于程序化分析、绘图或集成至自动化流水线。

> 以上文件与模型权重一同发布，下载仓库后即可查看。

---

# TinySage-4B

一款面向 AI 基础设施领域的多教师蒸馏小语言模型（约 4B 参数）。

- **基座模型**：Qwen/Qwen3-4B
- **训练框架**：[PolyDistill](https://github.com/chensongpoixs/PolyDistill)
- **教师模型**：GPT、Claude、Gemini
- **蒸馏方法**：黑盒指令蒸馏 + LoRA 监督微调（r=32）
- **领域**：AI 基础设施（音视频编解码、流媒体协议、GPU/CUDA 等）

## 使用方法

```python
from transformers import AutoModelForCausalLM, AutoTokenizer

# 加载模型与分词器
model = AutoModelForCausalLM.from_pretrained(
    "TinySage-4B",
    device_map="auto",
    torch_dtype="auto",
    trust_remote_code=True,
)
tokenizer = AutoTokenizer.from_pretrained("TinySage-4B", trust_remote_code=True)

# 构建对话消息
messages = [
    {"role": "system", "content": "你是一个乐于助人的助手。"},
    {"role": "user", "content": "解释 CUDA Stream 的并行原理"},
]

# 应用对话模板并生成回复
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```

## 许可证

与基础模型 (Qwen/Qwen3-4B) 相同。
