---
title: Xiaothink-T17-RWKV5-MLA-0.6B-Frontend
canonical_url: "https://www.modelscope.cn/models/ericsjq/Xiaothink-T17-RWKV5-MLA-0.6B-Frontend"
md_url: "https://www.modelscope.cn/models/ericsjq/Xiaothink-T17-RWKV5-MLA-0.6B-Frontend.md"
repository: ericsjq/Xiaothink-T17-RWKV5-MLA-0.6B-Frontend
chinese_name: Xiaothink-T17-RWKV5-MLA-0.6B-Frontend
last_updated: 2026-08-23
pipeline_tag: text-generation
tasks:
  - text-generation
downloads: 6
stars: 1
---

# Xiaothink-T17-RWKV5-MLA-0.6B-Frontend

> Xiaothink-T17-RWKV5-MLA-0.6B-Frontend - ericsjq 在 ModelScope 开源的模型。Xiaothink-T17-RWKV5-MLA-Frontend 是小思框架（Xiaothink）推出的 ≈0.6B 中文前端页面生成专项模型 ，也是业界首款面向 WanlyFrontend（WF）声明式前端语言 的生成模型。它在 DeepSeek-V4-Flash 深度思考裁判的 多模型对照盲测 中 以 52.6 的总平均分全面超越 8B 级…

- **Repository**: ericsjq/Xiaothink-T17-RWKV5-MLA-0.6B-Frontend
- **Tasks**: text-generation
- **Downloads**: 6
- **Stars**: 1
- **Last updated**: 2026-08-23

Source: https://www.modelscope.cn/models/ericsjq/Xiaothink-T17-RWKV5-MLA-0.6B-Frontend

---

# Xiaothink-T17-RWKV5-MLA-Frontend 模型卡片

[模型在线Demo体验（首次进入若跳转到主页请重进链接）](http://xiaothink.top/xiaothink_llm/frontend.html)
## 模型概述

Xiaothink-T17-RWKV5-MLA-Frontend 是小思框架（Xiaothink）推出的 **≈0.6B 中文前端页面生成专项模型**，采用自研的 **RWKV-v5 + MLA 纯历史检索架构**（DeepSeek V3 风格低秩压缩注意力），面向**声明式前端代码生成**任务深度微调。

与通用指令模型不同，本模型**不直接输出 HTML**，而是生成小思框架自研的 **WanlyFrontend（WF）** 前端编程语言代码——一种以中文为主的极简声明式语言，再由 **WanlyFrontend 编译器**一键编译为完整 HTML/CSS/JS 页面。该"语言生成 + 编译器"的架构使模型在 0.6B 参数量下即可产出结构规整、配色丰富、设计感强的高质量页面，支持消费级显卡（含 BF16）本地部署。

在 **DeepSeek-V4-Flash 裁判对照盲测**中，本模型与 20B/80B 级云端模型及同级小模型同场竞技：**前端总平均分 52.6，超越 llama-3-8B-instruct（35.4）与 Qwen3-0.6B（23.0）**，其中**简单页面任务达 63.0 分**、复杂提示词任务达 54.3 分，展现出 0.6B 规模下卓越的前端生成能力（详见性能评测章节）。

## 模型概览

| 属性     | 值                                         |
| ------ | ----------------------------------------- |
| 模型名称   | Xiaothink-T17-RWKV5-MLA-Frontend          |
| 架构     | RWKV-v5 + MLA（DeepSeek V3 风格）纯历史检索架构      |
| 参数量    | **≈0.6B**（与 Instruct 版同架构）                |
| 词表大小   | 52,894                                    |
| 最大序列长度 | 51200（训练时）                               |
| 历史检索方式 | 稀疏快照 + top-k 历史注意力（history\_top\_k=6）     |
| 输出语言   | **WanlyFrontend（WF）**——中文声明式前端编程语言        |
| 深度学习框架 | PyTorch（≥2.0）                             |
| 最低库版本  | **xiaothink ≥ 1.4.8**                     |
| 语言     | **中文**（截止 Xiaothink-T17 系列发布，所有模型只支持中文处理） |
| 推理显存需求 | 消费级显卡可运行（支持 BF16 推理）                      |

> ⚠️ **重要说明：本模型是自研特殊架构（RWKV-v5 时间混合 + MLA 低秩历史检索），权重格式与标准 transformers/ModelScope 不兼容，不支持 ModelScope 推理后端、不支持 transformers、不支持 transformers 的 safetensors 格式加载。请务必使用 xiaothink ≥ 1.4.8 库调用本模型。具体调用代码详见后文或 xiaothink 库文档或 http\://xiaothink.top 小思框架官网文档。**
>
> ⚠️ **前端生成说明：本模型的输出是 WanlyFrontend（WF）编程语言代码，而非可直接预览的 HTML。请将模型输出接入 WanlyFrontend 编译器（开源仓库：https\://github.com/Ericsjq/Open-WanlyFrontend）编译为完整 HTML 页面。切勿将 WF 源码直接当作 HTML 使用。**

***

## 核心创新

### 一、WanlyFrontend：中文声明式前端编程语言

本模型的核心能力是"先写语言，再编译成页面"。WanlyFrontend 是一套中文为主的极简声明式前端语言，一条语句即可描述一个组件及其样式，例如：

```
__页面__（）
页面（最小高度：100vh；填充：#0f172a；弹性；纵向排列；内边距：20px）
页面.头部.标题（文本："🌍 世界时钟"；字号：24px；字重：700；文字色：#38bdf8）
页面.时钟列表.北京.时间1（文本："14:30"；字号：32px；字重：700；文字色：#38bdf8）
```

该语言特点：

- **中文为主**：组件名、属性名、标点全部支持中英文双语，模型更易学习与遵循
- **声明式极简**：`组件（属性：值；属性：值）` 单行描述一个完整组件，天然对齐模型生成的 token 序列
- **全栈能力**：支持样式（弹性布局、颜色、圆角）、事件（被点击时）、逻辑（如果/循环）、动画等，编译器统一转换为 HTML+CSS+JS
- **编译为完整页面**：开源编译器一键输出 `full` 完整 HTML 文档，可直接浏览器打开

这种"语言 + 编译器"的设计显著降低了对模型参数量的要求：模型只需学会**结构化的中文描述**，而繁琐的 HTML/CSS 标签配对与转义细节交给编译器保证正确性，因此 0.6B 模型也能稳定产出高完成度页面。

### 二、RWKV-v5 + MLA 纯历史检索架构

与 Instruct 版相同，本模型在 0.6B 参数量下融合 RWKV-v5 并行时间混合与 DeepSeek V3 风格 MLA 低秩压缩注意力，实现"当前信息由 RWKV 负责、长程历史由 MLA 检索"的职责分离：

```
1. RWKV-v5 TokenShift + WKV 线性注意力 → time_out    # 处理当前信息
2. MLA 纯历史检索: 稀疏快照 → 标准 softmax 全注意力 → h_ctx
   - 本版 kv_lora_rank=None，即 KV 不做低秩压缩，全量保留页面结构信息
   - NoPE：无位置编码，QK-Norm 稳定点积尺度
3. Gate 融合: combined = time_out + gate * h_ctx
4. FFN: RWKV 风格 SquaredReLU
```

#### 关键设计

- **稀疏历史快照**：每 `save_every=16` 步保存一次 KV 快照，检索时只与快照做标准 softmax 注意力，长页面生成时历史规模线性增长而非平方
- **长页面建模**：训练序列长度 51200，配合 MLA 历史检索，能够稳定承接"想要一个完整 XX 页面"这类多区块、多组件长任务的结构化生成
- **推理 KV Cache**：推理时缓存 K/V（`use_kv_cache=True`），避免每步重复计算
- **门控融合**：可学习的标量门控（`hist_gate_proj`）自动权衡当前信息与历史检索信息

***

## 模型参数

| 参数              | 值      | 说明                            |
| --------------- | ------ | ----------------------------- |
| `d_model`       | 1400   | 嵌入维度                          |
| `hidden_dim`    | 1400   | 前馈网络维度                        |
| `num_heads`     | 4      | 多头注意力头数                       |
| `num_layers`    | 16     | RWKV5HistMLABlock 层数          |
| `max_seq_len`   | 51200  | 训练时最大序列长度                     |
| `history_top_k` | 6      | 历史检索 top-k 值                  |
| `save_every`    | 16     | 历史快照保存间隔（步）                   |
| `kv_lora_rank`  | None   | MLA KV 低秩压缩维度（None=不压缩，全量 KV） |
| `q_lora_rank`   | None   | MLA Q 低秩压缩维度（None=不压缩）        |
| `n_maxgate`     | 0      | 门控上限层数（0=不限制）                 |
| `v_maxgate`     | 1.0    | 门控最大值                         |
| `use_kv_cache`  | True   | 推理时启用 KV Cache                |
| `max_cut`       | 2400   | 生成截断长度配置                      |
| `dropout`       | 0.0    | Dropout 率                     |

### 模型变体

| 变体                       | d\_model | num\_heads | num\_layers | 说明              |
| ------------------------ | -------- | ---------- | ----------- | --------------- |
| `t17_rwkv5_mla`          | 1400     | 4          | 16          | 基础预训练版          |
| `t17_rwkv5_mla_instruct` | 1400     | 4          | 16          | 通用指令微调版         |
| `t17_rwkv5_mla_frontend` | 1400     | 4          | 16          | **本卡：前端生成专项版** |

***

## 性能评测

### 盲测设置

以 **DeepSeek-V4-Flash（深度思考模式）作为裁判**，对本模型与多款模型进行**前端生成能力对照盲测**：

- **4 个前端评测领域**：复杂提示词、长页面生成任务、简单页面任务、简单小游戏
- **每个领域 3 道测试题**，共 12 题；提示词以"想要/弄一个/请生成/给我生成"开头，覆盖长页面复杂任务与简单页面任务两类难度
- **对照盲测**：每个问题将各模型生成的页面同时提交裁判，裁判按**编号**（不暴露模型名）对照评分
- 裁判评分维度（按权重）：**页面艺术感与设计感**（配色丰富程度、色彩搭配和谐度、视觉设计感，权重最高）、**内容与功能丰富程度**、**页面完整性**、**需求符合度**；忽略页面 title 与中文命名/变量名
- 评分范围：0-100 整数，表现明显更好的模型获得明显更高的分数
- 本模型推理：温度梯度 0.78~0.90 多次采样，经 **WanlyFrontend 编译器**编译为 HTML 后参与评分；对照模型每次采样结果与各模型回答同时送评

### 盲测结果图

![前端能力盲测对比结果](model_evaluation_frontend.png)

### 分领域平均得分

| 领域       | **T17-RWKV5-MLA-Frontend（0.6B）** | DeepSeek-V4-Flash | gpt-oss-20B | llama-3-8B-instruct | Qwen3-0.6B |
| -------- | ------------------------------- | ----------------- | ----------- | ------------------- | ---------- |
| 复杂提示词    | **54.3**                        | 94.4              | 62.6        | 37.2                | 31.3       |
| 长页面生成任务  | **51.3**                        | 94.7              | 61.2        | 34.1                | 20.1       |
| 简单页面任务   | **63.0**                        | 92.6              | 76.3        | 41.8                | 23.6       |
| 简单小游戏    | **41.7**                        | 78.1              | 56.8        | 28.3                | 17.0       |
| **总体平均** | **52.6**                        | **89.9**          | **64.2**    | **35.4**            | **23.0**   |

> 注：DeepSeek-V4-Flash（80B+）与 gpt-oss-20B（20B）为云端大模型，llama-3-8B-instruct 为 8B 开源模型。**本模型以 0.6B 参数量在全部 4 个前端领域中超越 8B 级 llama-3-8B-instruct 与同级 Qwen3-0.6B**，其中**简单页面任务 63.0 分**已接近 20B 级 gpt-oss-20B（76.3）的水平，在"配色丰富、设计感强"这一核心维度上展现出 0.6B 规模下优异的前端生成能力，充分体现"WanlyFrontend 语言 + 编译器"路线对前端任务的建模效率。

***

## 快速开始

### 第一步：安装依赖

```bash
# 安装 xiaothink 库（含 PyTorch 后端）
pip install xiaothink[torch]

# 获取 WanlyFrontend 编译器（开源仓库）
# 仓库地址: https://github.com/Ericsjq/Open-WanlyFrontend
```

> 需要 xiaothink ≥ 1.4.8。模型权重目录需包含 `tokenizer.json` 和 `checkpoints/` 权重文件。

### 第二步：加载模型并生成 WanlyFrontend 代码

```python
from xiaothink.llm.inference_torch.torch_formal import TorchModel

# 1. 加载模型（ckpt_dir 指向模型权重目录）
model = TorchModel(
    ckpt_dir='path/to/ckpt_test_t17_rwkv5_mla_frontend',
    MT='t17_rwkv5_mla_frontend',
    use_bf16=False,          # 显存不足时设为 True（需显卡支持 BF16）
    inference_mode='auto'
)

# 2. 生成页面（输出为 WanlyFrontend 编程语言代码，而非 HTML）
model.clear_history()
wf_code = model.chat('想要一个具有电影海报风格的复古影院页面，主色调暗红与金色，包含片单列表、票价信息与宣传语', temperature=0.9, max_length=10000)
print(wf_code)
```

### 第三步：编译为 HTML

```python
from wanlyfontend import WanlyFontend   # 来自 Open-WanlyFrontend 仓库

# 3. 使用 WanlyFrontend 编译器将模型输出编译为完整 HTML 页面
compiler = WanlyFontend()
result = compiler.to_web(wf_code)       # 返回 {'html','css','js','full','errors'}
html = result['full']                   # 完整 HTML 文档，可直接保存为 .html 用浏览器打开

with open('page.html', 'w', encoding='utf-8') as f:
    f.write(html)
```

> 完整工作流：**中文提示词 → 模型生成 WanlyFrontend 代码 → 编译器编译为 HTML**。请勿将模型输出的 WF 源码直接当作 HTML 使用。

### 参数建议

| 任务类型        | temperature | top\_p | max\_length | 说明                 |
| ----------- | ----------- | ------ | ----------- | ------------------ |
| 简单页面（请生成/给我生成） | 0.7 \~ 0.9  | 0.86   | 4096        | 页面元素较少，无需过长序列      |
| 长页面/复杂任务（想要/弄一个） | 0.78 \~ 0.9 | 0.86   | 10000       | 多区块、多组件页面，需更大生成长度 |

***

## 局限性

1. **仅支持中文**：截止 Xiaothink-T17 系列发布，所有模型只支持中文处理
2. **不支持 ModelScope/transformers**：权重格式为自定义 PyTorch state\_dict，必须使用 xiaothink 库加载
3. **输出为 WF 语言而非 HTML**：必须经 WanlyFrontend 编译器编译后才能预览，多一步转换流程
4. **端侧部署**：参数量 0.6B，建议在 ≥8GB 显存或 16GB 内存的设备上运行
5. **复杂交互弱项**：在"简单小游戏"等强交互场景（41.7 分）相对弱于大模型，擅长静态展示型页面；复杂 JavaScript 交互仍建议使用云端大模型

***

## 许可证

本项目采用 Apache License 2.0 许可证。

Copyright (c) 2026 Xiaothink Team
