---
title: xiaoli-v2-base
canonical_url: "https://www.modelscope.cn/models/shuiyu1123/xiaoli-v2-base"
md_url: "https://www.modelscope.cn/models/shuiyu1123/xiaoli-v2-base.md"
repository: shuiyu1123/xiaoli-v2-base
chinese_name: Lix-v2-base
last_updated: 2026-08-25
license: mit
pipeline_tag: text-generation
tasks:
  - text-generation
model_type:
  - llama
architectures:
  - LlamaForCausalLM
parameters: 1.5B
tensor_type:
  - F32
library_name:
  - transformer
  - safetensors
language:
  - zh
downloads: 33
stars: 0
tags:
  - llama
  - chinese
  - pretrained
  - xiaoli
  - lix
---

# xiaoli-v2-base

> xiaoli-v2-base - shuiyu1123 在 ModelScope 开源的模型。狸柯 Lix v2 基座模型 (xiaoli-v2-base)

shuiyu1123/xiaoli-v2-base 是 ModelScope 魔搭社区上的 1.5B 参数text-generation模型，采用 mit 许可。

- **Repository**: shuiyu1123/xiaoli-v2-base
- **License**: mit
- **Tasks**: text-generation
- **Parameters**: 1.5B
- **Tags**: llama, chinese, pretrained, xiaoli, lix
- **Downloads**: 33
- **Stars**: 0
- **Last updated**: 2026-08-25

Source: https://www.modelscope.cn/models/shuiyu1123/xiaoli-v2-base

---

# 狸柯 Lix v2 基座模型 (xiaoli-v2-base)

狸柯（Lix）v2 基座模型是一个从零预训练的中文 1.5B 参数语言模型，基于 LLaMA 架构，在国产算力平台 SCNet（曙光 DCU 集群）上完成训练。

## 模型信息

| 属性 | 值 |
|------|-----|
| 架构 | LlamaForCausalLM |
| 参数量 | ~1.5B |
| 隐藏层大小 | 2048 |
| 层数 | 20 |
| 注意力头 | 16 |
| 词表大小 | 30008 |
| 最大上下文长度 | 2048 |
| 训练步数 | 450,000 |
| 许可证 | MIT |

## 能力说明

这是一个**纯预训练基座模型**，仅具备文本续写能力，**未经过指令微调（SFT）**：

- 可以续写文本、预测下一个 token
- 不能正确回答问答、不能遵循指令、不能做数学计算

问答与指令跟随能力将在 SFT 阶段训练后获得。SFT 训练代码见本仓库 `training_code/` 目录。

## 快速使用

```python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("shuiyu1123/xiaoli-v2-base")
tokenizer = AutoTokenizer.from_pretrained("shuiyu1123/xiaoli-v2-base")

prompt = "中国的首都是北京，北京是"
inputs = tokenizer(prompt, return_tensors="pt")
out = model.generate(**inputs, max_new_tokens=30)
print(tokenizer.decode(out[0], skip_special_tokens=True))
```

## 分词器说明

本模型使用 Whitespace BPE 分词器，词表中包含真实中文字符（非字节级 BPE）。在 llama.cpp/Ollama 中运行时，中文可能显示为 `[UNK_BYTE_0x...]`，这是 llama.cpp 按字节级 BPE 解码导致的显示问题，模型生成的 token 本身是正确的。建议使用 transformers 加载以获得正常的中文输出。

## 训练

### 算力平台

- 训练平台：**SCNet 国产算力平台**（曙光 DCU 集群）
- 硬件：2× 64G DCU 卡（FSDP 全参数并行）
- 框架：PyTorch + FSDP + bf16 混合精度

### 训练成本

通过国产算力平台的免费/低成本配额，本次预训练 + SFT 的总算力成本约 **100 卡时**（2 卡并行约 50 小时），**训练成本几乎为 0**。

### 预训练数据来源与占比

预训练采用 on-the-fly 实时分词，按 token 比例混合以下语料：

| 数据类别 | 来源 | 占比 |
|---------|------|------|
| 通用文本 | seq-monkey 通用开放语料（mobvoi_seq_monkey_general_open_corpus） | ~74% |
| 古籍文本 | seq-monkey classical 古籍子集（唐/宋/南北朝等诗词文） | （含在通用文本中） |
| 知识语料 | pleisto/wikipedia-cn 中文维基过滤版（开放） | ~13% |
| 代码语料 | OpenCoder fineweb-code-corpus（MIT） | ~13% |
| 指令语料 | COIG-CQIA（预训练阶段混合） | （含在通用文本中） |

> 注：通用文本占比 = 100% - 代码 13% - 知识 13% = 74%，其中包含 seq-monkey 通用语料、古籍子集及 COIG-CQIA 指令语料。

### SFT 数据来源与占比

SFT 采用多文件配比采样，总预算 **300M token**，按 token 比例分配如下：

| 数据类别 | 占比 | 主要数据源 |
|---------|------|-----------|
| 通用对话/指令 | 40% | eagle_chat、firefly_culture、COIG-CQIA、alpaca_gpt4_zh、Slim-LCCC 等 |
| 数学/推理 | 20% | r1_math_stem_zh、OpenR1-Math-highq、MetaMathQA |
| 代码 | 15% | magicoder_sft、codeforces_cots |
| 长文本 | 15% | long_inst_zh、longwriter_6k、longctx_sft、long |
| 工具调用 | 10% | fc_sft（function calling） |

> SFT 采用统一 chat 格式（系统/用户/助手/工具结果），4k 上下文窗口，loss 仅计算输出 token（prompt 部分 mask），训练 1 epoch。

### Loss 曲线

![预训练 loss 曲线](loss_curve.png)

预训练 loss 从初始 ~10.6 快速下降，约 4 万步后进入收敛区间，最终稳定在 ~1.8 附近。

### 验证集 Loss 与 PPL

在独立验证集（代码 / 古籍诗词 / 中文维基 / 通用问答 / 社区问答）上，以 512 token 滑动窗口计算平均交叉熵 loss 与困惑度 PPL：

| 验证集 | 窗口数 | avg CE Loss | PPL |
|--------|--------|-------------|-----|
| 代码（OpenCoder 采样） | 100 | 1.6951 | 5.45 |
| 古籍诗词 | 100 | 6.0808 | 437.36 |
| 中文维基知识 | 100 | 4.2473 | 69.91 |
| 通用问答（狸柯身份） | 2 | 1.9066 | 6.73 |
| 社区问答（COIG-CQIA） | 100 | 1.1319 | 3.10 |

> 说明：古籍诗词为古典中文（南北朝/清末近现代初），与预训练语料分布差异大，故 PPL 较高；通用问答样本量小（2 窗口）。

## 训练代码

完整的预训练与 SFT 训练代码见本仓库 [`training_code/`](training_code/) 目录，包含：

- `train_pretrain.py` / `run_pretrain.sh`：预训练主脚本与启动脚本
- `sft_train_v2.py` / `run_sft.sh`：SFT 指令微调脚本（4k 上下文，300M token 配比采样）
- `build_knowledge.py` / `build_code.py`：语料下载转换脚本

## 许可证

MIT License
