---
title: XGuard-v22-Safety-Classification
canonical_url: "https://www.modelscope.cn/datasets/CLJY2026/XGuard-v22-Safety-Classification"
md_url: "https://www.modelscope.cn/datasets/CLJY2026/XGuard-v22-Safety-Classification.md"
repository: CLJY2026/XGuard-v22-Safety-Classification
chinese_name: "XGuard v22 内容安全分类数据集"
last_updated: 2026-04-28
license: "Apache License 2.0"
storage_size: "520 MB"
downloads: 69
stars: 1
---

# XGuard-v22-Safety-Classification

> XGuard-v22-Safety-Classification - CLJY2026 在 ModelScope 开源的数据集。该数据集覆盖多语言（中/英）内容安全场景，包括但不限于：有害内容、欺诈、暴力、色情、仇恨言论等风险类别，以及安全内容的负样本。数据经过多轮清洗、标签校正、对抗样本增强和类别平衡处理。样本量：1,218,808 条，标签体系：33 类（29 标准标签 + 4 个 cn_* 中文动态策略标签），格式：JSONL（对话式 SFT 格式）

CLJY2026/XGuard-v22-Safety-Classification 是 ModelScope 魔搭社区上的数据集，存储大小 520 MB，采用 Apache License 2.0 许可。

- **Repository**: CLJY2026/XGuard-v22-Safety-Classification
- **License**: Apache License 2.0
- **Storage size**: 520 MB
- **Downloads**: 69
- **Stars**: 1
- **Last updated**: 2026-04-28

Source: https://www.modelscope.cn/datasets/CLJY2026/XGuard-v22-Safety-Classification

---

# XGuard v22 内容安全分类数据集



## 概览

| 项目 | 值 |
|------|-----|
| 样本量 | 1,218,808 |
| 标签数 | 33（29 标准 + 4 中文动态策略） |
| 语言 | 中文、英文 |
| 格式 | JSONL（对话式 SFT） |
| 文件大小 | 521 MB |
| 基座模型 | YuFeng-XGuard-Reason-8B（Qwen3-8B） |
| 训练方式 | 全参数微调（Full-parameter SFT） |

## 标签体系（33 类）

### 29 标准标签

| 标签 | 样本数 | 说明 |
|------|--------|------|
| ac | 33,908 | Adult Content |
| acc | 33,815 | Account Security |
| cm | 57,372 | Child Safety / Minor |
| cs | 29,031 | Cybersecurity |
| cy | 36,016 | Copyright |
| dc | 49,531 | Deceptive Content |
| def | 30,111 | Defamation |
| dw | 35,075 | Dangerous / Weapons |
| ec | 61,566 | Extremist Content |
| ext | 34,002 | Extortion |
| fin | 33,730 | Financial Risk |
| ha | 35,860 | Harassment |
| law | 28,990 | Legal Risk |
| ma | 34,045 | Malware |
| mc | 45,508 | Misinformation |
| md | 29,237 | Medical Risk |
| med | 29,033 | Media Manipulation |
| mh | 28,980 | Mental Health |
| pc | 40,838 | Political Content |
| ph | 42,211 | Phishing |
| pi | 40,873 | Personal Information |
| pp | 30,957 | Privacy |
| ps | 33,911 | Public Safety |
| sci | 41,026 | Science Misuse |
| sd | 29,032 | Self-harm / Dangerous |
| se | 40,877 | Sexual Exploitation |
| sec | 36,576 | Secure (安全/无风险) |
| ter | 35,822 | Terrorism |
| ti | 40,875 | Threat / Intimidation |

### 4 中文动态策略标签（cn_*）

| 标签 | 样本数 | 说明 |
|------|--------|------|
| cn_fraud | 35,000 | 中文诈骗 |
| cn_gamble | 35,000 | 中文赌博 |
| cn_mlm | 35,000 | 中文传销 |
| cn_rumor | 35,000 | 中文谣言 |

## 数据构成

### 按阶段分布

| 阶段 | 样本数 | 说明 |
|------|--------|------|
| q | 942,336 | 仅问题（query-only） |
| qr | 170,530 | 问答对（query-response） |
| r | 105,942 | 仅回复（response-only） |

### 按类型分布（Top 10）

| 类型 | 样本数 | 说明 |
|------|--------|------|
| general | 295,982 | 通用样本 |
| boundary | 164,268 | 边界样本 |
| label_expansion | 153,994 | 标签扩展 |
| hard_negative | 151,200 | 困难负样本 |
| adversarial | 117,709 | 对抗样本 |
| dynamic_policy | 90,664 | 动态策略（cn_*） |
| confusion_boundary | 80,000 | 混淆边界 |
| cross_lingual | 29,407 | 跨语言 |
| r_boost | 24,657 | 回复增强 |
| label_fill | 24,186 | 标签填充 |

## 数据格式

每行一个 JSON 对象，对话式 SFT 格式：

```json
{
  "messages": [
    {"role": "system", "content": "<system prompt with label definitions>"},
    {"role": "user", "content": "<user message>"},
    {"role": "assistant", "content": "<label>"}
  ]
}
```

## 使用方式

### ModelScope SDK

```python
from modelscope.msdatasets import MsDataset
ds = MsDataset.load('CLJY2026/XGuard-v22-Safety-Classification')
```

### Git Clone

```bash
git lfs install
git clone https://www.modelscope.cn/datasets/CLJY2026/XGuard-v22-Safety-Classification.git
```

## 许可证

Apache License 2.0
