---
title: Llama3-Chinese-Dataset
canonical_url: "https://www.modelscope.cn/datasets/zhuangxialie/Llama3-Chinese-Dataset"
md_url: "https://www.modelscope.cn/datasets/zhuangxialie/Llama3-Chinese-Dataset.md"
repository: zhuangxialie/Llama3-Chinese-Dataset
chinese_name: "Llama3 中文数据集"
last_updated: 2024-04-26
license: "Apache License 2.0"
storage_size: "2.2 GB"
downloads: 4352
stars: 23
---

# Llama3-Chinese-Dataset

> Llama3-Chinese-Dataset - zhuangxialie 在 ModelScope 开源的数据集。中文微调数据集 已全转为ShareGPT格式（直接使用要删除README、datasetinfos.json） firefly-train-1.1M 包含了23种常见的中文NLP任务的数据，并且构造了许多与中华文化相关的数据，如对联、作诗、文言文翻译、散文、金庸小说等。对于每个任务，由人工书写若干种指令模板，保证数据的高质量与丰富度，数据量为115万。 CodeChat…

zhuangxialie/Llama3-Chinese-Dataset 是 ModelScope 魔搭社区上的数据集，存储大小 2.2 GB，采用 Apache License 2.0 许可。

- **Repository**: zhuangxialie/Llama3-Chinese-Dataset
- **License**: Apache License 2.0
- **Storage size**: 2.2 GB
- **Downloads**: 4352
- **Stars**: 23
- **Last updated**: 2024-04-26

Source: https://www.modelscope.cn/datasets/zhuangxialie/Llama3-Chinese-Dataset

---

## 中文微调数据集
### 已全转为ShareGPT格式（直接使用要删除README、dataset_infos.json）
### firefly-train-1.1M
- 包含了23种常见的中文NLP任务的数据，并且构造了许多与中华文化相关的数据，如对联、作诗、文言文翻译、散文、金庸小说等。对于每个任务，由人工书写若干种指令模板，保证数据的高质量与丰富度，数据量为115万。
### CodeChat
- 主要包含逻辑推理、代码问答、代码生成相关语料样本。
### shareAIShareGPT-Chinese-English-90k
- 中英文平行双语优质人机问答数据集，覆盖真实复杂场景下的用户提问。（包含大量多轮对话）
### ruozhiba
- 弱智吧数据问答，据说比较锻炼模型的心智能力。


### 附带Python脚本，可统一转为ShareGPT格式
### 原版未处理格式汇总
- https://modelscope.cn/datasets/zhuangxialie/SFT-Chinese-Dataset/summary


#### 下载方法 
:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}
