---
title: alpaca-gpt4-data-zh
canonical_url: "https://www.modelscope.cn/datasets/AI-ModelScope/alpaca-gpt4-data-zh"
md_url: "https://www.modelscope.cn/datasets/AI-ModelScope/alpaca-gpt4-data-zh.md"
repository: AI-ModelScope/alpaca-gpt4-data-zh
chinese_name: alpaca-gpt4-data-zh
last_updated: 2024-04-23
license: "CC BY NC 4.0"
storage_size: "30 MB"
domain:
  - text
tasks:
  - TextGeneration
language:
  - zh
size_scale:
  - 10k-100k
downloads: 341518
stars: 76
---

# alpaca-gpt4-data-zh

> alpaca-gpt4-data-zh - AI-ModelScope 在 ModelScope 开源的数据集。alpaca-gpt4 中文数据集

AI-ModelScope/alpaca-gpt4-data-zh 是 ModelScope 魔搭社区上的TextGeneration数据集，涉及 text 领域，存储大小 30 MB，采用 CC BY NC 4.0 许可。

- **Repository**: AI-ModelScope/alpaca-gpt4-data-zh
- **License**: CC BY NC 4.0
- **Tasks**: TextGeneration
- **Domain**: text
- **Storage size**: 30 MB
- **Downloads**: 341518
- **Stars**: 76
- **Last updated**: 2024-04-23

Source: https://www.modelscope.cn/datasets/AI-ModelScope/alpaca-gpt4-data-zh

---

## 数据集描述
该数据集为GPT-4生成的中文数据集，用于LLM的指令精调和强化学习等。



### 数据集加载方式
```python
from modelscope.msdatasets import MsDataset
ds = MsDataset.load("alpaca-gpt4-data-zh", namespace="AI-ModelScope", split="train")
print(next(iter(ds)))
```

### 数据分片
数据已经预设了train分片。



## 数据集版权信息
数据集已经开源，license为CC BY NC 4.0（仅用于非商业化用途），如有违反相关条款，随时联系modelscope删除。


## 引用方式
```
@article{peng2023gpt4llm,
    title={Instruction Tuning with GPT-4},
    author={Baolin Peng, Chunyuan Li, Pengcheng He, Michel Galley, Jianfeng Gao},
    journal={arXiv preprint arXiv:2304.03277},
    year={2023}
}
```

## 参考链接
```
https://huggingface.co/datasets/c-s-ale/alpaca-gpt4-data-zh
https://github.com/Instruction-Tuning-with-GPT-4/GPT-4-LLM
```

### Clone with HTTP
```bash
git clone https://www.modelscope.cn/datasets/AI-ModelScope/alpaca-gpt4-data-zh.git
```
