---
title: nlp_polylm_multialpaca_sft
canonical_url: "https://www.modelscope.cn/datasets/iic/nlp_polylm_multialpaca_sft"
md_url: "https://www.modelscope.cn/datasets/iic/nlp_polylm_multialpaca_sft.md"
repository: iic/nlp_polylm_multialpaca_sft
chinese_name: "MultiAlpaca多语言指令精调数据集"
last_updated: 2024-09-03
license: "Apache License 2.0"
storage_size: "57 MB"
domain:
  - configs
  - text
tasks:
  - "{config_name=vi, data_files=[{path=vi.jsonl, split=train}]}"
  - conversational
languages:
  - ar
  - de
  - es
  - fr
  - id
  - ja
  - ko
  - pt
  - ru
  - th
  - vi
size_scale:
  - 10k-100k
type:
  - task-qa
downloads: 9066
stars: 17
---

# nlp_polylm_multialpaca_sft

> nlp_polylm_multialpaca_sft - iic 在 ModelScope 开源的数据集。MultiAlpaca数据集是根据self-instruct思想构建的多语言指令精调数据集

iic/nlp_polylm_multialpaca_sft 是 ModelScope 魔搭社区上的{config_name=vi, data_files=[{path=vi.jsonl, split=train}]}、conversational数据集，涉及 configs、text 领域，存储大小 57 MB，采用 Apache License 2.0 许可。

- **Repository**: iic/nlp_polylm_multialpaca_sft
- **License**: Apache License 2.0
- **Tasks**: {config_name=vi, data_files=[{path=vi.jsonl, split=train}]}, conversational
- **Domain**: configs, text
- **Storage size**: 57 MB
- **Downloads**: 9066
- **Stars**: 17
- **Last updated**: 2024-09-03

Source: https://www.modelscope.cn/datasets/iic/nlp_polylm_multialpaca_sft

---

## 数据集描述
MultiAlpaca数据集是根据self-instruct思想构建的多语言指令数据集。

### 数据集简介
本数据集涉及语言有阿拉伯语（Ar)、德语（De）、西班牙语（Es）、法语（Fr）、印度尼西亚语（Id）、日语（Ja）、韩语（Ko）、葡萄牙语（Pt）、俄语（Ru）、泰语（Th）、越南语（Vi），共计11个语种。

本数据集共计132,701条数据，具体到每个语言从9,515至14,671不等。如下表所示：

|**Language-key**|**Language**|**\# examples**|
|---

-|---

-|---

-|
|ar|Arabic|14,671|
|de|German|9,515|
|es|Spanish|9,958|
|fr|France|11,332|
|id|Indonesian|12,117|
|ja|Japanese|10,191|
|ko|Korean|14,402|
|pt|Portuguese|10,825|
|ru|Russian|14,286|
|th|Thai|11,496|
|vi|Vietnamese|13,908|


### 数据集支持的任务
该数据集支持对多语言大模型（large language models, LLMs）进行监督微调学习（supervised fine-tuning, SFT）。

## 数据集的格式和结构

### 数据格式
数据共分为11个文件，每个文件对应每个语言。

数据文件以jsonlines格式存储，每一行代表着一个SFT样本。

每个样本含有三个关键字：instruction, input, output，其中：
- instruction为对应任务的介绍
- input为对应任务所需的输入。部分任务的instruction字段可能已经构成一个完整的问题，则此情况下input字段为空。
- output为对应任务的输出。

### 数据集加载方式
```
from modelscope.msdatasets import MsDataset
ds =  MsDataset.load('damo/nlp_polylm_multialpaca_sft', subset_name='ar', split='train')
print(next(iter(ds)))

# Note: subset_name参数设置参考上表中的Language-key
```

### 数据分片
此数据集用作训练集使用，未进行数据分片。


## 数据集生成的相关信息

### 原始数据

原始数据通过迭代式self-instruct收集，通过构造对应语言提示指令（prompt）引导大模型自我生成SFT任务。原始数据收集后经过格式过滤和重复性过滤汇总为整个数据集。

### 数据集标注

该数据集未进行人工标注。

## 数据集版权信息

数据集已经开源，license为Apache License 2.0，如有违反相关条款，随时联系modelscope删除。

本数据集仅可供相关科学研究使用。因使用此数据集于其它场景（特别是业务场景）造成的法务、经济等风险及损失，本团队概不负责。

## 引用方式

若此数据集对您研究有帮助，请于研究相关论文、报告中按照以下格式引用[参考论文](https://arxiv.org/abs/2307.06018)：
```
@misc{wei2023polylm,
      title={PolyLM: An Open Source Polyglot Large Language Model}, 
      author={Xiangpeng Wei and Haoran Wei and Huan Lin and Tianhao Li and Pei Zhang and Xingzhang Ren and Mei Li and Yu Wan and Zhiwei Cao and Binbin Xie and Tianxiang Hu and Shangjie Li and Binyuan Hui and Bowen Yu and Dayiheng Liu and Baosong Yang and Fei Huang and Jun Xie},
      year={2023},
      eprint={2307.06018},
      archivePrefix={arXiv},
      primaryClass={cs.CL}
}
```

## 其他相关信息

本数据集可能会存在潜在风险，如事实性错误、偏见等。使用该数据集时请注意数据本身的潜在风险。
