---
title: GuanacoDataset
canonical_url: "https://www.modelscope.cn/datasets/AI-ModelScope/GuanacoDataset"
md_url: "https://www.modelscope.cn/datasets/AI-ModelScope/GuanacoDataset.md"
repository: AI-ModelScope/GuanacoDataset
chinese_name: GuanacoDataset
last_updated: 2024-09-02
license: GPL-3.0
storage_size: "248 MB"
domain:
  - configs
  - text
tasks:
  - "{config_name=default, data_files=[{path=guanaco_chat_all-utf8.jsonl, split=train}]}"
  - conversational
  - question-answering
  - text-generation
size_scale:
  - 10k-1m
type:
  - task-qa
language:
  - cn
  - en
downloads: 1155
stars: 1
---

# GuanacoDataset

> GuanacoDataset - AI-ModelScope 在 ModelScope 开源的数据集。数据集描述 It contains 534610 en instructions generated by text-davinci-003 upon 175 tasks from the Alpaca model by providing rewrites of seed tasks in different languages and adding new tasks specifically…

AI-ModelScope/GuanacoDataset 是 ModelScope 魔搭社区上的{config_name=default, data_files=[{path=guanaco_chat_all-utf8.jsonl, split=train}]}、conversational、question-answering数据集，涉及 configs、text 领域，存储大小 248 MB，采用 GPL-3.0 许可。

- **Repository**: AI-ModelScope/GuanacoDataset
- **License**: GPL-3.0
- **Tasks**: {config_name=default, data_files=[{path=guanaco_chat_all-utf8.jsonl, split=train}]}, conversational, question-answering, text-generation
- **Domain**: configs, text
- **Storage size**: 248 MB
- **Downloads**: 1155
- **Stars**: 1
- **Last updated**: 2024-09-02

Source: https://www.modelscope.cn/datasets/AI-ModelScope/GuanacoDataset

---

## 数据集描述
It contains 534610 en instructions generated by text-davinci-003 upon 175 tasks from the Alpaca model by providing rewrites of seed tasks in different languages and adding new tasks specifically designed for English grammar analysis, natural language understanding, cross-lingual self-awareness, and explicit content recognition.

### 数据集加载方式
```Python
from modelscope.msdatasets import MsDataset
from modelscope.utils.constant import DownloadMode

# Load the dataset
ds_train = MsDataset.load('AI-ModelScope/GuanacoDataset', subset_name='subset', split='train')
#subset_name='default' or 'subset'
print(next(iter(ds_train)))
```

### Clone with HTTP
```bash
git clone https://www.modelscope.cn/datasets/AI-ModelScope/GuanacoDataset.git
```
