---
title: nlp_plug_question-generation_27B
canonical_url: "https://www.modelscope.cn/models/damo/nlp_plug_question-generation_27B"
md_url: "https://www.modelscope.cn/models/damo/nlp_plug_question-generation_27B.md"
repository: damo/nlp_plug_question-generation_27B
chinese_name: "PLUG通用问题生成模型-中文-27B"
last_updated: 2022-11-30
license: "Apache License 2.0"
pipeline_tag: text-generation
tasks:
  - text-generation
model_type:
  - PLUG
library_name:
  - pytorch
frameworks:
  - pytorch
language:
  - ch
domain:
  - nlp
downloads: 3830
stars: 7
tags:
  - transformer
  - Alibaba
---

# nlp_plug_question-generation_27B

> nlp_plug_question-generation_27B - damo 在 ModelScope 开源的模型。PLUG通用问题生成模型-中文-27B

damo/nlp_plug_question-generation_27B 是 ModelScope 魔搭社区上的text-generation模型，采用 Apache License 2.0 许可。

- **Repository**: damo/nlp_plug_question-generation_27B
- **License**: Apache License 2.0
- **Tasks**: text-generation
- **Tags**: transformer, Alibaba
- **Downloads**: 3830
- **Stars**: 7
- **Last updated**: 2022-11-30

Source: https://www.modelscope.cn/models/damo/nlp_plug_question-generation_27B

---

# 大规模中文理解和生成联合模型PLUG

PLUG (Pre-training for Language Understanding and Generation) 是一个270亿参数的大规模中文理解和生成联合预训练模型。

## 模型描述

PLUG是有海量高质量中文文本预训练得到的理解和生成联合模型。PLUG的训练由两阶段组成。首先我们训练了一个24层的基于[StructBERT](https://arxiv.org/abs/1908.04577)的encoder，然后我们基于此训练了一个24+6层的[PALM](https://arxiv.org/pdf/2004.07159.pdf?fbclid=IwAR0BNl1IzR5bhcuEbyfNw2UN7MApHFoFP3BN40FKkW8x3bqolK_HilU293I) encoder-decoder。这使得模型既可以通过finetune来处理文本分类、序列标注等自然语言理解（NLU）任务，也可以用来处理自然语言生成（NLG）的任务。

![PLUG architecture](resources/architecture.png)

## 期望模型使用方式以及适用范围
本模型可直接用于文本生成，也可以通过finetune用于各类文本理解的任务。用户可以自行尝试各种输入文档。具体调用方式请参考代码示例。

### 如何使用
在安装完成ModelScope-lib之后即可使用PLUG的能力。

#### 代码范例
此范例为单机8卡(GPU)示例，运行时每张GPU约占用显存12G。
1. 通过model_id获取默认model_dir
```python
from modelscope.hub.snapshot_download import snapshot_download
model_id = 'damo/nlp_plug_question-generation_27B'
model_dir = snapshot_download(model_id)
print(model_dir)
```
2. 将模型二进制文件下载至model_dir/model，下载地址获取：https://github.com/alibaba/AliceMind/tree/main/PLUG#pre-trained-model-download

3. 模型调用
```python
from modelscope.pipelines import pipeline
from modelscope.utils.constant import Tasks

input = '爬行垫根据中间材料的不同可以分为:XPE爬行垫、EPE爬行垫、EVA爬行垫、PVC爬行垫;其中XPE爬行垫、EPE爬行垫都属于PE材>料加保鲜膜复合而成,都是无异味的环保材料,但是XPE爬行垫是品质较好的爬行垫,韩国进口爬行垫都是这种爬行垫,而EPE爬行垫是国内>厂家为了减低成本,使用EPE(珍珠棉)作为原料生产的一款爬行垫,该材料弹性差,易碎,开孔发泡防水性弱。EVA爬行垫、PVC爬行垫是用EVA或PVC作为原材料与保鲜膜复合的而成的爬行垫,或者把图案转印在原材料上,这两款爬行垫通常有异味,如果是图案转印的爬行垫,油墨>外露容易脱落。 当时我儿子爬的时候,我们也买了垫子,但是始终有味。最后就没用了,铺的就的薄毯子让他爬。'
model_id = 'damo/nlp_plug_question-generation_27B'
pipe = pipeline(Tasks.text_generation, model=model_id)

# out_length为期望的生成长度，最大为512
result = pipe(input, out_length=256)
print(result)

# 预期输出：output: {'text': '爬行垫什么材质的好爬行垫什么材质的好'}
```

### 模型局限性以及可能的偏差
模型训练数据有限，效果可能存在一定偏差。

## 训练数据介绍
数据来源于[https://huggingface.co/datasets/wikipedia](https://huggingface.co/datasets/wikipedia)和[https://commoncrawl.org/](https://commoncrawl.org/)

## 模型训练流程
在中文wiki/ Common crawl等无监督数据上，通过"模型描述"章节介绍的训练任务训练了约300B字得到。
### 预处理
暂无
### 训练
暂无
### 数据评估及结果

#### Finetune
* [CLUE classification benchmark](https://www.cluebenchmarks.com/classification.html), 结果来自2021/04/20

![clue](resources/clue.png)

* 在问题生成任务上的finetune结果

|Model|Metric|[KBQG](https://github.com/nanduan/NLPCC-KBQA)|[DuReaderQG](https://arxiv.org/abs/1711.05073)|[DuReader-Robust](https://arxiv.org/abs/2004.11142)|
|-----|-----|-------|--------|----|
|plug.zh|BLEU-4|66.30|49.20|42.83|


#### Zero-shot示例
* 小说生成

![novel generation](resources/zero-shot1.png)

* 技术文档撰写

![Scientific Literature generation](resources/zero-shot2.png)

* 常识问答

![common sense q&a](resources/zero-shot3.png)

* Zero-shot分类

![zero-shot classification](resources/zero-shot4.png)

### 开源信息
PLUG同时开源到了[AliceMind](https://github.com/alibaba/AliceMind)，如果我们的工作对您有帮助，欢迎给我们Star。
