---
title: NLPCC2018-test
canonical_url: "https://www.modelscope.cn/datasets/DAMO_NLP/NLPCC2018-test"
md_url: "https://www.modelscope.cn/datasets/DAMO_NLP/NLPCC2018-test.md"
repository: DAMO_NLP/NLPCC2018-test
chinese_name: "NLPCC2018中文语法纠错测试集"
last_updated: 2022-10-26
license: "Apache License 2.0"
storage_size: "394 KB"
domain:
  - text
tasks:
  - text-error-correction
language:
  - zh
type:
  - "seq2edits&seq2seq"
downloads: 1483
stars: 4
---

# NLPCC2018-test

> NLPCC2018-test - DAMO_NLP 在 ModelScope 开源的数据集。NLPCC2018中文语法纠错测试集是NLPCC 2018 shared task 2中开出的数据集，目前学术界往往用该数据集作为评估模型性能的测试集。.详见官网http://tcci.ccf.org.cn/conference/2018/taskdata.php。

DAMO_NLP/NLPCC2018-test 是 ModelScope 魔搭社区上的text-error-correction数据集，涉及 text 领域，存储大小 394 KB，采用 Apache License 2.0 许可。

- **Repository**: DAMO_NLP/NLPCC2018-test
- **License**: Apache License 2.0
- **Tasks**: text-error-correction
- **Domain**: text
- **Storage size**: 394 KB
- **Downloads**: 1483
- **Stars**: 4
- **Last updated**: 2022-10-26

Source: https://www.modelscope.cn/datasets/DAMO_NLP/NLPCC2018-test

---

## 概述

NLPCC2018中文语法纠错测试集是NLPCC 2018 shared task 2中开出的数据集，目前学术界往往用该数据集作为评估模型性能的测试集。

## 数据集描述

本数据集包括测试集2,000条。其中，每一条数据有两个属性，分别是待纠错句子（分词后）和修改编辑edits。数据格式为csv格式，请用相应的标准csv库来解析。

## 示例
冬阴功 是 泰国 最 著名 的 菜 之一 ， 它 虽然 不 是 很 豪华 ， 但 它 的 味 确实 让 人 上瘾 ， 做法 也 不 难 、 不 复杂 。,9 11|||W|||虽然 它|||REQUIRED|||-NONE-|||0

csv格式，请用标准csv库解析。第一列src是Pku分词器分词后的句子，第二列为修改编辑，用"|||"间隔，"9 11"表示src中第[9,11)需要修改，"W"是错误类型，表示乱序；"虽然 它"是纠正结果。整个编辑的意思是，src中第9个词和第10个词"它 虽然"存在乱序错误，应修改为"虽然 它"。  

## Clone with HTTP
* http://www.modelscope.cn/datasets/DAMO_NLP/NLPCC2018-test.git
