---
title: 1000000Groups-Chinese-RussianParallelCorpusData
canonical_url: "https://www.modelscope.cn/datasets/DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData"
md_url: "https://www.modelscope.cn/datasets/DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData.md"
repository: DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData
chinese_name: "数据堂—100万组中俄平行语料数据"
last_updated: 2024-05-07
license: "Apache License 2.0"
storage_size: "1.3 MB"
domain:
  - text
tasks:
  - translation
language:
  - ru
downloads: 95
stars: 0
---

# 1000000Groups-Chinese-RussianParallelCorpusData

> 1000000Groups-Chinese-RussianParallelCorpusData - DatatangBeijing 在 ModelScope 开源的数据集。100万组中俄平行互译语料，数据存储格式为txt文档，覆盖旅游、医药、日常、电视剧等多个领域。已进行数据清洗脱敏质检，可作为文本类数据分析的基础语料库，用于机器翻译等领域

DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData 是 ModelScope 魔搭社区上的translation数据集，涉及 text 领域，存储大小 1.3 MB，采用 Apache License 2.0 许可。

- **Repository**: DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData
- **License**: Apache License 2.0
- **Tasks**: translation
- **Domain**: text
- **Storage size**: 1.3 MB
- **Downloads**: 95
- **Stars**: 0
- **Last updated**: 2024-05-07

Source: https://www.modelscope.cn/datasets/DatatangBeijing/1000000Groups-Chinese-RussianParallelCorpusData

---

# 数据堂100万组中俄平行语料数据

## 数据集描述
用于机器翻译的测试任务

### 数据集简介
100万组中俄平行互译语料，数据存储格式为txt文档，覆盖旅游、医药、日常、电视剧等多个领域。已进行数据清洗脱敏质检，可作为文本类数据分析的基础语料库，用于机器翻译等领域

### 数据集支持的任务
用于机器翻译的测试任务

## 数据集的格式和结构

### 储存格式
TXT

### 数据内容
中俄平行语料

### 数据规模
100万对中俄平行语料数据，中文句长平均14.6个字符

### 语言
汉语，俄语

### 应用场景
机器翻译

## 数据集生成的相关信息

## 数据集版权信息
版权归数据堂所有，商用数据。

## 其他相关信息
详见https://www.datatang.com/dataset/1071?source=modelscope
