---
title: speech_asr_commonvoice_ru_trainsets
canonical_url: "https://www.modelscope.cn/datasets/modelscope/speech_asr_commonvoice_ru_trainsets"
md_url: "https://www.modelscope.cn/datasets/modelscope/speech_asr_commonvoice_ru_trainsets.md"
repository: modelscope/speech_asr_commonvoice_ru_trainsets
chinese_name: "俄语语音识别Common Voice学术数据集"
last_updated: 2023-01-14
license: "Apache License 2.0"
storage_size: "5.8 MB"
domain:
  - audio
tasks:
  - auto-speech-recognition
languages:
  - ru
sampling_rates:
  - 16000
downloads: 1165
stars: 1
---

# speech_asr_commonvoice_ru_trainsets

> speech_asr_commonvoice_ru_trainsets - modelscope 在 ModelScope 开源的数据集。应用于Common Voice学术数据集的俄语语音识别模型（speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-online，speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-offline）的Common Voice训练集

modelscope/speech_asr_commonvoice_ru_trainsets 是 ModelScope 魔搭社区上的auto-speech-recognition数据集，涉及 audio 领域，存储大小 5.8 MB，采用 Apache License 2.0 许可。

- **Repository**: modelscope/speech_asr_commonvoice_ru_trainsets
- **License**: Apache License 2.0
- **Tasks**: auto-speech-recognition
- **Domain**: audio
- **Storage size**: 5.8 MB
- **Downloads**: 1165
- **Stars**: 1
- **Last updated**: 2023-01-14

Source: https://www.modelscope.cn/datasets/modelscope/speech_asr_commonvoice_ru_trainsets

---

# 俄语语音识别Common Voice学术数据集

## 数据集描述
Common Voice是一个多语言开源语音学术数据集。 此数据集包含了可应用于俄语语语音识别模型（[speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-online](https://www.modelscope.cn/models/damo/speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-online/summary), [speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-offline](https://www.modelscope.cn/models/damo/speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-offline/summary) ）的Common Voice训练集、开发集、测试集。

### 数据集简介
Common Voice是一个多语言开源语音学术数据集，由Mozilla基金会发起的以众包方式收集的大型公开语料库。以麦克风来进行录音及分类他人所录制的声音。收集的句子及语音都以CC0授权释出至公开数据库当中。第一版语料库发布于2017年。截止2022年底，Common Voice数据集已收录了约26,119小时录音，包含多种多样人口相关的元数据（如年龄、性别、口音等），其中有约17,127小时覆盖104语种的有效数据，每个语种包含建立该语种语音识别模型所需的训练集、开发集、测试集。

### 语种
俄语 (Russian)

### 数据集支持的任务
支持“Common Voice学术数据集的语音识别模型”模型的训练、开发和测试任务

## 数据集的格式和结构

### 数据格式
16KHz采样率，单通道音频，wav格式。

### 数据集加载方式
无

### 数据分片
- 训练集: speech_asr_commonvoice_ru_trainsets
- 验证集: speech_asr_commonvoice_ru_devsets
- 测试集: speech_asr_commonvoice_ru_testsets


## 数据集生成的相关信息

### 原始数据
无

### 数据集标注
无

#### 标注过程
无

#### 标注者
无

## 数据集版权信息
版权归Mozilla所有，支持学术研究，未经允许禁止商用。
Content available under a Creative Commons license.

## 引用方式
详见[https://commonvoice.mozilla.org/en/datasets](https://commonvoice.mozilla.org/en/datasets)
