---
title: 34Hours-HindiChildsSpontaneousSpeechData
canonical_url: "https://www.modelscope.cn/datasets/DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData"
md_url: "https://www.modelscope.cn/datasets/DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData.md"
repository: DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData
chinese_name: "数据堂—34小时印度印地语儿童语音数据_口语化"
last_updated: 2024-05-10
license: "Apache License 2.0"
storage_size: "1.0 MB"
domain:
  - audio
tasks:
  - auto-speech-recognition
language:
  - other
sampling_rate:
  - 16000
downloads: 161
stars: 0
---

# 34Hours-HindiChildsSpontaneousSpeechData

> 34Hours-HindiChildsSpontaneousSpeechData - DatatangBeijing 在 ModelScope 开源的数据集。印度印地语儿童语音数据_口语化，内容覆盖自媒体、对话、直播、讲座、综艺等通用领域，反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别、口音等多种属性，由多名12岁及以下、来自不同地域和文化背景的印度儿童录制，准确性高，易用性强，为语音识别相关研究及应用提供了丰富的资源，有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私…

DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData 是 ModelScope 魔搭社区上的auto-speech-recognition数据集，涉及 audio 领域，存储大小 1.0 MB，采用 Apache License 2.0 许可。

- **Repository**: DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData
- **License**: Apache License 2.0
- **Tasks**: auto-speech-recognition
- **Domain**: audio
- **Storage size**: 1.0 MB
- **Downloads**: 161
- **Stars**: 0
- **Last updated**: 2024-05-10

Source: https://www.modelscope.cn/datasets/DatatangBeijing/34Hours-HindiChildsSpontaneousSpeechData

---

# 数据堂34小时印度印地语儿童语音数据_口语化

## 数据集描述
用于语音识别相关研究及应用的测试任务

### 数据集简介
印度印地语儿童语音数据_口语化，内容覆盖自媒体、对话、直播、讲座、综艺等通用领域，反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别、口音等多种属性，由多名12岁及以下、来自不同地域和文化背景的印度儿童录制，准确性高，易用性强，为语音识别相关研究及应用提供了丰富的资源，有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定，确保数据采集、存储和使用的过程中维护用户的隐私和合法权益，所有数据均遵循GDPR, CCPA, PIPL

### 数据集支持的任务
用于语音识别相关研究及应用的测试任务

## 数据集的格式和结构

### 格式
16kHz，16 bit， wav，单声道

### 儿童年龄
12岁及以下

### 内容分类
对话类、自媒体类、综艺类等

### 录音环境
低噪

### 国家
印度

### 语言地区代码
hi-IN

### 语言
印地语

### 标注特点
标注文本内容、句时间戳、说话人标识、性别、噪音标注

### 准确率
词准确率98%

## 数据集生成的相关信息

## 数据集版权信息
版权归数据堂所有，商用数据。

## 其他相关信息
详见https://www.datatang.com/dataset/1377?source=modelscope
