---
title: 494Hours-HindiSpontaneousSpeechData
canonical_url: "https://www.modelscope.cn/datasets/DatatangBeijing/494Hours-HindiSpontaneousSpeechData"
md_url: "https://www.modelscope.cn/datasets/DatatangBeijing/494Hours-HindiSpontaneousSpeechData.md"
repository: DatatangBeijing/494Hours-HindiSpontaneousSpeechData
chinese_name: "数据堂—494小时印地语语音数据_口语化"
last_updated: 2024-05-09
license: "Apache License 2.0"
storage_size: "980 KB"
domain:
  - audio
tasks:
  - auto-speech-recognition
language:
  - other
sampling_rate:
  - 16000
downloads: 98
stars: 0
---

# 494Hours-HindiSpontaneousSpeechData

> 494Hours-HindiSpontaneousSpeechData - DatatangBeijing 在 ModelScope 开源的数据集。印地语语音数据_口语化，内容覆盖访谈、脱口秀、综艺等领域。反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别等多种属性，由来自不同地域和文化背景的印地本土人录制，准确性高，易用性强，为语音识别相关研究及应用提供了丰富的资源，有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定，确保数据采集、存储和使用的过程中维护用户的隐私和合…

DatatangBeijing/494Hours-HindiSpontaneousSpeechData 是 ModelScope 魔搭社区上的auto-speech-recognition数据集，涉及 audio 领域，存储大小 980 KB，采用 Apache License 2.0 许可。

- **Repository**: DatatangBeijing/494Hours-HindiSpontaneousSpeechData
- **License**: Apache License 2.0
- **Tasks**: auto-speech-recognition
- **Domain**: audio
- **Storage size**: 980 KB
- **Downloads**: 98
- **Stars**: 0
- **Last updated**: 2024-05-09

Source: https://www.modelscope.cn/datasets/DatatangBeijing/494Hours-HindiSpontaneousSpeechData

---

# 数据堂494小时印地语语音数据_口语化

## 数据集描述
用于语音识别相关研究及应用的测试任务

### 数据集简介
印地语语音数据_口语化，内容覆盖访谈、脱口秀、综艺等领域。反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别等多种属性，由来自不同地域和文化背景的印地本土人录制，准确性高，易用性强，为语音识别相关研究及应用提供了丰富的资源，有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定，确保数据采集、存储和使用的过程中维护用户的隐私和合法权益，所有数据均遵循GDPR, CCPA, PIPL

### 数据集支持的任务
用于语音识别相关研究及应用的测试任务

## 数据集的格式和结构

### 格式
16kHz，16 bit， wav，单声道

### 内容分类
包含访谈类、脱口秀类、综艺类等；

### 录音环境
低噪

### 国家
印度

### 语言地区代码
hi-IN

### 语言
印地语

### 标注特点
标注文本内容、句时间戳、说话人标识、性别、噪音标注

### 准确率
词准确率98%

## 数据集生成的相关信息

## 数据集版权信息
版权归数据堂所有，商用数据。

## 其他相关信息
详见https://www.datatang.com/dataset/1269?source=modelscope
