---
title: 155Hours-LipSyncMultimodalVideoData
canonical_url: "https://www.modelscope.cn/datasets/DatatangBeijing/155Hours-LipSyncMultimodalVideoData"
md_url: "https://www.modelscope.cn/datasets/DatatangBeijing/155Hours-LipSyncMultimodalVideoData.md"
repository: DatatangBeijing/155Hours-LipSyncMultimodalVideoData
chinese_name: "数据堂—155小时唇形同步视频数据_多模态"
last_updated: 2024-05-06
license: "Apache License 2.0"
storage_size: "699 KB"
domain:
  - multi_modal
tasks:
  - feature-extraction
downloads: 206
stars: 2
---

# 155Hours-LipSyncMultimodalVideoData

> 155Hours-LipSyncMultimodalVideoData - DatatangBeijing 在 ModelScope 开源的数据集。249人参与录制语音以及相匹配的唇语视频，多设备同步录制，通过脉冲信号进行精准对齐，准确性高。可用于语音图像领域的多模态学习算法研究。经多家AI公司验证：有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定，确保数据采集、存储和使用的过程中维护用户的隐私和合法权益，所有数据均遵循GDPR, CCPA, PIPL

DatatangBeijing/155Hours-LipSyncMultimodalVideoData 是 ModelScope 魔搭社区上的feature-extraction数据集，涉及 multi_modal 领域，存储大小 699 KB，采用 Apache License 2.0 许可。

- **Repository**: DatatangBeijing/155Hours-LipSyncMultimodalVideoData
- **License**: Apache License 2.0
- **Tasks**: feature-extraction
- **Domain**: multi_modal
- **Storage size**: 699 KB
- **Downloads**: 206
- **Stars**: 2
- **Last updated**: 2024-05-06

Source: https://www.modelscope.cn/datasets/DatatangBeijing/155Hours-LipSyncMultimodalVideoData

---

# 数据堂155小时唇形同步多模态视频数据


## 数据集描述
用于155小时唇形同步多模态视频数据 用于语音图像领域的多模态学习算法研究。

### 数据集简介

249人参与录制语音以及相匹配的唇语视频，多设备同步录制，通过脉冲信号进行精准对齐，准确性高。可用于语音图像领域的多模态学习算法研究。

### 数据集支持的任务
用于语音图像领域的多模态学习算法研究。

## 数据集的格式和结构

### 数据格式
视频mp4格式，1,280*720；音频wav格式，16kHz 16bit单声道

### 人员
249名中国人，男女比例均衡

### 录制角度
同时录制正脸、单一面侧脸、俯视、仰视、侧脸俯视、侧脸仰视6个角度的视频（含音视频），以及近端、远端2个距离的音频（不含视频）


## 数据集生成的相关信息

### 原始数据
无

### 数据集标注
句准确率不低于98%


#### 标注过程
无

#### 标注者
无


## 数据集版权信息
版权归数据堂所有，商用数据。


## 其他相关信息
详见https://www.datatang.com/dataset/996?source=modelscope
