---
title: Genesis_VQA
canonical_url: "https://www.modelscope.cn/datasets/manlei/Genesis_VQA"
md_url: "https://www.modelscope.cn/datasets/manlei/Genesis_VQA.md"
repository: manlei/Genesis_VQA
last_updated: 2025-10-02
license: "Apache License 2.0"
storage_size: "2.2 MB"
downloads: 1018
stars: 0
---

# Genesis_VQA

> Genesis_VQA - manlei 在 ModelScope 开源的数据集。本数据集是一个大规模的多模态视频理解与推理基准数据集, 视频内容涵盖多种现实生活场景（辩论、家庭、教育、社交、军事、历史等），平均时长约50分钟。数据集专注于评估模型在长视频场景下的综合理解能力，从基础的视觉感知到高层次的逻辑推理。

manlei/Genesis_VQA 是 ModelScope 魔搭社区上的数据集，存储大小 2.2 MB，采用 Apache License 2.0 许可。

- **Repository**: manlei/Genesis_VQA
- **License**: Apache License 2.0
- **Storage size**: 2.2 MB
- **Downloads**: 1018
- **Stars**: 0
- **Last updated**: 2025-10-02

Source: https://www.modelscope.cn/datasets/manlei/Genesis_VQA

---

# 多模态视频理解与推理数据集

## 数据集概述

本数据集是一个大规模的多模态视频理解与推理基准数据集。视频内容涵盖多种现实生活场景（辩论、家庭、教育、社交、军事、历史等），平均时长约50分钟。数据集专注于评估模型在长视频场景下的综合理解能力，从基础的视觉感知到高层次的逻辑推理。

## 数据集特点

- **多层次理解体系**：涵盖8种问题类型，从低级视觉细节到高级认知推理
- **精确时间定位**：每个问题都标注了对应的视频时间戳
- **长视频理解**：平均视频时长50分钟，测试长时记忆和事件链理解能力
- **多选题格式**：每个问题包含5个候选答案，降低猜测概率
- **真实场景覆盖**：多样化的视频来源，测试模型的泛化能力

## 问题类型

数据集包含8种问题类型，系统性地评估模型的不同能力维度：

1. **visual_detail_questions** - 视觉细节识别（物体、颜色、符号等）
2. **action_perception_questions** - 动作和行为理解
3. **audio_visual_emotion_questions** - 多模态情感分析（结合语气、表情、对话）
4. **basic_facts_questions** - 事实信息记忆与提取
5. **reasoning_questions** - 逻辑推理和动机分析
6. **counterfactual_reasoning_questions** - 反事实推理和预测
7. **long_chain_memory_questions** - 跨时间段信息整合和事件链理解
8. **multi_step_reasoning_questions** - 多步骤复杂推理和深层分析

## 数据格式

### JSON文件结构

每个视频对应一个JSON文件，包含8种类型的问题数组：

json

```json
{
  "visual_detail_questions": [...],
  "action_perception_questions": [...],
  "audio_visual_emotion_questions": [...],
  "basic_facts_questions": [...],
  "reasoning_questions": [...],
  "counterfactual_reasoning_questions": [...],
  "long_chain_memory_questions": [...],
  "multi_step_reasoning_questions": [...]
}
```

### 问题格式

每个问题包含以下字段：

json

```json
{
  "question": "问题文本",
  "time": "时间戳范围 (如 12:51-12:55)",
  "a0": "选项A",
  "a1": "选项B",
  "a2": "选项C",
  "a3": "选项D",
  "a4": "选项E",
  "answer": "正确答案 (如 a4)"
}
```

## 目录结构

```
.
├── README.md
└── data
    ├── chat_1.json
    ├── chat_2.json
    ├── ...
    └── chat_346.json
      
```

## 数据集统计

- **视频数量**: 346个
- **问题类型**: 8种
- **平均每视频问题数**: 约16个（每种类型2个）
- **总问题数**: 约5,500+
- **时间标注覆盖**: 100%

## 标注质量控制

为确保数据质量，我们采用了严格的标注和审核流程：

- **专业标注团队**：由经过培训的标注人员完成问题设计和答案标注
- **交叉验证机制**：每个视频由至少两名标注人员独立审核
- **时间精确对齐**：确保时间戳与问题内容精确对应
- **一致性检查**：验证答案的唯一性和合理性
- **三方仲裁机制**：对于存在分歧的标注，引入第三方审核作最终决定

## 应用场景

本数据集可用于：

- 多模态视频理解模型的训练和评估
- 长视频问答系统的开发
- 视频-语言预训练模型的微调
- 跨模态推理能力的基准测试

## 引用

如果您认为我们的工作对您有帮助，请考虑引用以下论文：

```
Coming Soon
```
