---
title: OK-VQA
canonical_url: "https://www.modelscope.cn/datasets/OmniData/OK-VQA"
md_url: "https://www.modelscope.cn/datasets/OmniData/OK-VQA.md"
repository: OmniData/OK-VQA
last_updated: 2024-07-14
license: "[Unknown]"
storage_size: "19 GB"
domain:
  - publishDate
  - publisher
  - paperUrl
  - publishUrl
  - displayName
  - mediaTypes
  - labelTypes
  - taskTypes
tasks:
  - 2019
  - "Allen Institute for Artificial Intelligence"
  - "https://arxiv.org/pdf/1906.00067v2.pdf"
  - "https://okvqa.allenai.org/"
  - "OK-VQA (Outside Knowledge Visual Question Answering)"
  - Text
  - "Visual Question Answering"
downloads: 497
stars: 3
---

# OK-VQA

> OK-VQA - OmniData 在 ModelScope 开源的数据集。displayName: OK-VQA (Outside Knowledge Visual Question Answering) labelTypes: Text license: Unknown mediaTypes: Image Text paperUrl: https://arxiv.org/pdf/1906.00067v2.pdf publishDate: "2019" publishUrl:…

OmniData/OK-VQA 是 ModelScope 魔搭社区上的2019、Allen Institute for Artificial Intelligence、https://arxiv.org/pdf/1906.00067v2.pdf数据集，涉及 publishDate、publisher、paperUrl 领域，存储大小 19 GB，采用 [Unknown] 许可。

- **Repository**: OmniData/OK-VQA
- **License**: [Unknown]
- **Tasks**: 2019, Allen Institute for Artificial Intelligence, https://arxiv.org/pdf/1906.00067v2.pdf, https://okvqa.allenai.org/, OK-VQA (Outside Knowledge Visual Question Answering), Text, Visual Question Answering
- **Domain**: publishDate, publisher, paperUrl, publishUrl, displayName, mediaTypes, labelTypes, taskTypes
- **Storage size**: 19 GB
- **Downloads**: 497
- **Stars**: 3
- **Last updated**: 2024-07-14

Source: https://www.modelscope.cn/datasets/OmniData/OK-VQA

---

displayName: OK-VQA (Outside Knowledge Visual Question Answering)
labelTypes:
- Text
license:
- Unknown
mediaTypes:
- Image
- Text
paperUrl: https://arxiv.org/pdf/1906.00067v2.pdf
publishDate: "2019"
publishUrl: https://okvqa.allenai.org/
publisher:
- Carnegie Mellon University
- University of Washington
- Allen Institute for Artificial Intelligence
tags:
- Language
taskTypes:
- Question Generation
- Visual Question Answering

---
# 数据集介绍
  ## 简介
   理想形式的视觉问答 (VQA) 让我们能够在视觉和语言的联合空间中研究推理，并充当场景理解 AI 任务的代理。然而，迄今为止，大多数 VQA 基准测试都集中在简单计数、视觉属性和对象检测等问题上，这些问题不需要推理或图像之外的知识。在本文中，我们解决了基于知识的视觉问答任务，并提供了一个名为 OK-VQA 的基准，其中图像内容不足以回答问题，鼓励依赖外部知识资源的方法。我们的新数据集包括 14,000 多个需要外部知识才能回答的问题。我们表明，在这种新环境中，最先进的 VQA 模型的性能会急剧下降。我们的分析表明，与以前的基于知识的 VQA 数据集相比，我们的基于知识的 VQA 任务是多样化、困难和庞大的。我们希望这个数据集能够使研究人员为该领域的研究开辟新的途径。 
  ## 引文
  
```
"@inproceedings{marino2019ok,
title={Ok-vqa: A visual question answering benchmark requiring external knowledge},
author={Marino, Kenneth and Rastegari, Mohammad and Farhadi, Ali and Mottaghi, Roozbeh},
booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
pages={3195--3204},
year={2019}
}"
```

  
## Download dataset
:modelscope-code[]{type="git"}
