---
title: HowTo100M
canonical_url: "https://www.modelscope.cn/datasets/OmniData/HowTo100M"
md_url: "https://www.modelscope.cn/datasets/OmniData/HowTo100M.md"
repository: OmniData/HowTo100M
last_updated: 2024-07-01
license: "[MIT]"
storage_size: "37 MB"
domain:
  - publishDate
  - displayName
  - paperUrl
  - publishUrl
  - publisher
tasks:
  - 2022
  - HowTo100M
  - "https://openaccess.thecvf.com/content/CVPR2022/papers/Han_Temporal_Alignment_Networks_for_Long-Term_Video_CVPR_2022_paper.pdf"
  - "https://www.di.ens.fr/willow/research/howto100m/"
  - "Visual Geometry Group, University of Oxford"
downloads: 107
stars: 0
---

# HowTo100M

> HowTo100M - OmniData 在 ModelScope 开源的数据集。displayName: HowTo100M labelTypes: [] license: MIT mediaTypes: [] paperUrl: https://openaccess.thecvf.com/content/CVPR2022/papers/HanTemporalAlignmentNetworksforLong-TermVideoCVPR2022paper.pdf publishDate: "2022"…

OmniData/HowTo100M 是 ModelScope 魔搭社区上的2022、HowTo100M、https://openaccess.thecvf.com/content/CVPR2022/papers/Han_Temporal_Alignment_Networks_for_Long-Term_Video_CVPR_2022_paper.pdf数据集，涉及 publishDate、displayName、paperUrl 领域，存储大小 37 MB，采用 [MIT] 许可。

- **Repository**: OmniData/HowTo100M
- **License**: [MIT]
- **Tasks**: 2022, HowTo100M, https://openaccess.thecvf.com/content/CVPR2022/papers/Han_Temporal_Alignment_Networks_for_Long-Term_Video_CVPR_2022_paper.pdf, https://www.di.ens.fr/willow/research/howto100m/, Visual Geometry Group, University of Oxford
- **Domain**: publishDate, displayName, paperUrl, publishUrl, publisher
- **Storage size**: 37 MB
- **Downloads**: 107
- **Stars**: 0
- **Last updated**: 2024-07-01

Source: https://www.modelscope.cn/datasets/OmniData/HowTo100M

---

displayName: HowTo100M
labelTypes: []
license:
- MIT
mediaTypes: []
paperUrl: https://openaccess.thecvf.com/content/CVPR2022/papers/Han_Temporal_Alignment_Networks_for_Long-Term_Video_CVPR_2022_paper.pdf
publishDate: "2022"
publishUrl: https://www.di.ens.fr/willow/research/howto100m/
publisher:
- Shanghai Jiao Tong University
- Visual Geometry Group, University of Oxford
tags:
- Food
- Huamn
taskTypes: []

---
# 数据集介绍
  ## 简介
  本文的目的是建立一个时间对齐网络，该网络吸收长期视频序列和相关的文本句子，以便 :( 1) 确定句子是否与视频对齐; (2) 如果可以对齐，则确定其对齐。面临的挑战是从大规模数据集 (例如HowTo100M) 训练此类网络，其中相关的文本句子具有明显的噪声，并且仅在相关时才弱对齐。
除了提出对齐网络之外，我们还做出了四个贡献 :( i) 我们描述了一种新颖的联合训练方法，尽管噪音很大，但可以在不使用手动注释的情况下对原始教学视频进行降噪和训练; (ii) 基准对齐性能，我们手动策划了HowTo100M的10小时子集，总共80个视频，并带有稀疏的时间描述。我们提出的模型，在HowTo100M上训练，在这个对齐数据集上的强基线 (CLIP，MIL-NCE) 的显著优势; (iii) 我们将训练好的模型应用于多个下游视频理解任务，并实现最先进的结果，包括YouCook2上的文本视频检索，以及早餐动作上的弱监督视频动作分割; (iv) 我们使用自动对齐的HowTo100M注释进行骨干模型的端到端微调，并在下游动作识别任务上获得了改进的性能。
  
## Download dataset
:modelscope-code[]{type="git"}
