---
title: ViT
canonical_url: "https://www.modelscope.cn/models/Genius-Society/ViT"
md_url: "https://www.modelscope.cn/models/Genius-Society/ViT.md"
repository: Genius-Society/ViT
chinese_name: "Vision Transformer 模型镜像"
last_updated: 2026-01-17
license: "MIT License"
pipeline_tag: image-classification
tasks:
  - image-classification
base_model:
  - Genius-Society/ViT
base_model_relation: finetune
library_name:
  - pytorch
frameworks:
  - PyTorch
language:
  - en
downloads: 678
stars: 28
---

# ViT

> ViT - Genius-Society 在 ModelScope 开源的模型。Vision Transformer（ViT）是一个基于 transformer 编码器模型在一个大型图像集合上以监督学习进行预训练的模型，即 ImageNet-21k，分辨率为 224x224 像素。图像被呈现给模型作为一系列固定大小的 patch（分辨率为16x16），这些patch被线性嵌入。还在序列的开头添加了一个 [CLS] 标记，用于分类任务。在将序列馈送到 Transformer…

Genius-Society/ViT 是 ModelScope 魔搭社区上的image-classification模型，采用 MIT License 许可，基于 Genius-Society/ViT 构建。

- **Repository**: Genius-Society/ViT
- **License**: MIT License
- **Tasks**: image-classification
- **Base model**: Genius-Society/ViT
- **Downloads**: 678
- **Stars**: 28
- **Last updated**: 2026-01-17

Source: https://www.modelscope.cn/models/Genius-Society/ViT

---

# 简介
Vision Transformer(ViT)是一个基于 transformer 编码器模型在一个大型图像集合上以监督学习进行预训练的模型, 即 ImageNet-21k, 分辨率为 224x224 像素。图像被呈现给模型作为一系列固定大小的 patch(分辨率为16x16), 这些patch被线性嵌入。还在序列的开头添加了一个 [CLS] 标记, 用于分类任务。在将序列馈送到 Transformer 编码器的层之前, 还添加了绝对位置嵌入。需要注意的是, 该模型不提供任何精细调整的头部, 因为这些头部已被 Google 研究人员置零。然而, 模型包括预训练的池化器, 可用于下游任务(如图像分类)。通过对模型进行预训练, 它学习了图像的内部表示, 然后可以用于提取有用于下游任务的特征：例如, 如果您有一个带标签的图像数据集, 您可以通过在预训练的编码器顶部放置一个线性层来训练一个标准的分类器。通常将线性层放在 [CLS] 标记的顶部, 因为该标记的最后隐藏状态可以看作是整个图像的表示。

## 使用
:modelscope-code[]{type="sdk"}

## 维护
:modelscope-code[]{type="git"}

## 致谢
 - <a href="https://arxiv.org/pdf/2010.11929">An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale</a>
