---
title: Gaokao-Admission-Chart-Segment
canonical_url: "https://www.modelscope.cn/datasets/wqzh117/Gaokao-Admission-Chart-Segment"
md_url: "https://www.modelscope.cn/datasets/wqzh117/Gaokao-Admission-Chart-Segment.md"
repository: wqzh117/Gaokao-Admission-Chart-Segment
chinese_name: "高考录取表格分割"
last_updated: 2025-11-12
license: "Apache License 2.0"
storage_size: "435 MB"
downloads: 99
stars: 2
---

# Gaokao-Admission-Chart-Segment

> Gaokao-Admission-Chart-Segment - wqzh117 在 ModelScope 开源的数据集。全国各省市的招生和录取书籍中的表格，有些包含2列或者3列数据。在高考志愿填报业务，我们需要进行OCR或者使用VLM进行解析，将数据存入数据库。此时如果能把每一列分开处理，这样就可以避免数据串行的错误，表格解析效果会好很多。因此，作者自行收集图片并使用Labelimg标注工具标注出了1150+张图片中的表格，并且使用了YOLO11训练了3个模型（nano,small,medium）进行检测

wqzh117/Gaokao-Admission-Chart-Segment 是 ModelScope 魔搭社区上的数据集，存储大小 435 MB，采用 Apache License 2.0 许可。

- **Repository**: wqzh117/Gaokao-Admission-Chart-Segment
- **License**: Apache License 2.0
- **Storage size**: 435 MB
- **Downloads**: 99
- **Stars**: 2
- **Last updated**: 2025-11-12

Source: https://www.modelscope.cn/datasets/wqzh117/Gaokao-Admission-Chart-Segment

---

# 数据集背景
全国各省市的招生和录取书籍中的表格，有些包含2列或者3列数据。在高考志愿填报业务，我们需要进行OCR或者使用VLM进行解析，将数据存入数据库。此时如果能把每一列分开处理，这样就可以避免数据串行的错误，表格解析效果会好很多。

因此，作者自行收集图片并使用Labelimg标注工具标注出了1150+张图片中的表格，并且使用了YOLO11训练了3个模型（nano,small,medium）进行检测

- `examples/` 包含了数据集的示例
- `images.zip` 包含2列及以上的表格图片。只有一列数据的图片没有收录，也没有标注
- `labels.zip` YOLO格式的txt标注文件

# 模型权重
使用[ultralytics](https://github.com/ultralytics/ultralytics) 训练YOLO11模型的权重
训练70 epochs, 取最好的模型

表格检测，测试代码示例
```sh
yolo predict model=weights/v4-n-best.pt source=examples/安徽_招生_历史_2025_page44.pdf_0.jpg
```
