---
title: GBA2022_AncientDoc_ImageAnalysis_TrainingSet
canonical_url: "https://www.modelscope.cn/datasets/llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet"
md_url: "https://www.modelscope.cn/datasets/llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet.md"
repository: llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet
chinese_name: "2022 年粤港澳大湾区（黄埔）国际算法算例大赛-古籍文档图像分析与识别初赛训练集"
last_updated: 2025-09-06
license: "Apache License 2.0"
storage_size: "793 MB"
downloads: 64
stars: 3
---

# GBA2022_AncientDoc_ImageAnalysis_TrainingSet

> GBA2022_AncientDoc_ImageAnalysis_TrainingSet - llmlearningX 在 ModelScope 开源的数据集。2022 年粤港澳大湾区（黄埔）国际算法算例大赛-古籍文档图像分析与识别训练集初赛数据集：训练集、验证集与测试集各包括1000幅古籍文档图像（共3000张图像），数据选自四库全书、历代古籍善本、乾隆大藏经等多种古籍数据。任务仅考虑古籍文档的正文内容，忽略如版心、卷号等边框外的内容。社区项目链接：https://aistudio.baidu.com/proj…

llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet 是 ModelScope 魔搭社区上的数据集，存储大小 793 MB，采用 Apache License 2.0 许可。

- **Repository**: llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet
- **License**: Apache License 2.0
- **Storage size**: 793 MB
- **Downloads**: 64
- **Stars**: 3
- **Last updated**: 2025-09-06

Source: https://www.modelscope.cn/datasets/llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet

---

## 任务说明

-   **任务目标**：对输入的古籍文档图像进行结构化分析与识别\
-   **输入**：篇幅级别的古籍文档图像\
-   **输出**：
    -   文本行检测结果（坐标位置）\
    -   文本行识别内容\
    -   按 **阅读顺序排列** 的结构化文本

> 注意：任务仅考虑古籍文档的
> **正文部分**，不包含版心、卷号等边框之外的辅助信息。

------------------------------------------------------------------------

## 数据集规模

-   总量：**3000 张古籍文档图像**\
-   划分：
    -   训练集：1000 张\
    -   验证集：1000 张\
    -   测试集：1000 张

------------------------------------------------------------------------

## 标注方式

-   **文本行级标注**：提供每一行文字的矩形边界框坐标 `bbox`。\
-   **识别文本**：为每一行文字提供识别结果。\
-   **阅读顺序**：为每一行文字标注 `order`，确保输出与实际阅读习惯一致。

------------------------------------------------------------------------

## 数据格式

数据采用 **图像文件（JPG/PNG） + JSON 标注文件** 组织。

标注文件示例：

``` json
{
  "image_id": "page_001.jpg",
  "lines": [
    {
      "bbox": [120, 350, 480, 390],
      "text": "天下大同",
      "order": 1
    },
    {
      "bbox": [130, 400, 500, 440],
      "text": "圣人出焉",
      "order": 2
    }
  ]
}
```

字段说明： - `image_id`：对应的图像文件名\

- `lines`：文本行标注列表\
- `bbox`：文本行矩形框坐标 `[x1, y1, x2, y2]`\
- `text`：识别出的文本\
- `order`：阅读顺序编号

------------------------------------------------------------------------

## 应用场景

本数据集可广泛应用于：\

- **古籍 OCR**：针对历史文献的光学字符识别\
- **版面分析**：复杂古籍的文档结构建模\
- **文本检测与识别**：行级别文本定位与识别\
- **阅读顺序建模**：跨行、多列文档的阅读顺序预测\
- **数字人文研究**：辅助文献数字化、知识库构建

------------------------------------------------------------------------

## 基准与评价指标

常用的评测指标包括：\

- **文本检测**：IoU、Precision、Recall、F1-score\
- **文本识别**：Character Accuracy (CA)、Word Accuracy (WA)\
- **端到端任务**：Edit Distance、Normalized Edit Distance (NED)\
- **阅读顺序**：Sequence Accuracy、Order Preservation Rate

------------------------------------------------------------------------

## 数据许可

本数据集遵循 **Apache License 2.0** 协议开放。\
使用时请遵循相关法律法规，仅用于科研和教育目的。

------------------------------------------------------------------------

## 引用

如果您在研究中使用了本数据集，请引用以下信息：

    @dataset{gba2022_ancientdoc,
      title        = {GBA2022 Ancient Document Image Analysis & Recognition Training Set},
      author       = {GBA Algorithm Challenge Organizing Committee},
      year         = {2022},
      publisher    = {Greater Bay Area (Huangpu) International Algorithm Challenge},
      license      = {Apache-2.0},
      url          = {https://modelscope.cn/datasets/llmlearningX/GBA2022_AncientDoc_ImageAnalysis_TrainingSet}
    }

------------------------------------------------------------------------

license: Apache License 2.0
image:
  image-to-text:
    size_scale:
      - 100-10k
tags:
  - 古籍

## 致谢

本数据集由 **2022 粤港澳大湾区（黄埔）国际算法算例大赛组委会** 提供。\
感谢大赛团队在古籍数据整理、标注与验证中的贡献。
