---
title: line-det
canonical_url: "https://www.modelscope.cn/datasets/irhawks/line-det"
md_url: "https://www.modelscope.cn/datasets/irhawks/line-det.md"
repository: irhawks/line-det
chinese_name: "单行内容检测数据集（LND）"
last_updated: 2024-11-05
license: "Apache License 2.0"
storage_size: "5.5 MB"
downloads: 570
stars: 0
---

# line-det

> line-det - irhawks 在 ModelScope 开源的数据集。面向复杂文档图像中的内容识别需求，在图像中标出来每一行文本。其中段落中的每一行标为一个文本行（“单行内容”），整张图片、表格、算法块标注为“其他类型”，孤立出来的公式，被标注为“行间公式”。本次发布的是初版数据集，预标注中存在若干错误，因此会有一些行内公式。

irhawks/line-det 是 ModelScope 魔搭社区上的数据集，存储大小 5.5 MB，采用 Apache License 2.0 许可。

- **Repository**: irhawks/line-det
- **License**: Apache License 2.0
- **Storage size**: 5.5 MB
- **Downloads**: 570
- **Stars**: 0
- **Last updated**: 2024-11-05

Source: https://www.modelscope.cn/datasets/irhawks/line-det

---

**单行内容检测数据集**

# 下载方法

:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}

# 内容说明

由于当前OCR等识别技术的局限性，当前多数系统仍然需要从视觉丰富文档（Visually Rich Document）图像中检测出可被文本识别模型或公式识别模型接受的区域。通常，PaddleOCR中的PPOCR等模型，支持对单行纯文本进行识别，Unimernet, Texteller等模型，支持输入行内公式和行间公式所在的区域进行公式识别。为此，需要我们完善文档图像中目标检测的任务体系，顺利得到文档内容识别（公式和文本）结果，并正确处理文档中的插图、附表、算法块、公式块等信息。

为更好地与文本识别模型、公式识别模型或表格内容识别模型进行对接，笔者定义了如下任务：

-   **单行内容检测（LND，line-det）。主要在行的级别检测在复杂文档中的文本、公式、浮动体等内容。任务标注出行间公式、单行内容和其他类型三种元素。其中“单行内容”可以是不包含行内公式，也可以包含行内公式。**

-   行内元素检测（SPD，span-det）。在行内对文档图像中的公式、文本等元素进行检测，相比单行内容检测任务，粒度更细，任务区分和标注出行间公式、单行文本、行内公式、其他类型（插图、附表、算法块等）四类元素，每个检测出来的对象可以称为一个span。其中单行文本的内容原则上可以直接被OCR（光学字符识别）模型所识别，或者被STR（场景文本识别）模型所识别；行内公式和行间公式所在的区域抠出图之后，可以直接被MFR（数学公式识别模型）所识别。

-   场景文本检测（STR，scenetext-det）。按照传统的场景文本检测模型的思路，在给定的文档图像中检测出来所有的场景文字。包括PPOCR在内的现行的多数文本检测模型均属于此类。

-   数学公式检测（MFR，math-det）。只检测文档图像中的数学公式，分成行间公式和行内公式两类。目前对行间公式的标注，暂不包含公式的编号。这样，数学公式检测任务所得到的每个公式区域，都可以送入后续的数学公式识别模型得到识别结果。

# 数据样例

## line-det（单行内容检测）

面向复杂文档图像中的内容识别需求，在图像中标出来每一行文本。其中段落中的每一行标为一个文本行（“单行内容”），整张图片、表格、算法块标注为“其他类型”，孤立出来的公式，被标注为“行间公式”。本次发布的是初版数据集，预标注中存在若干错误，因此会有一些行内公式。

-   在逻辑上，在同一栏里面，在同一行里面只能有一个目标对象，故如果本行内容里面既有编号又有文本时，编号和文本应当标注在一起。

-   后续根据识别的情况，若整体内容都是黑体，斜体，或者具有特定的属性，则可以从“单行内容”中分化出一些二级类型，比如“全黑体的行”，“全斜体的行”，“等宽字体的行”等。

![](images/paste-1.png)

## span-det（行内元素检测）

行内元素检测任务在文本行检测任务的基础上，继续细化分解文档中的内容，特别是对于包含行内公式的单行内容，可以切分出来纯文本区域和行内公式区域，让这两个区域按照从左到右的顺序排列好。任务中所识别出来的每种元素，原则上均可按照元素的类型，送入不同的识别模型进行内容的识别。

![](images/paste-2.png)

![](images/paste-3.png)

## scenetext-det（场景文本检测）

场景文本检测模型按照场景文本检测的思路，在文档图像中找到可被识别的内容。需要注意的是，如果同一行里面两段文本的间距相距过大（比如有些文档中的章节标题的编号与标题名称），可能会被识别为两个对象。

![](images/paste-4.png)

![](images/paste-5.png)

## math-det（数学公式检测）

当前数学公式检测任务区分为行内公式与行间公式两类元素。其中行间公式的区域，暂不包含公式的编号。

![](images/paste-6.png)

![](images/paste-7.png)
