---
title: OCR_Synthetic_LaTeX
canonical_url: "https://www.modelscope.cn/datasets/xmatrix/OCR_Synthetic_LaTeX"
md_url: "https://www.modelscope.cn/datasets/xmatrix/OCR_Synthetic_LaTeX.md"
repository: xmatrix/OCR_Synthetic_LaTeX
chinese_name: "LaTeX公式OCR识别数据集"
last_updated: 2024-12-31
license: CC-BY-NC-4.0
storage_size: "722 MB"
domain:
  - image
tasks:
  - image-to-text
language:
  - LaTeX
size_scale:
  - 10k-1m
downloads: 39258
stars: 7
---

# OCR_Synthetic_LaTeX

> OCR_Synthetic_LaTeX - xmatrix 在 ModelScope 开源的数据集。为LaTeX公式OCR识别生产的合成中文数据集

xmatrix/OCR_Synthetic_LaTeX 是 ModelScope 魔搭社区上的image-to-text数据集，涉及 image 领域，存储大小 722 MB，采用 CC-BY-NC-4.0 许可。

- **Repository**: xmatrix/OCR_Synthetic_LaTeX
- **License**: CC-BY-NC-4.0
- **Tasks**: image-to-text
- **Domain**: image
- **Storage size**: 722 MB
- **Downloads**: 39258
- **Stars**: 7
- **Last updated**: 2024-12-31

Source: https://www.modelscope.cn/datasets/xmatrix/OCR_Synthetic_LaTeX

---

<!--- 以上YAML section提供属性/tags描述--->

<!--- 以下为markdown格式的dataset描述--->

## 数据集描述

用于训练 LaTeX 文本的 OCR 模型的合成数据集。该数据集包含了 markdown 中 LaTeX 公式的文本和对应的图片。

### 数据集简介

用于训练 LaTeX 文本的 OCR 模型的合成数据集。该数据集包含了 markdown 中 LaTeX 公式的文本和对应的图片。
数据集合采用合成的方式生成，主要流程为：

- 根据需求使用 llm 生成 markdown 文本
- 使用 mathpix 将 markdown 文本转换为 html
- 将 html 转换为图片

两个文件 latex_ocr_01 和 latex_ocr_02 分别包含了 1000 个样本，使用两组不同的 LLM Prompt 生成。

## 其他相关信息

### 局限

数据集合采用合成的方式生成，其中的公式可能不够多样化，不足以覆盖所有的 LaTeX 语法。且逻辑上可能存在错误，谨慎使用
