---
title: REL-CoT
canonical_url: "https://www.modelscope.cn/datasets/zhongfangzhi/REL-CoT"
md_url: "https://www.modelscope.cn/datasets/zhongfangzhi/REL-CoT.md"
repository: zhongfangzhi/REL-CoT
last_updated: 2026-09-30
license: other
storage_size: "45 GB"
downloads: 11
stars: 0
---

# REL-CoT

> REL-CoT - zhongfangzhi 在 ModelScope 开源的数据集。REL-CoT（Reasoning–Evidence Localization Chain-of-Thought）是用于长文档视觉文本压缩与证据定位的监督数据集。每条样本把问答、蒸馏推理轨迹、支持证据所在页码和归一化边界框关联起来，可用于训练模型从低分辨率文档页面中定位证据并完成回答。

zhongfangzhi/REL-CoT 是 ModelScope 魔搭社区上的数据集，存储大小 45 GB，采用 other 许可。

- **Repository**: zhongfangzhi/REL-CoT
- **License**: other
- **Storage size**: 45 GB
- **Downloads**: 11
- **Stars**: 0
- **Last updated**: 2026-09-30

Source: https://www.modelscope.cn/datasets/zhongfangzhi/REL-CoT

---

# REL-CoT

REL-CoT（Reasoning–Evidence Localization Chain-of-Thought）是用于长文档视觉文本压缩与证据定位的监督数据集。每条样本把问答、蒸馏推理轨迹、支持证据所在页码和归一化边界框关联起来，可用于训练模型从低分辨率文档页面中定位证据并完成回答。

本数据集用于论文 [**FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution**](https://arxiv.org/abs/2609.36651) 的 REL-SFT 阶段，并为后续自适应分辨率 GRPO 训练提供监督初始化。

## 当前发布范围

本仓库只发布 **72 DPI** 版本，并包含该版本所需的完整组成：

| 内容 | 数量/配置 |
| --- | ---: |
| 基础样本 / `train_72dpi.json` 记录 | 29,411 |
| 72-DPI 页面图像 | 253,926 |
| 每个样本的页面数 | 1–76，中位数 7，均值 8.63 |
| REL-CoT 对话文件 | 29,411 |
| 渲染前源文本 | 29,411 |
| 语言 | 主要为英语 |

论文方法研究了 `{48, 60, 72, 84, 96, 120, 144}` 七种 DPI；这是论文中的实验设计，并不表示本仓库提供全部分辨率。当前发布不包含 96/144 DPI 图像或训练清单。

## 数据来源

29,411 条去重基础样本来自公开问答数据集。`*_long` 变体通过同一语料中的段落追加与打乱构成长上下文。

| 来源/子集 | 样本数 |
| --- | ---: |
| ChatQA / DROP | 3,327 |
| ChatQA / Quoref | 870 |
| ChatQA / ROPES | 1,705 |
| ChatQA / TAT-QA | 2,931 |
| ChatQA2 / NarrativeQA-131072 | 2,018 |
| ChatQA2 / Long-SFT | 5,195 |
| TriviaQA reading comprehension | 5,755 |
| 2WikiMultihopQA（原始/长上下文） | 285 / 2,123 |
| HotpotQA（原始/长上下文） | 382 / 2,014 |
| MuSiQue（原始/长上下文） | 277 / 1,106 |
| FinQA | 1,423 |

主要上游发布包括 [NVIDIA ChatQA-Training-Data](https://huggingface.co/datasets/nvidia/ChatQA-Training-Data)、[NVIDIA ChatQA2-Long-SFT-data](https://huggingface.co/datasets/nvidia/ChatQA2-Long-SFT-data)，以及 TriviaQA、HotpotQA、2WikiMultihopQA、MuSiQue、FinQA 和 NarrativeQA。

## REL-CoT 构建流程

论文使用跨模型的三阶段流程构建标注：

1. **上下文依赖过滤**：DeepSeek V4 Flash 过滤可由常识直接回答的问题，减少绕过文档阅读的捷径。
2. **推理与证据标注**：Gemini 3.5 Flash 生成证据支撑的推理轨迹，并在引用证据的位置内联页码与归一化边界框。
3. **独立验证**：GPT-5 mini 检查预测边界框对应的页面裁剪是否支持参考答案；证据错误或不足的样本被移除。

发布页面以 **DejaVu Sans 9 pt**、10 pt 行高（即 1 pt 行间距）渲染。页面画布为 A4（595 × 842 PDF points），页边距为 10 pt，再以 72 DPI 栅格化。证据框统一归一化到 `[0, 1000]` 坐标空间。

## 文件组织

下载并解包后：

```text
REL-CoT/
├── README.md
├── train_72dpi.json
├── scripts/
│   └── render_text_72dpi.py
├── conversations/
├── text/
└── images/                 # 72 DPI
```

- `train_72dpi.json`：JSON Lines（JSONL）清单，每行一条基础样本。
- `conversations/`：每条样本的两轮对话和 REL-CoT 监督目标。
- `text/`：生成页面图像前的源上下文文本。
- `images/`：按来源和样本组织的 72-DPI PNG 页面。
- `scripts/render_text_72dpi.py`：对应的独立渲染脚本，默认使用系统路径 `/usr/share/fonts/truetype/dejavu/DejaVuSans.ttf`。

尽管训练清单扩展名为 `.json`，它实际是 JSONL，应逐行解析，不应作为单个 JSON 数组加载。

## 记录格式

`train_72dpi.json` 的主要字段如下：

| 字段 | 说明 |
| --- | --- |
| `id` | 样本 ID |
| `image` | 按页排序的 72-DPI 图像路径 |
| `image_dpi72` | 与 `image` 相同的显式 72-DPI 路径 |
| `conversations` | REL-CoT 对话文件路径 |
| `text_path` | 渲染前源文本路径 |
| `metadata.all_locations` | 标注流程产生的候选证据区域 |
| `metadata.evidence_locations` | 验证后保留的支持证据区域 |
| `image_dpi96` | 同一样本的 96-DPI 路径字段；为保持原始记录完整性而保留，图像不随本次发布提供 |
| `image_dpi144` | 同一样本的 144-DPI 路径字段；为保持原始记录完整性而保留，图像不随本次发布提供 |
| `image_sizes_dpi144` | 原始记录中的 144-DPI 页面尺寸；保留但不对应本次发布的图像资产 |

本次发布不删改原始记录字段。训练时应使用 `image` 或 `image_dpi72`；`image_dpi96`、`image_dpi144` 只是保留的构建信息，其对应页面不在仓库中。

位置对象示例：

```json
{
  "page": 4,
  "bbox": [20, 450, 980, 500],
  "bbox_abs": [11, 378, 575, 421]
}
```

`page` 从 1 开始；`bbox = [x1, y1, x2, y2]` 使用 `[0, 1000]` 归一化页面坐标；`bbox_abs` 为对应 72-DPI 页面中的像素坐标。

`conversations/*.json` 使用常见的 `human`/`gpt` 两轮格式。用户消息以按页排列的 `<image>` 占位符表示页面；模型消息由 `<think>...</think>` 推理和最终答案组成。证据引用以内联形式出现，例如：

```text
Page 2 <|box_start|>[20, 270, 980, 320]<|box_end|>
```

一条推理轨迹可引用多个区域，推理步骤与边界框不要求一一对应。

## 下载与解包

为避免直接传输数十万个小文件，目录被打包为 zstd 压缩分片：

| 归档 | 分片数 | 压缩后大小（约） |
| --- | ---: | ---: |
| `images-72dpi.tar.zst` | 23 | 44.61 GiB |
| `text.tar.zst` | 1 | 0.54 GiB |
| `conversations.tar.zst` | 1 | 6.14 MiB |

```bash
modelscope download --dataset zhongfangzhi/REL-CoT --local_dir REL-CoT
cd REL-CoT

cat archives/images-72dpi.tar.zst.part-* | tar --use-compress-program=unzstd -xf -
cat archives/text.tar.zst.part-* | tar --use-compress-program=unzstd -xf -
cat archives/conversations.tar.zst.part-* | tar --use-compress-program=unzstd -xf -
```

请先安装 `zstd`；三位数字分片编号可保证 shell 通配符按正确顺序拼接。

## 使用渲染脚本

脚本依赖 `reportlab`、`pdf2image`、`Pillow`、`numpy` 和系统中的 Poppler。Debian/Ubuntu 可通过 `fonts-dejavu-core` 提供 DejaVu Sans 字体。

```bash
python scripts/render_text_72dpi.py \
  --text-root text \
  --image-root rerendered_images \
  --font-path /usr/share/fonts/truetype/dejavu/DejaVuSans.ttf \
  --processes 16
```

## 路径重映射

为保留构建追溯信息，清单中的文件路径保留了原始绝对前缀：

```text
/vepfs-mlp2/c20250405/400042/data/VTC/SFT/gemini-3.5-flash-30k/
```

读取时可将该前缀映射到本地解包目录，而无需修改原始清单：

```python
import json
from pathlib import Path

dataset_root = Path("REL-CoT").resolve()
source_root = Path(
    "/vepfs-mlp2/c20250405/400042/data/VTC/SFT/gemini-3.5-flash-30k"
)

def resolve_path(path):
    return dataset_root / Path(path).relative_to(source_root)

with open(dataset_root / "train_72dpi.json", encoding="utf-8") as handle:
    row = json.loads(next(handle))

images = [resolve_path(path) for path in row["image"]]
conversation_path = resolve_path(row["conversations"])
text_path = resolve_path(row["text_path"])
```

## 推荐用途

- 长文档视觉问答与视觉文本压缩；
- 推理—证据联合监督；
- 页面级和区域级证据定位；
- 自适应裁剪或工具调用策略的监督初始化。

## 限制与责任使用

- 推理、证据位置与答案由生成模型产生；即使经过自动验证，仍可能含有错误、偏差或不充分证据。
- 边界框与答案的一致性不等同于因果忠实性，不能证明模型确实依赖了相应证据。
- 数据主要来自英文公开问答语料，对其他语言、版式与领域的覆盖有限。
- 涉及高风险或敏感文档的应用必须独立核验证据和答案，并保护完整页面及裁剪区域。
- 本数据集包含多个上游数据集的派生内容。上游文本、问题、答案和渲染页面继续受各自来源的使用与再分发条款约束；本仓库的统一 `license: other` 不替代这些条款。

## 引用

如果本数据集对你的研究有帮助，请引用 [FocusVTC](https://arxiv.org/abs/2609.36651)：

```bibtex
@misc{zhong2026focusvtcefficienthighperformancevisual,
      title={FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution},
      author={FangZhi Zhong and Xuerui Qiu and Yuqi Pan and Ya Liu and Shaowei Gu and Bo Xu and Guoqi Li},
      year={2026},
      eprint={2609.36651},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2609.36651},
}
```
