---
title: meta-search-dataset
canonical_url: "https://www.modelscope.cn/datasets/InfoxmedModel/meta-search-dataset"
md_url: "https://www.modelscope.cn/datasets/InfoxmedModel/meta-search-dataset.md"
repository: InfoxmedModel/meta-search-dataset
chinese_name: "Meta分析检索式训练数据集"
last_updated: 2026-07-06
license: other
storage_size: "138 MB"
downloads: 401
stars: 0
---

# meta-search-dataset

> meta-search-dataset - InfoxmedModel 在 ModelScope 开源的数据集。本数据集用于 Meta 分析和系统综述场景下的医学数据库检索式生成训练，覆盖 PubMed、Embase、Ovid MEDLINE、CENTRAL、Web of Science 五类常用医学文献数据库。

InfoxmedModel/meta-search-dataset 是 ModelScope 魔搭社区上的数据集，存储大小 138 MB，采用 other 许可。

- **Repository**: InfoxmedModel/meta-search-dataset
- **License**: other
- **Storage size**: 138 MB
- **Downloads**: 401
- **Stars**: 0
- **Last updated**: 2026-07-06

Source: https://www.modelscope.cn/datasets/InfoxmedModel/meta-search-dataset

---

# Qwen3 Meta Search SFT

本数据集是面向 **Meta-analysis / Systematic Review 医学数据库检索式生成** 的训练数据集，包含源母表数据和经过处理的 Chat SFT 训练数据。

数据目标是训练模型根据研究题目、研究目标、PICO 信息和目标数据库，生成或修复 PubMed、Embase、Ovid MEDLINE、CENTRAL、Web of Science 等数据库的检索式。

## 数据集组成

| 模块 | 路径 | 样本数 | 说明 |
|---|---|---:|---|
| 源母表 | `data/source_master/master.jsonl` | 4,631 | 原始整理后的 meta-analysis 检索式母表 |
| 总训练集 | `data/all_stages` | 8,673 | 四阶段 Chat SFT 数据合并视图 |
| Stage 1 | `data/stage1_strict_pico_numbered` | 627 | 编号式检索式生成 |
| Stage 2 | `data/stage2_schema_repair` | 520 | JSON schema 与编号格式强化 |
| Stage 3 | `data/stage3_output_repair` | 3,688 | 构造坏输出修复 |
| Stage 4 | `data/stage4_output_repair_hardcases_v31` | 3,838 | 真实 hardcase 混合修复 |
| 规则说明 | `rules/` | 2 files | PICO 入式规则和数据库语法约束 |
| 统计文档 | `docs/`、`metadata/` | - | 数据分布、文件清单、校验信息 |

## 目录结构

```text
.
├── README.md
├── data
│   ├── source_master
│   │   └── master.jsonl
│   ├── all_stages
│   │   ├── train.jsonl
│   │   ├── val.jsonl
│   │   └── test.jsonl
│   ├── stage1_strict_pico_numbered
│   ├── stage2_schema_repair
│   ├── stage3_output_repair
│   └── stage4_output_repair_hardcases_v31
├── docs
│   └── source_master_summary.md
├── metadata
│   ├── dataset_infos.json
│   ├── dataset_summary.json
│   ├── file_manifest.tsv
│   ├── source_master_summary.json
│   └── checksums.sha256
└── rules
    ├── pico_rules.json
    └── pico_rules.md
```

## 源母表数据

源母表文件为 `data/source_master/master.jsonl`，共 4,631 条样本。该文件用于记录 meta-analysis / systematic review 检索式数据的来源、数据库、题目、PICO 上下文、检索式文本和质量标记。

### 源母表字段

| 字段 | 说明 |
|---|---|
| `record_id` | 样本唯一标识，通常由文献来源 id 和数据库名组成 |
| `source_id` | 文献来源 id |
| `database` | 目标数据库 |
| `title` | 研究题目 |
| `objective` | 研究目标 |
| `pico_context` | PICO 上下文，包括 Population、Intervention、Comparator、Outcome |
| `query_text` | 检索式文本 |
| `quality` | 质量分数、PICO 完整度、一致性等指标 |
| `criteria` | 纳入/排除标准文本 |
| `study_counts` | 文献数量信息 |
| `preparation` | 语法等级、上下文类型、准备阶段 flags |

### 源母表数据库分布

| 数据库 | 样本数 | 占比 |
|---|---:|---:|
| PubMed | 2,249 | 48.6% |
| Embase | 896 | 19.3% |
| Web of Science | 675 | 14.6% |
| Ovid MEDLINE | 538 | 11.6% |
| CENTRAL | 273 | 5.9% |
| 合计 | 4,631 | 100.0% |

### 源母表 PICO 覆盖

| PICO 槽位 | 非空样本数 | 占比 |
|---|---:|---:|
| Population | 3,277 | 70.8% |
| Intervention | 3,545 | 76.5% |
| Comparator | 142 | 3.1% |
| Outcome | 1,259 | 27.2% |

| 指标 | 样本数 | 占比 |
|---|---:|---:|
| Population 或 Intervention 至少一个非空 | 3,658 | 79.0% |
| Population 和 Intervention 同时非空 | 3,164 | 68.3% |
| 四个 PICO 槽位均为空 | 737 | 15.9% |

### 源母表语法来源

| syntax_grade | 样本数 | 占比 |
|---|---:|---:|
| `db_explicit` | 2,562 | 55.3% |
| `salvaged_plain_boolean` | 1,406 | 30.4% |
| `cross_db` | 207 | 4.5% |
| `round3_numbered` | 181 | 3.9% |
| `plain_boolean` | 127 | 2.7% |
| `numbered_only` | 58 | 1.3% |
| 其他 | 90 | 1.9% |

完整源母表统计见 `docs/source_master_summary.md` 和 `metadata/source_master_summary.json`。

## Chat SFT 训练数据格式

训练数据采用 JSONL 格式，每行一个样本。每条样本包含 `system/user/assistant` 三段 messages。

```json
{
  "id": "...",
  "task": "db_query_generation",
  "database": "pubmed",
  "messages": [
    {"role": "system", "content": "..."},
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "{\"database\":\"pubmed\",\"query\":\"1. ...\"}"}
  ],
  "metadata": {}
}
```

### 顶层字段

| 字段 | 说明 |
|---|---|
| `id` | 训练样本 id |
| `task` | `db_query_generation` 或 `db_query_repair` |
| `database` | 目标数据库 |
| `messages` | Chat SFT 三段消息 |
| `metadata` | split、规则版本、语法等级、repair variant、hardcase 来源等 |

### Assistant 输出格式

Assistant 的标准答案为唯一 JSON 对象：

```json
{"database": "<database>", "query": "<numbered_query>"}
```

## 总训练集

`data/all_stages` 是四阶段训练数据的合并视图，适合多任务混合训练或整体审计。合并时已为 `id` 增加阶段前缀，并在 `metadata.source_stage` 中记录来源阶段。

| split | 样本数 | Stage 1 | Stage 2 | Stage 3 | Stage 4 |
|---|---:|---:|---:|---:|---:|
| train | 7,534 | 500 | 402 | 3,216 | 3,416 |
| val | 549 | 68 | 59 | 236 | 186 |
| test | 590 | 59 | 59 | 236 | 236 |
| 合计 | 8,673 | 627 | 520 | 3,688 | 3,838 |

## 四阶段训练数据

### Stage 1: 编号式检索式生成

路径：`data/stage1_strict_pico_numbered`

| split | 样本数 | PubMed | Embase | Web of Science | Ovid MEDLINE | CENTRAL |
|---|---:|---:|---:|---:|---:|---:|
| train | 500 | 238 | 92 | 91 | 46 | 33 |
| val | 68 | 34 | 14 | 7 | 8 | 5 |
| test | 59 | 21 | 8 | 20 | 3 | 7 |

### Stage 2: Schema Repair

路径：`data/stage2_schema_repair`

| split | 样本数 | PubMed | Embase | Web of Science | Ovid MEDLINE | CENTRAL |
|---|---:|---:|---:|---:|---:|---:|
| train | 402 | 140 | 92 | 91 | 46 | 33 |
| val | 59 | 25 | 14 | 7 | 8 | 5 |
| test | 59 | 21 | 8 | 20 | 3 | 7 |

### Stage 3: Output Repair

路径：`data/stage3_output_repair`

| split | 样本数 | PubMed | Embase | Web of Science | Ovid MEDLINE | CENTRAL |
|---|---:|---:|---:|---:|---:|---:|
| train | 3,216 | 1,120 | 736 | 728 | 368 | 264 |
| val | 236 | 100 | 56 | 28 | 32 | 20 |
| test | 236 | 84 | 32 | 80 | 12 | 28 |

### Stage 4: Hardcase Output Repair

路径：`data/stage4_output_repair_hardcases_v31`

| split | 样本数 | PubMed | Embase | Web of Science | Ovid MEDLINE | CENTRAL |
|---|---:|---:|---:|---:|---:|---:|
| train | 3,416 | 1,160 | 776 | 768 | 408 | 304 |
| val | 186 | 90 | 46 | 18 | 22 | 10 |
| test | 236 | 84 | 32 | 80 | 12 | 28 |

## 规则摘要

详细规则见 `rules/pico_rules.md` 和 `rules/pico_rules.json`。

| 规则 | 说明 |
|---|---|
| P/I 主槽位 | Population 和 Intervention 是默认优先槽位 |
| C/O 可选 | Comparator 和 Outcome 只在必要时入式 |
| 编号式 query | 当前训练目标要求连续编号式检索式 |
| 数据库语法隔离 | 禁止 PubMed、Embase、Ovid MEDLINE、CENTRAL、Web of Science 串库 |
| 输出 schema | 只允许 `database` 和 `query` 两个键 |

## Metadata

| 文件 | 说明 |
|---|---|
| `metadata/dataset_infos.json` | 数据集基本信息、样本数、字段结构 |
| `metadata/dataset_summary.json` | 每个文件的行数、数据库分布、任务分布和校验结果 |
| `metadata/source_master_summary.json` | 源母表 4,631 条样本的统计 |
| `metadata/file_manifest.tsv` | 文件清单 |
| `metadata/checksums.sha256` | SHA256 校验 |

## 校验

```bash
sha256sum -c metadata/checksums.sha256
```

当前整理版本的校验结果：

| 检查项 | 结果 |
|---|---:|
| 源母表 JSONL | 1 |
| Chat SFT JSONL | 15 |
| 源母表样本数 | 4,631 |
| 总训练样本数 | 8,673 |
| Chat SFT schema 错误数 | 0 |

## 许可说明

本数据集暂以 `other` 标注。公开使用或再分发前，请结合具体使用场景确认源文献元数据和检索式文本的许可要求。
