---
title: RewardModel-Dataset
canonical_url: "https://www.modelscope.cn/datasets/InfoxmedModel/RewardModel-Dataset"
md_url: "https://www.modelscope.cn/datasets/InfoxmedModel/RewardModel-Dataset.md"
repository: InfoxmedModel/RewardModel-Dataset
chinese_name: "医学循证-奖励模型数据集"
last_updated: 2026-05-20
license: "Apache License 2.0"
downloads: 26
stars: 0
---

# RewardModel-Dataset

> RewardModel-Dataset - InfoxmedModel 在 ModelScope 开源的数据集。每行一条 JSON，格式为标准 messages 偏好对：

InfoxmedModel/RewardModel-Dataset 是 ModelScope 魔搭社区上的数据集，采用 Apache License 2.0 许可。

- **Repository**: InfoxmedModel/RewardModel-Dataset
- **License**: Apache License 2.0
- **Downloads**: 26
- **Stars**: 0
- **Last updated**: 2026-05-20

Source: https://www.modelscope.cn/datasets/InfoxmedModel/RewardModel-Dataset

---

## 数据格式

每行一条 JSON，格式为标准 messages 偏好对：

```json
{
  "chosen": [
    {"role": "user",      "content": "医学问题"},
    {"role": "assistant", "content": "高质量循证医学回答（含文献引用）"}
  ],
  "rejected": [
    {"role": "user",      "content": "医学问题（同上）"},
    {"role": "assistant", "content": "低质量或泛化回答"}
  ]
}
```

---

## 数据示例

```json
{
  "chosen": [
    {
      "role": "user",
      "content": "关于循证指导下的综合管理方案对肝硬化患者的二次预防和并发症管理有何影响？"
    },
    {
      "role": "assistant",
      "content": "关于循证指导下的"综合管理方案"(multidisciplinary / comprehensive care bundle)对肝硬化患者的预防和并发症管理，已有较高质量证据，可显著降低病死率、失代偿发生率、再住院率和再次急诊率……[^01-e90c-0]"
    }
  ],
  "rejected": [
    {
      "role": "user",
      "content": "关于循证指导下的综合管理方案对肝硬化患者的二次预防和并发症管理有何影响？"
    },
    {
      "role": "assistant",
      "content": "这是一个非常具体且专业的问题，涉及到肝硬化患者的综合管理。建议您咨询专业的肝病科医生以获取个性化的医疗建议……"
    }
  ]
}
```

---

## 数据统计

| 指标 | 值 |
|------|-----|
| 总条数 | 1,239 |
| 数据格式 | JSONL（每行一条） |
| 语言 | 中文 |
| 平均 chosen 长度 | ~800 tokens |
| 平均 rejected 长度 | ~200 tokens |

---

## 主题覆盖

数据集覆盖以下医学领域的临床问题：

- **消化系统疾病**：肝硬化、门静脉高压、腹水、消化道出血
- **肿瘤学**：视网膜母细胞瘤、结直肠癌等癌症机制研究
- **心血管系统**：辅助循环装置、血流动力学
- **感染与免疫**：炎症调控机制、NF-κB 信号通路
- **临床药理**：药物作用机制与治疗方案
- **循证医学方法**：PICO 分析、系统综述解读

---

## 数据质量标准

**chosen（高质量）回答具备：**
- 引用国内外权威临床指南（如 EASL、AASLD、中华医学会指南）
- 给出明确的 PICO 框架分析
- 包含具体证据等级和推荐意见
- 使用文献引用标注（`[^xx-xxxx-x]`）

**rejected（低质量）回答特征：**
- 缺乏具体证据和文献支撑
- 回避性表述（"建议咨询医生"）
- 内容泛化，不针对具体问题
- 没有循证依据

---

## 使用方式

### 加载数据集

```python
from modelscope import MsDataset

ds = MsDataset.load("InfoxmedModel/RewardModel-Dataset")
print(ds["train"][0])
```

### 训练奖励模型（TRL RewardTrainer）

```python
from trl import RewardTrainer, RewardConfig
from transformers import AutoTokenizer, AutoModelForSequenceClassification
from datasets import load_dataset

# 加载数据
dataset = load_dataset("json",
    data_files="dpo_answer_converted.jsonl")["train"]

# 训练
model = AutoModelForSequenceClassification.from_pretrained(
    "Qwen/Qwen2.5-7B-Instruct", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")

trainer = RewardTrainer(
    model=model,
    args=RewardConfig(output_dir="reward_output", max_length=3000),
    train_dataset=dataset,
    processing_class=tokenizer,
)
trainer.train()
```

### 用于 DPO 训练

数据格式与 TRL `DPOTrainer` 兼容，可直接用于 DPO 偏好优化训练。

---

## 训练产物

基于本数据集训练的奖励模型：

- **模型**：[InfoxmedModel/Reward_Model](https://www.modelscope.cn/models/InfoxmedModel/Reward_Model)
- **基础模型**：Qwen/Qwen2.5-7B-Instruct
- **训练框架**：TRL RewardTrainer + PEFT LoRA（r=16, alpha=32）
- **训练步数**：789 steps，3 epochs

---

## 注意事项

- 本数据集**仅供科研与模型训练使用**
- 数据中的医学内容不构成临床诊疗建议
- 引用本数据集请注明来源

---

## 许可证

MIT License
