---
title: Infoxmed2.0-27B_Reward_Model_Data
canonical_url: "https://www.modelscope.cn/datasets/InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data"
md_url: "https://www.modelscope.cn/datasets/InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data.md"
repository: InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data
chinese_name: "Infoxmed2.0-27B-奖励模型数据集"
last_updated: 2026-05-21
license: "Apache License 2.0"
downloads: 8
stars: 0
---

# Infoxmed2.0-27B_Reward_Model_Data

> Infoxmed2.0-27B_Reward_Model_Data - InfoxmedModel 在 ModelScope 开源的数据集。dpomedicaltrainv2.jsonl — 奖励模型训练数据集

InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data 是 ModelScope 魔搭社区上的数据集，采用 Apache License 2.0 许可。

- **Repository**: InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data
- **License**: Apache License 2.0
- **Downloads**: 8
- **Stars**: 0
- **Last updated**: 2026-05-21

Source: https://www.modelscope.cn/datasets/InfoxmedModel/Infoxmed2.0-27B_Reward_Model_Data

---

# dpo_medical_train_v2.jsonl — 奖励模型训练数据集

## 概述

本数据集用于训练 Infoxmed2.0 项目中的外部奖励模型（Reward Model），该奖励模型在 GRPO 阶段为策略模型提供语义级评分信号。

数据集基于 MedMCQA 和 HLE（Humanity's Last Exam）两个评测基准构建偏好对（chosen / rejected），通过六维度启发式评分器自动标注质量差异，使奖励模型学习区分高质量医学回答与低质量回答。

## 基本信息

| 项目 | 值 |
|------|------|
| 文件格式 | JSONL（每行一个 JSON 对象） |
| 总样本数 | 6,283 条偏好对 |
| 生成时间 | 2026-04-28 |
| 构建工具 | `step2_DPO/data/build_dpo_dataset_v2.py` |
| 用途 | Reward Model 训练（SequenceClassification） |

## 数据来源分布

| 来源 | 样本数 | 占比 |
|------|--------|------|
| MedMCQA | 3,983 | 63.4% |
| HLE (Humanity's Last Exam) | 2,300 | 36.6% |

## Rejected 回答错误类型分布

| 错误类型 | 样本数 | 占比 | 说明 |
|----------|--------|------|------|
| `vague` | 1,296 | 20.6% | 回答含糊，声称"信息不足"或"无法确定"，回避给出明确答案 |
| `incomplete` | 1,290 | 20.5% | 回答不完整，未展开推理过程，仅给出残缺草稿 |
| `hallucination` | 1,273 | 20.3% | 虚构权威来源（如"2025年最新指南"），编造不存在的依据 |
| `wrong_answer` | 1,234 | 19.6% | 选错答案，基于表面关键词匹配而非深层理解 |
| `overconfident_wrong` | 1,190 | 18.9% | 过度自信地给出错误答案，声称"100%确定"却答错 |

## 数据统计

### 质量差距（Score Margin）

| 统计量 | 值 |
|--------|------|
| 最小值 | 5.50 |
| 最大值 | 11.50 |
| 平均值 | 8.63 |

Score margin = chosen_total_score − rejected_total_score，数值越大说明偏好对的质量差异越明显。

### 文本长度（字符数）

| 类别 | 最小值 | 最大值 | 平均值 |
|------|--------|--------|--------|
| Chosen（优质回答） | 119 | 1,870 | 723 |
| Rejected（低质回答） | 240 | 1,238 | 571 |

## 数据格式

每行为一个 JSON 对象，包含以下字段：

```jsonc
{
  "messages": [                    // Chosen（优质回答）对话
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ],
  "rejected_messages": [           // Rejected（低质回答）对话
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ],
  "metadata": {
    "source": "medmcqa",           // 数据来源: medmcqa | hle
    "question_id": "...",          // 原始题目 ID
    "error_type": "vague",         // rejected 回答的错误类型
    "generated_at": "2026-04-28T10:52:03",  // 生成时间戳
    "chosen_scores": {             // chosen 回答的六维度评分
      "grounding": 10,             // 事实准确性 (-10 ~ 10)
      "coverage": 6,               // 信息完整性
      "depth": 4,                  // 推理深度
      "tool_use": 2,               // 工具/证据利用
      "clarity": 4,                // 表达清晰度
      "safety": 4                  // 医学安全性
    },
    "chosen_total_score": 5.0,     // chosen 六维度均分
    "rejected_scores": {...},      // rejected 回答的六维度评分
    "rejected_total_score": -3.83, // rejected 六维度均分
    "score_margin": 8.83,          // 质量差距（chosen - rejected）
    "chosen_length": 564,          // chosen 回答字符长度
    "rejected_length": 372,        // rejected 回答字符长度
    "rejected_to_chosen_length_ratio": 0.66  // 长度比
  }
}
```

## 六维度评分体系

Chosen 和 Rejected 回答均由启发式评分器在以下 6 个维度上进行评分，分值范围为 -10 到 +10：

| 维度 | 字段名 | 评分含义 |
|------|--------|----------|
| 事实准确性 | `grounding` | 回答是否基于可靠事实，有无臆造信息 |
| 信息完整性 | `coverage` | 是否覆盖问题所有关键要点 |
| 推理深度 | `depth` | 推理过程是否清晰、逻辑是否严密 |
| 工具/证据利用 | `tool_use` | 是否正确引用医学证据或工具输出 |
| 表达清晰度 | `clarity` | 回答结构化程度和条理性 |
| 医学安全性 | `safety` | 是否识别风险场景、是否保持必要的不确定性 |

## Chosen 回答特征

高质量回答（chosen）具有以下共同特征：

- 明确给出正确答案
- 提供详细的医学解析和推理过程
- 引用教材或指南作为依据
- 标注学科归属并提示"仅供学习参考"
- 对 HLE 题目提供结构化的解析要点与边界提示

## Rejected 回答特征

低质量回答（rejected）由模板化方式生成，模拟了模型常见的 5 类错误模式：

1. **含糊回避型**（vague）：声称"信息不足""多个选项都对"，拒绝给出确定答案
2. **不完整型**（incomplete）：只给出残缺草稿，未完成推理链，声明"未完成部分"
3. **幻觉型**（hallucination）：虚构权威来源（如"2025年最新指南第8版第156页"），编造不存在的研究
4. **答错型**（wrong_answer）：基于表面关键词匹配选择干扰项，承认"没有真正回到标准解释逐项排除"
5. **过度自信错误型**（overconfident_wrong）：声称"毫无疑问""100%确定"却给出错误答案

## 数据污染防护

数据集构建时使用随机种子（seed=42）预先采样出评测用的 200 题 MedMCQA + 200 题 HLE，并从训练候选中**显式排除**了这 400 道评测题目，确保与评测集无重叠。

## 使用方式

本数据集直接用于奖励模型训练：

```bash
cd Post_train/Reward_Model
bash train_reward_mixed_from_scratch.sh
```

训练脚本会将本数据集（DPO 部分）与 GRPO 伪标签数据按 1:1 比例混合，共同训练 Qwen3.5-9B SequenceClassification 奖励模型。

## 与其他数据集的关系

| 数据集 | 用途 | 位置 |
|--------|------|------|
| 本数据集 (dpo_medical_train_v2.jsonl) | Reward Model 训练 | `Reward_Model/data/` |
| dpo_medical_train_v2.jsonl (副本) | DPO 阶段训练 | `step2_DPO/data/` |
| grpo_training_data.jsonl | GRPO 阶段训练 | `step3_GRPO/data/` |
| dpo_grpo_train_v1.jsonl | Reward Model 混合训练数据 | `Reward_Model/data/` |
