---
title: MedTrustBench
canonical_url: "https://www.modelscope.cn/datasets/InfoxmedModel/MedTrustBench"
md_url: "https://www.modelscope.cn/datasets/InfoxmedModel/MedTrustBench.md"
repository: InfoxmedModel/MedTrustBench
chinese_name: "医学循证评估集"
last_updated: 2026-05-26
license: "Apache License 2.0"
storage_size: "1.1 MB"
downloads: 121
stars: 0
---

# MedTrustBench

> MedTrustBench - InfoxmedModel 在 ModelScope 开源的数据集。本评估集面向循证医学智能体回答质量评估构建，采用团队最新确定的 7 个评估维度，共生成 1187 条 rubric 评分标准。评估维度包括问题相关性、证据层级合理性、证据质量与时效性、证据回答一致性、信息全面性与深度、逻辑严谨性以及医学术语规范性，覆盖从回答是否紧扣临床问题、是否合理区分和使用不同等级证据、是否引用高质量且具时效性的医学证据，到回答内容是否严格基于证据、信息是否充分完整、推理过程是否严谨以及医学表达…

InfoxmedModel/MedTrustBench 是 ModelScope 魔搭社区上的数据集，存储大小 1.1 MB，采用 Apache License 2.0 许可。

- **Repository**: InfoxmedModel/MedTrustBench
- **License**: Apache License 2.0
- **Storage size**: 1.1 MB
- **Downloads**: 121
- **Stars**: 0
- **Last updated**: 2026-05-26

Source: https://www.modelscope.cn/datasets/InfoxmedModel/MedTrustBench

---

MedTrustBench 正式上线：面向循证医学智能体的临床可靠性评估数据集
医学大模型正在快速进入真实医疗场景。从医学问答、文献总结，到临床指南解读、诊疗辅助和科研证据检索，越来越多医学智能体开始承担复杂的信息整合任务。
但在医学领域，一个模型“能回答”远远不够。
真正关键的问题是：它的回答是否可靠？证据是否真实？结论是否符合循证医学原则？面对复杂临床问题时，模型是否能够区分不同证据等级，而不是简单拼接文献片段？当证据存在冲突或不足时，它是否会如实说明，还是生成一个看似确定、实则缺乏依据的结论？
这些问题，决定了医学智能体能否从“演示可用”走向“临床可信”。
为此，我们构建并开源了 MedTrustBench：医学循证评估集。该数据集面向循证医学智能体的回答质量评估而设计，重点考察模型在真实临床决策问题中的证据检索、证据理解、分层表达、事实一致性和安全可靠性。
目前，MedTrustBench 已正式上线 ModelScope，欢迎研究者、开发者和医学AI团队下载使用。

---
为什么需要一个专门的循证医学评估集？
循证医学智能体和普通医学问答模型有本质区别。
普通医学问答模型通常只需要回答“某个疾病是什么”“某种药物有什么作用”“某个指标代表什么”。而循证医学智能体面对的往往是更复杂的问题，例如：
某类患者是否适合使用某种治疗方案？
 某种干预相比对照能否改善临床结局？
 不同指南推荐不一致时，应该如何解释？
 某项研究结果能否外推到当前患者人群？
 在疗效和风险之间，如何做出平衡？
这类问题并不只是医学知识问答，而是典型的循证决策任务。智能体需要完成完整流程：
接收临床问题 → 理解PICO结构 → 检索医学证据 → 判断证据等级 → 整合多来源文献 → 生成分层循证回答
因此，对这类系统的评估，也不能只停留在“回答是否流畅”“有没有提到关键词”“与标准答案是否相似”的层面。
尤其是在经过 DPO、GRPO 等训练后，模型可能在奖励模型上取得较高分数，但这并不意味着它的医学回答一定可靠。一个 reward 分数的收敛，只能说明模型学会了生成“奖励模型偏好的回答”，却无法直接回答以下关键问题：
- 模型引用的医学文献是否真实存在？
- 回答中的关键临床数据是否准确？
- 是否存在编造研究、编造统计结果、编造指南推荐？
- 是否能够区分指南、系统评价、Meta分析和RCT等不同证据等级？
- 是否能够正确处理证据冲突和证据不足？
- 是否存在过度推断，导致潜在错误临床决策？
- 回答是否符合医学术语和临床表达规范？
在医学场景中，这些问题不是细节，而是底线。
一个回答如果语言流畅但证据是编造的，危害远大于一个表达不够优美但数据准确的回答。也正因如此，我们需要一套独立于训练过程、面向真实临床质量维度的评估基准。
MedTrustBench 正是为此而构建。

---
从“标准答案匹配”到“Rubric 条件式评分”
传统QA评估往往采用标准答案，也就是为每个问题准备一个 gold answer，然后比较模型回答与标准答案之间的相似度。
但这种方式并不适合循证医学智能体。
原因很简单：医学证据是动态更新的。
今天数据库中能够检索到的最新指南和临床研究，可能在几个月后被新的证据补充、修订甚至推翻。如果评估集只依赖固定标准答案，很容易出现两个问题：
第一，标准答案会过时。
 第二，模型可能生成了合理、真实、基于新证据的回答，却因为和旧答案不完全一致而被低估。
因此，MedTrustBench 采用了更适合医学智能体的 Rubric 条件式评分机制。
Rubric 并不强制规定“唯一正确答案是什么”，而是定义“一个高质量医学回答应当满足哪些条件”。
例如，对于一道关于 SGLT2 抑制剂能否延缓糖尿病合并慢性肾病患者肾功能恶化的问题，Rubric 关注的不是模型是否逐字复现某个标准答案，而是检查：
- 回答是否聚焦于目标人群和肾脏结局？
- 是否引用了真实存在的关键临床试验？
- 是否正确呈现了核心统计结果？
- 是否区分指南推荐、系统评价和单个RCT？
- 是否编造了不存在的研究或数据？
- 是否夸大疗效，或者忽略适用人群限制？
也就是说，Rubric 把“这个回答好不好”这一模糊判断，拆解成一系列可以明确判断 Yes/No 的具体检查项，并为每个检查项设置权重。
这种方式更贴近真实医学评估过程，也更适合自动化评估。它既保留了医学判断的细粒度，又避免了传统标准答案在动态证据环境中的僵化问题。

---
MedTrustBench 包含什么？
MedTrustBench 面向真实临床决策场景构建，包含 100道临床问题，覆盖多个核心医学专科，包括：
- 心血管
- 肿瘤学
- 内分泌代谢
- 感染性疾病
- 神经内科
- 呼吸系统
- 血液系统
- 消化系统
- 肾脏疾病
- 风湿免疫
这些问题并不是简单的医学常识题，而是模拟医生在真实工作中可能提出的复杂循证问题。
每道题都包含明确的人群特征、干预措施、对照方案和结局指标，并附带标准化的 PICO结构：
- P，Population / Patient： 患者或目标人群
- I，Intervention： 干预措施
- C，Comparison： 对照方案
- O，Outcome： 结局指标
PICO 是循证医学问题构建的核心框架。通过对每道题进行PICO结构化处理，MedTrustBench 能够更准确地考察模型是否真正理解临床问题，而不是只根据关键词生成泛化回答。
例如，模型需要分清楚：
同样是糖尿病患者，是否合并慢性肾病？
 同样是慢性肾病，处于哪个分期？
 同样是SGLT2抑制剂，具体干预药物是什么？
 同样是疗效评估，关注的是肾脏终点、心血管终点，还是死亡风险？
这些细节直接决定了证据是否适用，也决定了回答是否具有临床意义。

---
覆盖不同难度，突出复杂临床决策能力
MedTrustBench 不仅关注基础问题，也重点覆盖复杂和争议性临床场景。
数据集按照难度划分为多个等级：
- G1： 有明确一致指南推荐、证据充分的基础问题
- G2： 需要比较多种方案优劣的中等难度问题
- G3： 涉及特殊人群、合并症或获益风险权衡的复杂问题
- G4： 证据存在冲突、指南推荐不一致或临床判断难度较高的问题
其中，数据集以 G3 和 G4 问题为主，更强调对复杂临床决策能力的评估。
这非常重要。因为对于医学智能体而言，真正拉开差距的不是简单问题，而是复杂问题。
在基础问题上，很多模型都可以给出看似正确的回答。但一旦问题涉及特殊人群、合并症、证据不一致、指南更新或获益风险权衡，模型是否还能保持证据忠实、逻辑严谨、表达审慎，就成为评估其临床可靠性的关键。
MedTrustBench 正是希望通过这些高质量问题，帮助开发者更真实地看到模型能力边界。

---
七大评估维度：不仅看“答没答”，更看“答得是否可信”
MedTrustBench 构建了系统化的七维度评估体系，共包含 1187条 Rubric 评分标准。这些标准从不同角度覆盖循证医学回答的核心质量要求。
1. 问题相关性
首先，模型必须回答用户真正提出的问题。
问题相关性评估模型是否准确识别临床问题中的核心对象，包括患者人群、干预措施、对照方案和结局指标。它关注回答是否偏题，是否引入无关疾病、无关药物或无关结局。
在医学场景中，偏题不是小问题。比如用户问的是某药物对肾脏结局的影响，模型却主要讨论心血管获益，即使内容本身正确，也不能算是高质量回答。

---
2. 证据层级合理性
循证医学强调证据分层。
指南、系统评价、Meta分析、随机对照试验、观察性研究，它们的证据等级和解释方式并不相同。一个合格的循证医学智能体，不仅要能找到证据，还要能说明证据处于什么层级。
这一维度评估模型是否能够清晰区分不同证据来源，是否优先呈现高等级证据，是否避免把指南推荐、Meta分析和单个RCT混在一起讨论。
这也是循证医学智能体区别于普通医学问答系统的重要能力：它不仅告诉用户“结论是什么”，还要告诉用户“这个结论有多可靠”。

---
3. 证据质量与时效性
医学证据不断更新。一个基于过时文献的回答，可能已经不符合当前临床实践。
这一维度评估模型是否引用权威、及时、高质量的证据来源，是否能够优先选择当前主流指南、关键临床试验和高质量综述，而不是依赖陈旧、低相关性或质量较低的研究。
对于真实临床应用而言，证据的时效性至关重要。特别是在肿瘤、感染、心血管等领域，指南和治疗证据更新速度很快，模型如果不能识别最新主流证据，就很难支撑可靠决策。

---
4. 证据回答一致性
这是 MedTrustBench 中最关键的评估维度之一。
证据回答一致性关注的是：模型的回答是否真的与所引用证据一致。
具体包括：
- 是否编造不存在的文献？
- 是否编造不存在的试验名称？
- 是否把某项研究的结果张冠李戴到另一种药物或人群？
- 是否错误报告HR、RR、OR、P值、置信区间等关键数据？
- 是否把探索性结论表述成确定性推荐？
- 是否在证据不足时强行给出确定结论？
在医学AI中，幻觉问题尤其危险。普通场景中的幻觉可能只是信息错误，但医学场景中的幻觉可能直接影响诊疗判断。因此，MedTrustBench 在这一维度中设置了负向评分项，用于惩罚编造证据、有害推断和严重事实错误。

---
5. 信息全面性与深度
一个高质量的医学回答不能只有结论。
对于临床医生而言，“推荐使用”或“不推荐使用”只是结果，更重要的是：为什么？基于什么证据？适用于哪些人群？效果大小如何？风险是什么？是否存在局限？
这一维度评估模型是否能够完整呈现关键信息，包括核心研究结果、证据细节、适用边界、潜在风险和背景说明。
尤其在复杂临床问题中，全面性和深度决定了回答是否真正有助于决策，而不是停留在泛泛而谈。

---
6. 逻辑严谨性
医学回答不仅要事实正确，还要推理合理。
逻辑严谨性评估模型是否能够从证据出发，经过清晰的分析，得出审慎的结论。它关注证据、分析和结论之间是否存在合理衔接，是否存在跳步推理、因果混淆、过度外推或自相矛盾。
例如，一项研究显示某药物改善替代终点，并不必然意味着它改善长期生存；一项针对普通人群的试验结果，也不能未经说明直接外推到高龄、妊娠、肾功能不全等特殊人群。
这些都是医学智能体必须处理好的逻辑问题。

---
7. 医学术语规范性
最后，医学表达本身也需要规范。
这一维度评估模型是否正确使用疾病名称、药物名称、研究设计、结局指标和统计学术语，是否保持术语一致，是否符合医学写作习惯。
术语规范性看似是表达问题，实际会影响理解准确性。尤其是在药物通用名、商品名、疾病分型、临床终点和研究类型等方面，错误或混乱的表达可能导致严重误解。

---
正负向评分结合，更重视安全性和可靠性
MedTrustBench 的 Rubric 评分包含正向和负向两类标准。
正向评分用于奖励模型“做对了什么”，例如：
- 正确识别PICO要素
- 合理分层证据
- 引用高质量研究
- 准确报告关键数据
- 完整呈现获益和风险
- 规范使用医学术语
负向评分则用于惩罚模型“犯了什么严重错误”，尤其是：
- 编造不存在的研究
- 编造临床数据
- 歪曲文献结论
- 夸大疗效
- 忽略重要风险
- 基于不足证据给出过强推荐
- 可能导致错误临床决策的有害推断
这种正负向结合的机制，使评估不只是鼓励信息丰富，更优先保证医学安全性和证据可靠性。
这也是 MedTrustBench 的一个重要设计原则：
宁可回答保守，也不能证据失真；宁可说明不确定，也不能编造确定性。

---
MedTrustBench 的核心优势
1. 更贴近真实临床使用场景
MedTrustBench 的问题设计不是抽象知识点，而是真实临床决策问题。每道题都要求模型理解具体人群、干预、对照和结局，并基于多层级医学证据进行回答。
这与循证医学智能体在实际部署中的工作方式高度一致，因此评估结果更具有现实参考价值。

---
2. 不依赖固定标准答案，更适合动态医学证据环境
Rubric 评分不要求模型复现唯一答案，而是判断回答是否满足医学质量标准。这使得评估方式能够更好适应医学文献持续更新的特点，也更适合RAG和Agent类系统。
无论模型使用哪种检索系统，只要回答符合循证医学原则、证据真实准确、逻辑严谨，就可以获得合理评价。

---
3. 可以进行维度化诊断，而不只是给一个总分
传统评估往往只给出总分，但总分很难告诉开发者模型到底哪里有问题。
MedTrustBench 的七维度设计可以帮助团队看到更细的能力画像。例如：
- 模型是否容易偏题？
- 是否会混淆证据层级？
- 是否引用过时文献？
- 是否存在医学幻觉？
- 是否回答不够完整？
- 是否逻辑推理不严谨？
- 是否术语表达不规范？
这些诊断结果可以直接指导下一轮训练数据构建和模型优化。

---
4. 强化幻觉检测，关注医学AI最关键风险
在医学智能体评估中，幻觉检测是最重要的问题之一。
MedTrustBench 通过负向 Rubric 专门识别编造文献、编造数据和无依据推断等高风险错误。相比只看文本相似度或回答流畅度的评估方式，它更能发现“看起来专业但其实不可靠”的医学回答。
这对于医学AI的安全评估尤其重要。

---
5. 支持自动化评估流程
MedTrustBench 的 Rubric 被设计为 Yes/No 可判断条件，这使得评分过程可以由经过校准的 LLM Judge 自动完成。
在实际使用中，可以先通过人工评分与模型评分进行一致性校准，再扩展到全量自动评估。这样既保证一定的评估可靠性，也能显著降低大规模医学模型评估的成本。
对于需要频繁迭代模型的团队来说，这一点尤其有价值。

---
6. 能与训练形成闭环
MedTrustBench 不只是一个评估集，也可以成为模型迭代闭环中的关键工具。
例如，如果评估结果显示模型在“证据层级合理性”上得分较低，团队可以针对性构建更多分层证据表达的训练样本；如果模型在“证据回答一致性”上失分较多，则可以强化忠实度约束和幻觉惩罚；如果模型在复杂问题上表现下降，则可以增加G3、G4难度样本进行定向训练。
最终形成：
评估 → 诊断 → 数据构建 → 模型优化 → 再评估
的持续改进流程。

---
谁适合使用 MedTrustBench？
MedTrustBench 适用于多种医学AI研发和评估场景，包括：
- 医学大模型评估
- 循证医学智能体评估
- 医学RAG系统评估
- 医学Agent检索与回答质量评估
- 医学问答系统事实一致性评估
- DPO / GRPO 训练前后效果对比
- 医学模型幻觉检测
- 自动化医学 Judge 研究
- 临床决策支持系统原型验证
- 模型版本迭代中的质量回归测试
如果你的系统需要回答临床问题、检索医学证据、总结指南或生成循证建议，MedTrustBench 都可以作为一个高质量评估基准。

---
推动医学AI从“会回答”走向“可信赖”
医学AI的发展，不能只追求回答更长、更流畅、更像专家。
在临床场景中，真正重要的是回答是否经得起验证：
 证据是否真实，数据是否准确，结论是否审慎，推理是否严谨，表达是否规范。
MedTrustBench 希望为循证医学智能体提供一套标准化、可复现、维度化的评估工具，帮助研究者和开发者更清晰地衡量模型的真实能力。
它关注的不只是模型“知道什么”，更关注模型是否能够在复杂医学问题中做到：
基于证据回答，按照层级表达，面对不确定性保持审慎，避免幻觉和有害推断。
这是医学智能体走向真实应用必须跨过的一道门槛。

---
数据集已上线 ModelScope
MedTrustBench 已正式上线 ModelScope，欢迎下载、使用和交流。
数据集地址：
https://www.modelscope.cn/datasets/InfoxmedModel/MedTrustBench
如果你正在构建医学大模型、医学RAG系统、循证医学智能体或医学自动化评估框架，欢迎使用 MedTrustBench 作为评估基准，一起推动医学AI从“能答”走向“可信”，从“生成内容”走向“生成可靠证据支持的医学回答”。
