数巨有谱数据集团
[01 · System 07]

医疗模型评测与安全

八套独立评测集,按任务域给出题目、参考答案与评分细则,输出分任务、分亚组的得分。

8 个数据产品 · 更新日期 2026-08-05

[02 · 产品清单]

本体系数据产品

共 8 个产品,按产品编号排列。

[03 · 使用场景]

典型场景

[01 · 模型团队 · 评测与发布]

发布间可比

  • 题面文本定版、规则带版本,同一套题可在不同模型版本间横向比较
  • 错误类型细分到检索、抽取、生成三段,失分可定位到具体环节
  • 高风险情境配输入变体、期望行为与禁止结果,可用于安全回归测试
[02 · 医疗机构 · 引入评估]

选型判据

  • 题目基于真实脱敏临床文书构建,并含明确标识的合成条目;每条的数据性质与复核状态随数据交付
  • 分组适用性与输入扰动稳定性两项,可评估模型在本院场景下的稳定性
  • 外部验证结构已定义,独立队列的验证项目可直接接入
[04 · 数据关系]

体系内数据关系

同一体系中的产品可按患者、就诊、事件、样本或任务标识连接。

数据产品相关产品连接关系
通用临床能力评测集医疗安全与红队测试集医疗安全与幻觉风险评测集补充安全边界。
医疗安全与红队测试集通用临床能力评测集与产品42组合,扩展该产品的输入、任务或评测场景。
医疗安全与红队测试集医疗检索增强生成(RAG)评测集与产品46组合,扩展该产品的输入、任务或评测场景。
医疗隐私、公平性与鲁棒性评测集通用临床能力评测集与产品42组合,扩展该产品的输入、任务或评测场景。
医疗隐私、公平性与鲁棒性评测集医疗安全与红队测试集与产品47组合,扩展该产品的输入、任务或评测场景。
独立测试与外部验证数据通用临床能力评测集与产品42组合,扩展该产品的输入、任务或评测场景。
独立测试与外部验证数据纵向病程与时间推理评测集与产品43组合,扩展该产品的输入、任务或评测场景。
独立测试与外部验证数据临床信息抽取与编码评测集与产品44组合,扩展该产品的输入、任务或评测场景。
[05 · 组合推荐]

跨体系推荐

与其他体系配合时常用的产品连接。

数据产品相关产品连接关系
临床决策过程监督数据通用临床能力评测集通用临床能力评测集提供分项评测结构。
通用临床能力评测集临床指令微调训练数据临床指令微调训练数据提供训练语料。
通用临床能力评测集临床决策过程监督数据临床决策过程监督数据提供决策节点任务。
纵向病程与时间推理评测集患者纵向诊疗数据患者纵向诊疗数据提供跨就诊事件。
纵向病程与时间推理评测集检验时序与变化数据检验时序与变化数据提供可复算检验序列。
纵向病程与时间推理评测集临床时间事件标注数据临床时间事件标注数据提供时间表达结构。
临床信息抽取与编码评测集临床实体与关系标注数据临床实体与关系标注数据提供训练标注结构。
临床信息抽取与编码评测集诊断、操作与药品术语标准化数据诊断、操作与药品术语标准化数据提供术语候选。
临床信息抽取与编码评测集临床文本去标识化数据临床文本去标识化数据提供可读文本输入。
医学多模态诊断与报告评测集医学影像—报告配对数据医学影像—报告配对数据提供检查级影像层级。
医学多模态诊断与报告评测集多模态临床训练数据多模态临床训练数据提供训练任务结构。
医学多模态诊断与报告评测集人群与模态平衡增强数据稀缺人群与多模态平衡增强数据补充平衡场景。
[06 · FAQ]

常见问题

医疗模型评测与安全体系解决什么问题?

医疗模型的风险集中在边界情况:罕见表现、时间推理、跨模态一致、诱导性提问、隐私泄漏与人群差异。体系 07 提供从通用能力、时间推理、抽取编码、多模态到安全红队、隐私公平与外部验证的评测集,全部作为独立评测使用,与训练侧数据隔离。

这个体系应该从哪个产品开始用?

多数团队先用通用临床能力评测集(SHP-MED-07-042)拿到能力基线,再按薄弱面补专项。安全侧上医疗安全与红队测试集(SHP-MED-07-047)确认阻断项,需要泛化证据时取独立测试与外部验证数据(SHP-MED-07-049)。

评测与安全体系和哪些体系配合?

评测对象通常是体系 06 训练出的模型,两者按同一任务口径成对使用;评测素材的临床事实来自体系 01 至 05。分组样本与边界场景不足时,由体系 09 的合成与增强数据定向补齐。