数巨有谱数据集团
[01 · SHP-MED-07-042]

通用临床能力评测集

一套成体系的临床能力评测集,用于测量医疗大模型在本评测集覆盖的五类临床能力域上的表现。每道题标明考的是哪一类临床能力、难度层级,以及在给定证据下能不能答。题目随附证据、参考答案与评分细则,失分按错误类型归类。可用于上线前能力摸底、版本回归,以及多家模型同题比选。

医疗模型评测与安全 · 评估与研究使用许可 · 更新日期 2026-08-05

9
实体
58
字段
1
实体关系
07
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体9错误类型 · 评测条目 · 证据条目 · 数据质量项 · 参考答案 · 复核记录 · 评分细则 · 来源文书 · 来源沿袭
字段58交付范围内的字段总数
实体关系1证据条目与参考答案各自成列,按条目标识挂到同一道评测条目

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

9 个实体6 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01关联实体

错误类型

失分归类

02核心实体

评测条目

能力域/难度/可答性

03关联实体

证据条目

证据正文/可用时间

04辅助实体

数据质量项

quality_issue

05关联实体

参考答案

答案要点/复核状态

06关联实体

复核记录

复核状态/时点

07关联实体

评分细则

计分方法/满分/部分得分

08关联实体

来源文书

文书族/去标识状态

09辅助实体

来源沿袭

source_lineage

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

来源文书

文书族/去标识状态

1—n
实体 B

评测条目

能力域/难度/可答性

实体 A02

评测条目

能力域/难度/可答性

1—n
实体 B

证据条目

证据正文/可用时间

实体 A03

评测条目

能力域/难度/可答性

1—1
实体 B

参考答案

答案要点/复核状态

实体 A04

评测条目

能力域/难度/可答性

1—1
实体 B

评分细则

计分方法/满分/部分得分

实体 A05

评测条目

能力域/难度/可答性

1—n
实体 B

错误类型

失分归类

实体 A06

评测条目

能力域/难度/可答性

1—n
实体 B

复核记录

复核状态/时点

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
来源文书1—n评测条目一份来源文书可支撑多道条目的题干
评测条目1—n证据条目条目挂接可回放的证据条目
评测条目1—1参考答案一道条目对应一份参考答案
评测条目1—1评分细则一道条目对应一版评分细则
评测条目1—n错误类型条目的失分按错误类型归类
评测条目1—n复核记录条目的历次复核记录

评测条目是整套结构的锚点。题干、证据、参考答案、评分细则、错误类型与复核记录都按条目标识对齐。可以整套回放,也可以只取其中一层。数据质量项与来源沿袭(记录每个对象出自哪份来源、经哪条加工规则得来)覆盖全部对象。

[03]

使用场景

上线前的能力基线摸底与版本回归

医疗科技企业 · 医疗大模型研发团队

  • 能力分项出分:按五类能力域分别出分。看得清模型是诊断推理弱还是沟通表达弱
  • 难度梯度诊断:三级难度分别统计。看模型是在基础事实上失分,还是在需要多步推理的题上失分
  • 拒答能力检验:可答性判定声明本题在给定证据范围内是否可答。可以直接检验模型在信息不够时的表现
  • 迭代回归:条目、参考答案与评分细则版本固定,模型每次迭代后跑同一套题,分数可直接前后对比
  • 失分归因:按错误类型统计失分分布,把笼统的能力结论细化到具体能力域的失分分布

获得:可分项、可复跑、能定位到具体能力短板的模型评测基线

院内引入前的模型比选与合同判据

医院信息部门 · 智能应用选型

  • 同题比选:多家候选模型跑同一套条目与同一版评分细则,横向结果不受各家自评口径影响
  • 判据可写进合同:计分方法、满分点数与部分得分规则措辞明确,可直接写成采购与试用的判定条款
  • 边界要求成题:把「信息不足时必须说明」写成可判分的条目
  • 科室侧重加权:按能力域加权出分,临床科室按自身用途决定更看重诊断推理还是医患沟通

获得:可写进合同、可复算的模型比选口径

临床能力证据的成套组织与边界披露

药械与数字疗法企业 · 产品能力材料

  • 能力声明有据:产品宣称的每一项能力,对应到具体能力域的评测结果
  • 过程可回放:题干、证据、参考答案、评分细则与复核记录成套留存,第三方可按同一口径复算
  • 边界如实写清:不可答条目与失分错误类型,构成产品能力边界的书面依据
  • 版本留痕:模型或判分口径每次变更形成新版本,历史结果保留

获得:可提交、可复核、边界写得清楚的能力证据包

评测方法学研究与自建评测集的组织框架

高校与科研机构 · 医学人工智能评测研究

  • 条目结构参照:能力域—难度—可答性—证据—评分细则这一套结构现成。可直接用作自建评测集的组织框架
  • 判分口径研究:要点加权与部分得分规则可复算,用于研究不同判分口径对模型排名的影响
  • 难度标注稳定性:难度按规则先验设定,可用于研究难度标注方法本身的稳定性
  • 错误分布分析:错误类型登记提供失分归因框架,支持按能力域做错误分布与弱项迁移研究

获得:结构清晰、判分可复算的评测方法学研究底座

[04]

定制与定向

  • 是否支持定制:是
  • 能力域范围(单选):按单一能力域 / 按全能力域组合
  • 其他定制项(多选):任务类型 / 难度分层比例 / 可答性构成 / 评分细则版本 / 临床科室场景
  • 最低定制数量:500 道评测条目
  • 扩展项:能力域扩充、难度梯度重排与错误类型体系按项目商定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 题干与证据文本逐条核查,去除可回联至具体个人与机构的细节
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-07-043 纵向病程与时间推理评测集——时间维度上的专项能力评测
  • SHP-MED-07-047 医疗安全与红队测试集——与能力评测配套的安全侧测试
  • SHP-MED-06-036 临床指令微调训练数据——训练侧对应的指令数据
[07]

常见问题

通用临床能力评测集包含哪些内容?

通用临床能力评测集(SHP-MED-07-042)由评测条目、证据、参考答案、评分细则与错误类型构成,按同一条目标识对齐。能力域覆盖临床知识与术语、病例理解与证据、诊断推理、治疗与风险、医患沟通。条目标明难度层级,以及在给定证据下能否作答。

通用临床能力评测集适合做哪些任务?

通用临床能力评测集(SHP-MED-07-042)用于医疗大模型上线前的能力摸底、版本迭代后的回归比对,以及多家模型同题比选。它作为独立评测集使用,与训练侧数据隔离。按能力域分项出分,短板落在哪类能力上看得清楚。

这套评测集的样例能看到什么?怎么交付?

公开样例展示通用临床能力评测集(SHP-MED-07-042)的条目结构:能力域、难度层级、可答性判定、证据挂接与评分细则;题目与参考答案随项目交付。交付形态为条目清单加单一条目文件夹与元数据文件,另支持 API 调用与连接器合约使用。

通用临床能力评测集怎么定制?起订量是多少?

通用临床能力评测集(SHP-MED-07-042)起订量为 500 道评测条目,范围按单一能力域或全能力域组合确定。任务类型、难度分层比例、可答性构成、评分细则版本与临床科室场景可选配,数据量按项目商定。

通用临床能力评测集常和哪些产品一起用?

通用临床能力评测集(SHP-MED-07-042)常与纵向病程与时间推理评测集(SHP-MED-07-043)合用,补上时间维度的专项考查。安全侧配医疗安全与红队测试集(SHP-MED-07-047),能力与安全一并测。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团