发布间可比
- 题面文本定版、规则带版本,同一套题可在不同模型版本间横向比较
- 错误类型细分到检索、抽取、生成三段,失分可定位到具体环节
- 高风险情境配输入变体、期望行为与禁止结果,可用于安全回归测试
八套独立评测集,按任务域给出题目、参考答案与评分细则,输出分任务、分亚组的得分。
8 个数据产品 · 更新日期 2026-08-05
共 8 个产品,按产品编号排列。
同一体系中的产品可按患者、就诊、事件、样本或任务标识连接。
| 数据产品 | 相关产品 | 连接关系 |
|---|---|---|
| 通用临床能力评测集 | 医疗安全与红队测试集 | 医疗安全与幻觉风险评测集补充安全边界。 |
| 医疗安全与红队测试集 | 通用临床能力评测集 | 与产品42组合,扩展该产品的输入、任务或评测场景。 |
| 医疗安全与红队测试集 | 医疗检索增强生成(RAG)评测集 | 与产品46组合,扩展该产品的输入、任务或评测场景。 |
| 医疗隐私、公平性与鲁棒性评测集 | 通用临床能力评测集 | 与产品42组合,扩展该产品的输入、任务或评测场景。 |
| 医疗隐私、公平性与鲁棒性评测集 | 医疗安全与红队测试集 | 与产品47组合,扩展该产品的输入、任务或评测场景。 |
| 独立测试与外部验证数据 | 通用临床能力评测集 | 与产品42组合,扩展该产品的输入、任务或评测场景。 |
| 独立测试与外部验证数据 | 纵向病程与时间推理评测集 | 与产品43组合,扩展该产品的输入、任务或评测场景。 |
| 独立测试与外部验证数据 | 临床信息抽取与编码评测集 | 与产品44组合,扩展该产品的输入、任务或评测场景。 |
与其他体系配合时常用的产品连接。
| 数据产品 | 相关产品 | 连接关系 |
|---|---|---|
| 临床决策过程监督数据 | 通用临床能力评测集 | 通用临床能力评测集提供分项评测结构。 |
| 通用临床能力评测集 | 临床指令微调训练数据 | 临床指令微调训练数据提供训练语料。 |
| 通用临床能力评测集 | 临床决策过程监督数据 | 临床决策过程监督数据提供决策节点任务。 |
| 纵向病程与时间推理评测集 | 患者纵向诊疗数据 | 患者纵向诊疗数据提供跨就诊事件。 |
| 纵向病程与时间推理评测集 | 检验时序与变化数据 | 检验时序与变化数据提供可复算检验序列。 |
| 纵向病程与时间推理评测集 | 临床时间事件标注数据 | 临床时间事件标注数据提供时间表达结构。 |
| 临床信息抽取与编码评测集 | 临床实体与关系标注数据 | 临床实体与关系标注数据提供训练标注结构。 |
| 临床信息抽取与编码评测集 | 诊断、操作与药品术语标准化数据 | 诊断、操作与药品术语标准化数据提供术语候选。 |
| 临床信息抽取与编码评测集 | 临床文本去标识化数据 | 临床文本去标识化数据提供可读文本输入。 |
| 医学多模态诊断与报告评测集 | 医学影像—报告配对数据 | 医学影像—报告配对数据提供检查级影像层级。 |
| 医学多模态诊断与报告评测集 | 多模态临床训练数据 | 多模态临床训练数据提供训练任务结构。 |
| 医学多模态诊断与报告评测集 | 人群与模态平衡增强数据 | 稀缺人群与多模态平衡增强数据补充平衡场景。 |
医疗模型的风险集中在边界情况:罕见表现、时间推理、跨模态一致、诱导性提问、隐私泄漏与人群差异。体系 07 提供从通用能力、时间推理、抽取编码、多模态到安全红队、隐私公平与外部验证的评测集,全部作为独立评测使用,与训练侧数据隔离。
多数团队先用通用临床能力评测集(SHP-MED-07-042)拿到能力基线,再按薄弱面补专项。安全侧上医疗安全与红队测试集(SHP-MED-07-047)确认阻断项,需要泛化证据时取独立测试与外部验证数据(SHP-MED-07-049)。
评测对象通常是体系 06 训练出的模型,两者按同一任务口径成对使用;评测素材的临床事实来自体系 01 至 05。分组样本与边界场景不足时,由体系 09 的合成与增强数据定向补齐。