数巨有谱数据集团
[01 · SHP-MED-07-047]

医疗安全与红队测试集

面向医疗大模型的安全边界测试集。用例按风险域组织,每例给一段临床上下文,再派生带干扰的对抗变体。每条用例预先定义必须行为与禁止结果两项判据,另标严重度。判分是二元的——两条同时满足才算通过。用于上线前的安全摸底与院内准入评估。

医疗模型评测与安全 · 评估与研究使用许可 · 更新日期 2026-08-05

17
实体
95
字段
2
实体关系
07
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体17对抗变体 · 临床上下文 · 期望行为 · 失败模式 · 缺失与冲突证据 · 模拟工具合同 · 禁止结果 · 数据质量项 · 复核记录 · 风险分类 · 安全用例 · 评分点 · 评分细则 · 严重度标注 · 来源沿袭 · 数据划分 · 可见证据
字段95交付范围内的字段总数
实体关系2每条安全测试用例连接临床上下文、可见证据与对抗变体。同一用例另连期望行为、禁止结果、严重程度、评分细则与失败模式 · 工具状态域另连模拟工具合约,空结果与错误状态各自登记

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

17 个实体13 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01关联实体

对抗变体

变体类型/变体正文

02关联实体

临床上下文

上下文正文/来源层级

03关联实体

期望行为

必须动作/不确定性/升级

04关联实体

失败模式

失败触发条件

05关联实体

缺失与冲突证据

缺口类型/处理规则

06关联实体

模拟工具合同

输入/输出/错误状态

07关联实体

禁止结果

禁止正文/失败归类

08辅助实体

数据质量项

quality_issue

09关联实体

复核记录

复核状态/版本

10关联实体

风险分类

风险域/医学范围

11核心实体

安全用例

风险域/情境/严重度

12关联实体

评分点

判分要点/满分

13关联实体

评分细则

二元计分口径

14关联实体

严重度标注

分级/依据

15辅助实体

来源沿袭

source_lineage

16关联实体

数据划分

同族变体不拆分

17关联实体

可见证据

证据正文/角色

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

临床上下文

上下文正文/来源层级

1—n
实体 B

安全用例

风险域/情境/严重度

实体 A02

临床上下文

上下文正文/来源层级

1—n
实体 B

可见证据

证据正文/角色

实体 A03

风险分类

风险域/医学范围

1—n
实体 B

安全用例

风险域/情境/严重度

实体 A04

安全用例

风险域/情境/严重度

1—n
实体 B

对抗变体

变体类型/变体正文

实体 A05

安全用例

风险域/情境/严重度

1—1
实体 B

期望行为

必须动作/不确定性/升级

实体 A06

安全用例

风险域/情境/严重度

1—1
实体 B

禁止结果

禁止正文/失败归类

实体 A07

安全用例

风险域/情境/严重度

1—n
实体 B

缺失与冲突证据

缺口类型/处理规则

实体 A08

安全用例

风险域/情境/严重度

1—1
实体 B

严重度标注

分级/依据

实体 A09

安全用例

风险域/情境/严重度

1—n
实体 B

失败模式

失败触发条件

实体 A10

安全用例

风险域/情境/严重度

1—1
实体 B

模拟工具合同

输入/输出/错误状态

实体 A11

安全用例

风险域/情境/严重度

1—1
实体 B

评分细则

二元计分口径

实体 A12

安全用例

风险域/情境/严重度

1—n
实体 B

评分点

判分要点/满分

实体 A13

安全用例

风险域/情境/严重度

1—n
实体 B

复核记录

复核状态/版本

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
临床上下文1—n安全用例一个临床上下文可派生多道用例
临床上下文1—n可见证据上下文声明作答时可见的证据
风险分类1—n安全用例用例按风险分类归入风险域
安全用例1—n对抗变体用例带可直接运行的干扰变体
安全用例1—1期望行为用例写明必须做到的行为
安全用例1—1禁止结果用例写明不得出现的结果
安全用例1—n缺失与冲突证据用例声明被有意保留的缺口与冲突
安全用例1—1严重度标注用例标注严重度与分级依据
安全用例1—n失败模式失败按失败模式归类
安全用例1—1模拟工具合同工具类用例另附模拟工具合同
安全用例1—1评分细则用例对应一版评分细则
安全用例1—n评分点按评分点逐点判分
安全用例1—n复核记录用例的历次复核记录

安全用例是判分的单位。可见证据、被保留的缺口、干扰变体、必须做到的行为与不得出现的结果,全部挂在同一个用例上。每次判定都说得清是哪一条要求没做到。期望行为与禁止结果是两个节点:「该做的做到了」与「不该说的没说」分别成立,才算通过。工具类用例另接模拟工具合同,空结果与报错状态在合同里就声明为非成功。同一基础上下文派生的变体经数据划分整体成组。

[03]

使用场景

上线前的安全底线摸底与阻断项确认

医疗科技企业 · 医疗大模型安全团队

  • 两条判据都要满足:必须做到的行为达成、且禁止结果一次未出现,才算这道用例通过。表述得体但含任一危险表述的输出,同样判为不通过
  • 急症要求给出升级处置:急症用例要求明确给出升级处置建议
  • 缺口是有意留的:用例声明哪些信息被刻意抽走,检验会不会用相邻信息补造出确定结论
  • 同事实多变体:同一临床事实派生出带干扰内容的多个变体,看结论会不会因措辞变化而翻转
  • 按严重度设阈:严重度分级随用例交付,高严重度项可单独设零容忍阈值

获得:必须行为与禁止结果双向约束、可按严重度设定阈值的安全基线

院内准入的安全条款与留档

医院信息部门 · 智能应用上线前安全评估

  • 条款落到用例:院方关心的急症、禁忌与剂量单位,各自对应到具体用例
  • 结果可复跑:用例、期望行为与判分口径版本固定,供应商换版本后跑同一套用例,前后结果直接对照
  • 失败可归档:失败按失败模式归类,评估结论写成「哪一类风险不达标」
  • 越界请求有边界:越界类用例要求拒绝具体执行,但保留安全指引。贴合院内既要安全又要可用的实际需要

获得:可写进准入条款、失败可归类留档的安全评估依据

风险场景覆盖与残余风险的书面表达

医疗器械与医疗软件企业 · 安全性材料准备

  • 风险域逐项覆盖:按风险分类逐域取用例,覆盖情况可按域列表说明
  • 不通过项如实列:未达标用例与其严重度,构成残余风险的书面依据
  • 判据先于结果:期望行为与禁止结果在测试前就写定
  • 用例与判分口径版本化:用例与判分口径每次变更形成新版本,历史结论保留

获得:覆盖情况可逐域说明、残余风险有书面依据的安全材料

对抗变体设计与判据一致性研究

高校与科研机构 · 模型安全评测方法研究

  • 变体只改一个因素:同族变体的临床事实不变,只改声明的那一个因素。哪一类干扰导致失效,可以分离出来
  • 二元判据的可靠性:必须行为与禁止结果都写成可判定的文字。可用于研究不同评判者对同一输出的判定一致性
  • 严重度分级研究:严重度按潜在伤害与不可逆性分级,可用于研究分级口径对整体结论的影响
  • 变体同族整体成组:同一基础情境的变体整体成组保存

获得:干扰因素可分离、判据一致性可测量的安全评测研究底座

[04]

定制与定向

  • 是否支持定制:是
  • 风险域范围(单选):按单一风险域 / 按全风险域组合
  • 其他定制项(多选):情境类型构成 / 对抗变体强度 / 严重度分布 / 工具类用例比例 / 临床科室场景
  • 最低定制数量:300 道安全测试用例
  • 风险体系:风险域扩充、严重度分级与失败模式体系按项目商定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 用例上下文按临床事实保留、身份线索移除的口径重写;干扰文本另行核查不携带任何真实标识
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-07-042 通用临床能力评测集——与安全测试配套的能力侧基线
  • SHP-MED-09-058 生成式临床难例与边界场景数据——同口径的边界场景与受控变体
  • SHP-MED-06-041 临床决策过程监督数据——决策节点侧的过程数据
[07]

常见问题

医疗安全与红队测试集包含哪些内容?

医疗安全与红队测试集(SHP-MED-07-047)按风险域组织用例,每例给一段临床上下文,再派生带干扰的对抗变体。每条用例预先写定必须行为与禁止结果两项判据,另标严重度。判分是二元的,两条同时满足才算通过。

红队测试集适合做什么?

医疗安全与红队测试集(SHP-MED-07-047)用于医疗大模型上线前的安全边界摸底、阻断项确认与院内准入评估。它作为独立评测集使用,与训练侧数据隔离,按风险域与严重度分别汇总通过情况。

样例和交付形态是什么样的?

公开样例展示医疗安全与红队测试集(SHP-MED-07-047)的用例结构:临床上下文、可见证据、对抗变体、期望行为与禁止结果、评分细则。交付为用例清单加单一用例文件夹与元数据文件,另支持 API 调用与连接器合约使用。

起订量是多少?怎么定制?

医疗安全与红队测试集(SHP-MED-07-047)起订量为 300 道安全测试用例,范围按单一风险域或全风险域组合确定。情境类型构成、对抗变体强度、严重度分布、工具类用例比例与临床科室场景可选配。

安全测试集和哪些产品一起用?

医疗安全与红队测试集(SHP-MED-07-047)常与通用临床能力评测集(SHP-MED-07-042)配套,能力侧与安全侧同批测。训练侧要把边界行为训成可控行为,可取生成式临床难例与边界场景数据(SHP-MED-09-058)。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。