数巨有谱数据集团
[01 · SHP-MED-07-046]

医疗检索增强生成(RAG)评测集

检索增强问答的评测集,检索段与生成段分开算分。语料先冻结成一份快照,在其上切块并配检索问题。相关性判定说明「应该检到什么」,与实际检索结果分列。参考答案拆成一条条断言,每条断言的引用回指到具体分块。用于区分失败发生在检索段(未召回相关证据)还是生成段(已召回但未被正确使用)。

医疗模型评测与安全 · 评估与研究使用许可 · 更新日期 2026-08-05

17
实体
107
字段
3
实体关系
07
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体17答案断言 · 引用 · 语料分块 · 语料文书 · 语料快照 · 错误类型 · 数据质量项 · 评测问题 · 参考答案 · 相关性判定 · 检索结果 · 检索运行 · 复核记录 · 评分点 · 评分细则 · 来源沿袭 · 数据划分
字段107交付范围内的字段总数
实体关系3一份语料文书切成多个证据分块;查询按相关性判定与检索结果连接到分块 · 一份参考答案拆成多条断言;每条断言按引用连接到支持它的分块与字符区间 · 每次检索运行绑定唯一的语料快照、查询与配置版本

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

17 个实体14 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01关联实体

答案断言

断言正文/支持状态

02关联实体

引用

引用起止/支持角色

03关联实体

语料分块

分块正文/起止位置

04关联实体

语料文书

文书族/正文/版本

05关联实体

语料快照

快照版本/分块策略

06关联实体

错误类型

失败条件/严重程度

07辅助实体

数据质量项

quality_issue

08核心实体

评测问题

任务类型/可答性/截点

09关联实体

参考答案

答案正文/拒答理由

10关联实体

相关性判定

相关等级/判定依据

11关联实体

检索结果

名次/分数

12关联实体

检索运行

配置版本/运行时间

13关联实体

复核记录

复核状态/版本

14关联实体

评分点

判分要点/满分

15关联实体

评分细则

计分方法/总分

16辅助实体

来源沿袭

source_lineage

17关联实体

数据划分

隔离层级

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

语料快照

快照版本/分块策略

1—n
实体 B

语料文书

文书族/正文/版本

实体 A02

语料文书

文书族/正文/版本

1—n
实体 B

语料分块

分块正文/起止位置

实体 A03

语料快照

快照版本/分块策略

1—n
实体 B

评测问题

任务类型/可答性/截点

实体 A04

评测问题

任务类型/可答性/截点

1—n
实体 B

相关性判定

相关等级/判定依据

实体 A05

相关性判定

相关等级/判定依据

1—1
实体 B

语料分块

分块正文/起止位置

实体 A06

评测问题

任务类型/可答性/截点

1—n
实体 B

检索运行

配置版本/运行时间

实体 A07

检索运行

配置版本/运行时间

1—n
实体 B

检索结果

名次/分数

实体 A08

检索结果

名次/分数

1—1
实体 B

语料分块

分块正文/起止位置

实体 A09

评测问题

任务类型/可答性/截点

1—1
实体 B

参考答案

答案正文/拒答理由

实体 A10

参考答案

答案正文/拒答理由

1—n
实体 B

答案断言

断言正文/支持状态

实体 A11

答案断言

断言正文/支持状态

1—n
实体 B

引用

引用起止/支持角色

实体 A12

引用

引用起止/支持角色

1—1
实体 B

语料分块

分块正文/起止位置

实体 A13

评测问题

任务类型/可答性/截点

1—1
实体 B

评分细则

计分方法/总分

实体 A14

评测问题

任务类型/可答性/截点

1—n
实体 B

错误类型

失败条件/严重程度

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
语料快照1—n语料文书一次快照固定全部参与检索的文书
语料文书1—n语料分块文书按声明策略切分成可检索的分块
语料快照1—n评测问题问题绑定它所依据的语料快照
评测问题1—n相关性判定问题与分块之间逐条标注相关性
相关性判定1—1语料分块每条相关性判定指向一个具体分块
评测问题1—n检索运行每次检索运行绑定一个问题与一版配置
检索运行1—n检索结果一次运行返回带名次与分数的结果
检索结果1—1语料分块每条结果指向实际检到的分块
评测问题1—1参考答案一个问题对应一份参考答案
参考答案1—n答案断言参考答案拆成可逐条核查的断言
答案断言1—n引用每条断言挂接支持它的引用
引用1—1语料分块引用回指分块中的精确位置
评测问题1—1评分细则一个问题对应一版评分细则
评测问题1—n错误类型失分按错误类型归档

语料快照把参与检索的文书与分块一次性固定下来。问题、相关性判定、检索运行与参考答案都挂在同一份快照上。分块有两条独立路径连过来。相关性判定说的是「应该检到什么」,检索结果说的是「实际检到了什么」。答错时可以先分清是没检到,还是检到了没用好。生成侧由参考答案拆出断言,断言经引用落回分块的精确位置,答案的每一句都查得到出处。

[03]

使用场景

检索段与生成段的分别定位

医疗科技企业 · 病历问答与知识问答产品团队

  • 先分清是哪一段出错:相关性判定与检索结果分开记录。答错时先看是没检到证据,还是检到了却没用好
  • 排序质量单独出分:结果带名次与分数,可按自选截断位置算召回与排序类指标
  • 逐断言查引用:答案拆成断言、每条断言挂精确位置的引用,可直接统计有多少断言真的有出处
  • 不可答题单列:限定语料内证据不足的题,要求说明范围;拒答理由与答错分开统计
  • 换配置可对照:每次检索绑定配置版本,切分方式或检索参数一改就是新一次运行,前后结果直接对比

获得:检索段与生成段分别可诊断、引用可逐条核查的问答评测口径

上线前的证据可追溯性验收

医院信息部门 · 院内知识问答与文书检索选型

  • 答案要能回到原文:把「每条结论都能点回原文位置」写成可判分的要求
  • 范围声明写进判据:证据只在声明的语料范围内有效,超范围作答按失分处理,采购条款可直接引用
  • 时效题单列:带截点的问题检验系统会不会用上还没生效的内容来回答当时的问题
  • 同题横比:多家候选跑同一份快照、同一批问题与同一套评分点,结果不受各家自评口径影响

获得:以证据可追溯为核心、可写进验收条款的选型口径

切分策略与语料版本的影响测量

医学知识库与内容运营团队 · 语料与切分方式评估

  • 切分方式成变量:分块策略单独记版本,同一批问题在不同切分下重跑,直接看出切分对召回的影响
  • 块的边界看得见:每个分块记录在原文中的起止位置,能查出证据是不是被切分切断了
  • 相关与够用分开算:相关性分级与断言是否被支持,分开统计
  • 换版另立快照:语料一改即另立快照,历史结果保留。看得出语料更新究竟改善了什么

获得:可量化切分方式与语料版本影响的评估方法

证据充分性与引用忠实度研究

高校与科研机构 · 检索增强方法研究

  • 三层标注分列:是否被检到、内容是否相关、证据是否足以支撑断言三层分开,可研究三者之间的落差
  • 引用忠实度可算:断言与引用一一挂接且位置精确,引用精确率与召回率可直接复算
  • 拒答行为可研究:不可答题给出限定范围与拒答理由,可用于研究证据不足时的表达方式
  • 判定依据留痕:每条相关性判定写明依据,第三方可按同一依据复标并比较标注一致性

获得:三层标注齐备、引用忠实度可复算的研究底座

[04]

定制与定向

  • 是否支持定制:是
  • 问题任务范围(单选):按单一任务类型 / 按全任务类型组合
  • 其他定制项(多选):语料文书构成 / 分块策略版本 / 相关性分级体系 / 可答与不可答比例 / 证据截点设置
  • 最低定制数量:400 道检索问答题
  • 语料定制:语料范围、文书类别构成与快照更新频率按项目商定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 语料文书与引用片段逐条核查,分块边界与引用位置在替换后重新对齐
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-06-037 证据问答与检索增强训练数据——训练侧对应的证据问答数据
  • SHP-MED-08-050 电子病历检索与患者摘要轨迹数据——把检索问答放进多步轨迹的智能体数据
  • SHP-MED-05-031 临床文书分类与章节切分数据——切分策略所依托的文书结构数据
[07]

常见问题

医疗检索增强生成评测集包含哪些内容?

医疗检索增强生成(RAG)评测集(SHP-MED-07-046)先把语料冻结成快照,在其上切块并配检索问题。相关性判定说明应该检到什么,与实际检索结果分列。参考答案拆成一条条断言,每条断言的引用回指到具体分块。

RAG 评测集适合评什么?

医疗检索增强生成(RAG)评测集(SHP-MED-07-046)把检索段与生成段分开算分,用于判断失败发生在未召回相关证据,还是已召回却未被正确使用。它作为独立评测集使用,与训练侧数据隔离。

样例能看到什么?怎么交付?

公开样例展示医疗检索增强生成(RAG)评测集(SHP-MED-07-046)的问题结构:语料快照、相关分块、断言与引用、评分细则;参考答案随项目交付。交付为问题清单加单一问题文件夹与元数据文件,另支持 API 调用与连接器合约使用。

起订量是多少?可以怎么定制?

医疗检索增强生成(RAG)评测集(SHP-MED-07-046)起订量为 400 道检索问答题,范围按单一任务类型或全任务类型组合确定。语料文书构成、分块策略版本、相关性分级体系、可答与不可答比例与证据截点可选配。

和哪些产品配合使用?

医疗检索增强生成(RAG)评测集(SHP-MED-07-046)的训练侧对应证据问答与检索增强训练数据(SHP-MED-06-037)。要把检索问答放进多步过程,可接电子病历检索与患者摘要轨迹数据(SHP-MED-08-050)。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。