数巨有谱数据集团
[01 · SHP-MED-06-038]

临床信息抽取训练数据

临床信息抽取的训练样本,按三套任务结构组织。每套结构写明输入契约与输出契约。样本挂在去标识输入文本版本之下,产出的目标记录各带否定状态、确定性、体验者与时相四项属性。跨度、关系边与术语映射按 Unicode 半开坐标对齐。可用于抽取模型训练、专病库入库口径设计与抽取引擎分项评测。

医疗模型训练 · 评估与研究使用许可 · 更新日期 2026-08-05

11
实体
160
字段
5
实体关系
06
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体11任务结构 · 输入文本版本 · 抽取训练样本 · 目标记录 · 跨度对齐 · 关系边 · 术语映射 · 复核记录 · 数据划分 · 数据质量项 · 来源沿袭
字段160交付范围内的字段总数
实体关系5抽取训练样本挂在一版输入文本之下,同一份文本可承载多种任务的样本 · 目标记录挂在样本之下,跨度对齐再挂在目标记录之下 · 关系边连接同一样本中两个不同的目标记录,不与自身相连 · 术语映射挂在目标记录上,并写明编码体系与映射版本 · 数据划分按文书成组,同一份文书的样本不跨划分

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

11 个实体9 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

抽取训练样本

任务类型/证据截点

02关联实体

任务结构

输入契约/输出契约

03关联实体

输入文本版本

去标识正文/文本版本

04关联实体

目标记录

否定/确定性/体验者/时相

05关联实体

跨度对齐

坐标系/证据角色

06关联实体

关系边

两端各有证据

07关联实体

术语映射

编码体系/映射版本

08关联实体

复核记录

输出/回放/边界

09关联实体

数据划分

按文书组隔离

10辅助实体

数据质量项

性质与口径

11辅助实体

来源沿袭

加工规则登记

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

任务结构

输入契约/输出契约

1—n
实体 B

抽取训练样本

任务类型/证据截点

实体 A02

输入文本版本

去标识正文/文本版本

1—n
实体 B

抽取训练样本

任务类型/证据截点

实体 A03

抽取训练样本

任务类型/证据截点

1—n
实体 B

目标记录

否定/确定性/体验者/时相

实体 A04

目标记录

否定/确定性/体验者/时相

1—n
实体 B

跨度对齐

坐标系/证据角色

实体 A05

目标记录

否定/确定性/体验者/时相

1—n
实体 B

关系边

两端各有证据

实体 A06

目标记录

否定/确定性/体验者/时相

1—1
实体 B

术语映射

编码体系/映射版本

实体 A07

抽取训练样本

任务类型/证据截点

1—n
实体 B

复核记录

输出/回放/边界

实体 A08

数据划分

按文书组隔离

1—n
实体 B

抽取训练样本

任务类型/证据截点

实体 A09

抽取训练样本

任务类型/证据截点

1—1 该样本的加工沿袭登记
实体 B

来源沿袭

加工规则登记

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
任务结构1—n抽取训练样本一套任务结构之下的多条训练样本
输入文本版本1—n抽取训练样本同一份输入文本承载多种任务的样本
抽取训练样本1—n目标记录样本之下的目标记录
目标记录1—n跨度对齐目标记录对齐到输入文本的字符区间
目标记录1—n关系边目标作为关系边的一端接入,两端必须是不同的目标
目标记录1—1术语映射目标记录上的术语映射及其编码体系与版本
抽取训练样本1—n复核记录该样本的复核记录
数据划分1—n抽取训练样本样本按文书成组归入数据划分
抽取训练样本1—1来源沿袭该样本的加工沿袭登记

一套任务结构定下输入与输出契约。样本挂在具体的输入文本版本之下。同一份文本可同时承载章节、实体关系、时间与术语三类任务的样本。目标记录挂在样本之下,跨度对齐再挂在目标之下,坐标只在其所属文本版本内有效。关系边连接同一样本中两个不同的目标,两端各有证据跨度。数据划分按文书成组,同一份文书的样本不被拆到划分两侧。

[03]

使用场景

抽取模型的属性监督与结构化输出对齐

医疗科技企业 · 临床信息抽取模型团队

  • 四项属性一并监督:每条目标同时带否定状态、确定性、体验者与时相。监督信号同时包含抽取到的内容及该事实所处的状态(否定、确定性、体验者、时相)
  • 疑似与确诊分列:本批四十九条已确定、一条疑似,确定性单列。「考虑肺炎」按疑似入训
  • 计划不当已执行:时相区分当前与计划中,「计划复查」这类表述被标为计划,不混进已执行事实
  • 输出契约可逐项校验:每类任务的输出契约写明必须给出哪几项。模型输出按契约校验即可,不必人工通读
  • 一文多任务:同一份输入文本同时承载三类任务的样本。可训练一个模型多头输出,也可按任务拆开分别训练

获得:属性齐、输出契约可校验的抽取训练信号

病历要素入库的字段口径与证据留痕

三甲医院 · 病历结构化与专病库建设

  • 入库带四项状态:否定、确定性、体验者、时相随要素一并入库。专病库里「记载为无」与「未采集」各占一格
  • 每格能回原句:目标记录对齐到输入文本的字符区间,库里任一格都能点回它出自哪一句
  • 关系入库有依据:症状与候选诊断、诊断与出院带药这类关系带两端证据跨度。专病库的每条关系均可回溯到原文
  • 编码随要素走:术语映射挂在目标上,并写明编码体系与版本。编码体系换版时能定位到受影响的具体条目
  • 口径可直接成文:三套任务结构的输入与输出契约可直接作为院内结构化的字段口径文档

获得:状态齐备、逐格可回原句的结构化入库口径

抽取引擎的坐标一致性检查与回归用例

医疗信息化企业 · 抽取引擎与标注平台

  • 坐标可脚本回放:跨度带坐标系声明与跨度正文。按区间截取的文字是否与跨度正文一致可脚本核对,坐标错位当场暴露
  • 准确率按角色拆:章节边界、时间规范化、术语映射、关系端点各有其证据角色。引擎可按角色分别统计准确率
  • 非自反是硬约束:关系边约束为连接同一样本中两个不同的目标,可用作图构建逻辑的边界用例
  • 隔离按字段执行:划分策略是数据里的字段,平台可直接按字段做文书级隔离,不必另写一套规则

获得:坐标可回放、准确率可按角色拆分的引擎测试底料

研究变量从文本中提取的口径与可核性

医学研究与真实世界证据团队 · 变量提取

  • 变量状态先分清:同一个词在否定、疑似、计划三种状态下含义不同,四项属性让变量定义能写得精确
  • 体验者不可省:体验者字段区分患者本人与他人所述,家族史类表述不会被计入患者本人的事实
  • 时间与术语成对给:时间与术语任务同结构组织。时间表达、规范化时间与术语映射状态一并给出,变量的时点与编码同时可得
  • 取值逐条可核:每个变量值带证据区间与复核记录,复核时按区间核对即可,不必重读全文

获得:变量定义精确、取值逐条可核的文本变量提取口径

[04]

定制与定向

  • 是否支持定制:是
  • 任务结构范围(单选):按单一任务结构 / 按多任务结构组合
  • 其他定制项(多选):目标类型范围 / 关系类型范围 / 术语编码体系 / 文书类型范围 / 属性标注深度
  • 最低定制数量:3,000 条抽取样本
  • 任务结构定制:输入契约、输出契约与复核口径可按客户抽取引擎改写,改写后另出一版任务结构随数据交付
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 输入文本按去标识策略处理,跨度坐标随处理后的文本重算
  8. 文本内嵌的日期统一平移,保序保间隔;证据截点与时间类目标的规范化取值同步平移
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-05-032 临床实体与关系标注数据——抽取目标所依据的标注层
  • SHP-MED-05-034 诊断、操作与药品术语标准化数据——术语映射所接的标准编码体系
  • SHP-MED-07-044 临床信息抽取与编码评测集——同一能力做成成题评测的对照
[07]

常见问题

临床信息抽取训练数据包含哪些内容?

临床信息抽取训练数据(SHP-MED-06-038)按文书章节、实体关系、时间与术语三套任务结构组织抽取训练样本,各写明输入契约与输出契约。每条目标记录带否定状态、确定性、体验者与时相四项属性,跨度、关系边与术语映射按 Unicode 半开坐标对齐。

临床信息抽取训练数据适合什么任务?

适合临床信息抽取模型的属性监督训练,疑似与确诊分列、计划与已执行分列;也适合专病库入库的字段口径设计与证据留痕、抽取引擎按证据角色分项评测,以及真实世界研究中文本变量提取口径的制定。

临床信息抽取训练数据的样例与交付形态?

产品页提供明确标识的自产样例:三十条抽取样本按三套任务结构各十条组织,产出五十条带四项属性的目标记录、五十条坐标对齐跨度、十条关系边与十条术语映射。支持数据集交付、API 调用、Token 计量与可信数据空间连接器。

临床信息抽取训练数据怎么定制?起订量多少?

任务结构可选单一或多任务组合,再按目标类型、关系类型、术语编码体系、文书类型与属性标注深度定制,起订量为 3,000 条抽取样本,数据量按项目商定。可先申请开源子集或测试数据核对输出契约与坐标口径。

临床信息抽取训练数据可以和哪些产品组合?

常与临床实体与关系标注数据(SHP-MED-05-032)衔接抽取目标所依据的标注层,与诊断、操作与药品术语标准化数据(SHP-MED-05-034)对接术语映射的标准编码体系,与临床信息抽取与编码评测集(SHP-MED-07-044)对照同一能力的成题评测。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。