数巨有谱数据集团
[01 · SHP-MED-06-036]

临床指令微调训练数据

分任务类型组织的单轮指令微调样本。每条样本给出指令、模型可见的上下文块,以及按声明结构写成的目标回答。回答附作答边界声明,并绑定一段可按字符区间回算的证据跨度。分组策略与复核记录随样本交付。可用于临床任务指令微调、医院助手的边界对齐与训练流水线校验。

医疗模型训练 · 评估与研究使用许可 · 更新日期 2026-08-05

10
实体
152
字段
4
实体关系
06
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体10指令样本 · 任务规范 · 上下文块 · 目标回答 · 证据跨度 · 复核记录 · 数据划分 · 来源文书 · 数据质量项 · 来源沿袭
字段152交付范围内的字段总数
实体关系4每条指令样本连接一个任务规范、一个上下文块、一个目标回答、至少一个证据跨度与一条复核记录 · 证据跨度以 Unicode 半开区间定位上下文块,按区间截取的文字必须与证据正文一致 · 数据划分按患者、就诊与近重复来源成组,同组样本不跨划分 · 自产样本与来源记录分开存放,来源文书索引单列一层

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

10 个实体8 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

指令样本

指令/可答性/截点

02关联实体

任务规范

输出结构/不可答处置

03关联实体

上下文块

模型可见的全部输入

04关联实体

目标回答

结构化输出/边界声明

05关联实体

证据跨度

字符区间/证据正文

06关联实体

复核记录

证据与边界分项核

07关联实体

数据划分

同患者不跨划分

08关联实体

来源文书

取材来源

09辅助实体

数据质量项

性质与口径

10辅助实体

来源沿袭

加工规则登记

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

任务规范

输出结构/不可答处置

1—n
实体 B

指令样本

指令/可答性/截点

实体 A02

指令样本

指令/可答性/截点

1—1
实体 B

上下文块

模型可见的全部输入

实体 A03

指令样本

指令/可答性/截点

1—1
实体 B

目标回答

结构化输出/边界声明

实体 A04

上下文块

模型可见的全部输入

1—n
实体 B

证据跨度

字符区间/证据正文

实体 A05

指令样本

指令/可答性/截点

1—1
实体 B

复核记录

证据与边界分项核

实体 A06

数据划分

同患者不跨划分

1—n
实体 B

指令样本

指令/可答性/截点

实体 A07

来源文书

取材来源

1—n 来源文书是上下文的取材来源,索引本身不生成指令目标
实体 B

上下文块

模型可见的全部输入

实体 A08

指令样本

指令/可答性/截点

1—1 该样本的加工沿袭登记
实体 B

来源沿袭

加工规则登记

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
任务规范1—n指令样本一版任务规范之下的多条指令样本
指令样本1—1上下文块每条样本一个模型可见的上下文块
指令样本1—1目标回答每条样本一份按结构写成的参考答案
上下文块1—n证据跨度答案所依据的上下文字符区间
指令样本1—1复核记录每条样本一条分项复核记录
数据划分1—n指令样本样本按患者、就诊与近重复来源成组归入划分
来源文书1—n上下文块来源文书是上下文的取材来源,索引本身不生成指令目标
指令样本1—1来源沿袭该样本的加工沿袭登记

一条指令样本把任务规范、可见上下文、参考答案、证据跨度与复核记录串成一套。证据跨度落在上下文块的字符坐标系上,按区间截取所得与证据正文一致,答案可逐条回算。数据划分按患者、就诊与近重复来源成组,同组样本不跨划分。来源文书是上下文的取材来源。

[03]

使用场景

医疗任务模型的指令对齐与输出格式收敛

医疗科技企业 · 医疗垂类大模型微调团队

  • 输出结构先定后训:每类任务的期望输出结构以键值形式写在任务规范里。模型学到的是下游程序能直接解析的结构
  • 拒答与作答一起训:不可答处置逐任务写明。目标字段未记载时返回未记录,无确定规则时保留原文并标待复核
  • 边界随答案入训:每份参考答案附作答边界声明,声明与答案在同一层交付。微调时边界是被对齐的内容
  • 证据可脚本核:答案绑定上下文中的字符区间。训练前可逐条核对证据是否真在上下文里,不合格样本进不了训练集
  • 四类任务可调配比:文书分类与章节、结构化抽取、时间事件、术语与去标识转换各成一类。可按目标能力调整配比

获得:输出结构可解析、拒答有据、证据可回算的指令对齐语料

院内场景助手的能力边界设定

医院信息中心 · 院内智能助手建设

  • 先定能干什么:四类任务规范可直接作为院内助手的能力清单,说明哪些请求接、哪些请求转人工
  • 边界由数据承载:作答边界声明写明仅依据可见上下文作答,不补充诊疗建议与未记载事实。助手的边界随训练数据一同交付
  • 输入截点可执行:证据截点让助手在回答时点只用当时拿得到的信息。截点后的信息不进入上下文与目标
  • 结果可直接回写:目标输出按声明结构给出,助手结果可写回院内系统字段,不必再加一层文本解析
  • 复核项目可查:每条样本的证据与边界两项分别记录核对结果,院内评审时可查到具体复核了哪两项

获得:能力清单明确、结果可直接对接院内系统的助手训练底料

训练数据流水线的质量卡点设置

医疗信息化企业 · 数据流水线与模型工程团队

  • 三项可机器校验:输出结构、证据区间、区间文本与证据正文是否一致,三项都能程序化校验。流水线可在入库前自动拦下不合格样本
  • 防泄漏写成字段:分组策略与泄漏防护策略都是数据里的字段。流水线可直接按字段执行划分
  • 近重复不被切开:患者、就诊与来源三层分组键随样本交付,近重复文书不会被分到训练与验证两侧
  • 答案版本可回退:参考答案带目标版本,修订后新旧并存,模型效果变化可归因到具体哪一版答案

获得:卡点可程序化、划分口径写在数据里的训练流水线输入

临床文本任务的标准作答范本

医学教育与专业内容团队 · 规范化作答范本

  • 结论必须带依据:分类答案同时给出标签与依据,可作为「结论要写出处」的教学范本
  • 不同任务不同答法:抽取任务给字段与取值,时间任务保留原始时间表达。术语任务给出规则与来源,四类各有范式
  • 材料不足怎么说:不可答处置给出四种规范说法,可直接作为材料不足时的标准回复表述
  • 当场可核对:范本带证据区间,教学时能当场核对结论是不是真从材料里读出来的

获得:结论带依据、材料不足时有规范说法的作答范本

[04]

定制与定向

  • 是否支持定制:是
  • 任务组织方式(单选):按单一任务类型 / 按多任务类型组合
  • 其他定制项(多选):任务类型范围 / 上下文长度 / 不可答样本比例 / 专科范围 / 输出结构规格
  • 最低定制数量:3,000 条指令样本
  • 任务规范定制:期望输出结构与不可答处置可按客户下游系统的字段与流程改写,改写后另出一版任务规范随数据交付
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 上下文与目标回答按去标识策略处理,策略版本随样本交付
  8. 样本内嵌的时间统一平移,保序保间隔;证据截点随之平移,截点与上下文之间的先后关系不变
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-05-035 临床文本去标识化数据——上下文所用文本的处理口径来源
  • SHP-MED-06-037 证据问答与检索增强训练数据——需要先检索再取证的任务形态
  • SHP-MED-07-042 通用临床能力评测集——微调结果的能力评测对照
[07]

常见问题

临床指令微调训练数据包含哪些内容?

临床指令微调训练数据(SHP-MED-06-036)交付分任务类型组织的单轮指令微调样本,覆盖文书分类与章节、结构化抽取、时间事件、术语与去标识转换四类任务。每条样本含指令、上下文块、按声明结构写成的目标回答、作答边界声明与可按字符区间回算的证据跨度。

临床指令微调训练数据适合训练什么模型?

适合医疗任务模型的指令对齐与输出格式收敛训练,拒答与作答一起训练,目标字段未记载时返回未记录;也适合院内智能助手的能力边界设定、训练数据流水线的质量卡点校验,以及临床文本任务的规范化作答范本组织。

临床指令微调训练数据的样例与交付形态?

产品页提供明确标识的自产样例:二十条单轮指令样本及目标回答,按四类任务规范组织,每条带证据跨度、作答边界声明与逐条复核记录,生成层级随样本标注。支持数据集交付、API 调用、Token 计量与可信数据空间连接器。

临床指令微调训练数据怎么定制?起订量多少?

任务组织方式可选单一任务类型或多任务组合,再按任务类型范围、上下文长度、不可答样本比例、专科范围与输出结构规格定制,起订量为 3,000 条指令样本,数据量按项目商定。可先申请开源子集或测试数据验证样本结构与校验脚本。

临床指令微调训练数据可以和哪些产品组合?

常与临床文本去标识化数据(SHP-MED-05-035)对齐上下文文本的处理口径,与证据问答与检索增强训练数据(SHP-MED-06-037)衔接先检索再取证的任务形态,与通用临床能力评测集(SHP-MED-07-042)对照微调结果的能力评测。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。