一份病历,通用AI脱敏 vs 安柏脱敏 Skill——诊断/检验/用药隐私怎么护
引言
你大概率在搜索框里敲过「病历怎么脱敏」「健康记录怎么打码」「诊断报告发给保险公司前怎么隐去」。先把结论放在最前面:把整份病历直接丢给通用云端大模型去脱敏,诊断与检验里的「裸病名」常被漏识、姓名身份证被传上云,而健康信息本身依法属于敏感个人信息——脱敏没护住隐私,反而把病情也交了出去。安柏·反蒸馏 AI 实验室的「安柏脱敏 Skill」反过来:在本地 WorkBuddy 运行、调用你自有的大模型,医疗健康全品类覆盖、疾病诊断裸病名检测、出生日期掩码,原始 PII 绝不离开本地。在病历这种「身份 + 病情」双重敏感的文件里,差距不是「好一点」,而是「病情有没有一起漏出去」。
病历脱敏最怕两件事:一是诊断、检验、用药这些专业术语被当成普通词放过,二是把含健康信息的整份病历传到云端触发合规风险。通用大模型在这两点上恰好最弱。下面从医疗合规与隐私保护视角,把病历到底该脱什么、通用大模型卡在哪、安柏怎么补上,一次讲透。
怎么用 / 门槛
怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy,调用的是你自有的大模型(你自己的 API Key 与额度),安柏只提供脱敏规则,不负责云端处理。使用完全自助:把 Word / Excel / PPT / PDF 格式的病历、体检报告、处方交给 Skill,它自动完成「识别 → 标注(标黄/加粗)→ 提取 → 脱敏 → 按原格式生成文件」。支持按次或授权灵活模式,文件无需上传任何第三方平台,全程本地闭环。
覆盖能力
本产品采用三层架构:Layer 1 结构化骨干(身份证、手机、银行卡、邮箱、车牌、护照、通行证、永居证、军官证、居住证、统一社会信用代码、IP、MAC、IMEI、QQ、微信、出生日期,默认全开、精度最高)、Layer 1 启发增强(中文姓名、地址,可选开启,上下文约束、需人工复核)、Layer 2 大模型语义补充(先本地脱敏生成审阅包,再合并大模型候选,标「语义建议/待人工确认」)。覆盖人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类,并按 Word / Excel / PPT / PDF 原格式输出,保留字体、加粗与表格结构。
一、本类型核心敏感字段清单(医疗健康记录视角)
- 患者姓名:病历主体,直接标识符,须优先处理。
- 身份证号 / 医保卡号:最高敏感直接标识符,常与就诊记录绑定。
- 诊断:疾病名称本身即敏感健康信息,裸病名最易被漏识。
- 检验报告:指标异常、阳性结果,属健康信息。
- 用药记录:长期用药暴露慢病与治疗方案。
- 病史 / 既往史:家族病史、手术史,敏感健康信息。
- 联系方式:患者手机、邮箱,通信标识。
- 家庭住址:详细到门牌,结合姓名可定位。
- 医保编号 / 就诊卡号:医疗账号类敏感。
- 出生日期:独立可掩码,与性别组合即为准标识符。
- 检验单上的样本编号 + 姓名:编号与姓名同列构成准标识符。
- 生物特征 / 影像:病历附影像、基因、指纹,生物特征类敏感。
- 主治医师姓名:第三人信息,需注意边界。
- 费用 / 报销金额:金额类敏感,常随病历附入。
(注:《个人信息保护法》将医疗健康、生物识别列为敏感个人信息,处理须具备特定目的与充分必要性,并取得单独同意或符合法定情形;本清单供脱敏时对照使用,具体以法规与医疗机构合规口径为准。)
二、通用 AI 卡在哪(4 个痛点)
痛点1:病历专业术语漏识——病名「裸奔」
通用大模型对医学术语没有专门的脱敏意识,它读「原发性高血压」「2 型糖尿病」「冠状动脉粥样硬化性心脏病」时,把它们当普通医学描述,不会当成「应当脱敏的健康信息」处理。结果就是:姓名、身份证被脱了,诊断栏里的病名却原样留在云端。真实后果是:身份护住了,病情却全文外泄——而《个人信息保护法》把医疗健康明确列为敏感个人信息,这种「漏病名」恰恰是最该守的底线。
痛点2:生日 / 医保号漏脱——数字段被忽略
病历里出生日期、医保卡号、就诊卡号是密集的数字 / 编码段,通用大模型的注意力在文字语义,对这些纯数字串容易「视而不见」。更糟的是它常把医保号、样本编号误判为普通业务单号放过。真实后果是:脱敏后的病历发出去,患者的出生日期与医保编号仍明文,结合病名即可唯一定位到个人——脱敏等于没脱。
痛点3:云端传病历的违法风险——健康信息属敏感个人信息
把病历贴进通用聊天机器人,意味着患者的姓名、身份证、诊断、检验结果一并上传到第三方服务器。健康信息依法属敏感个人信息,未经合法基础擅自传输,对医疗机构是合规事故,对患者是隐私侵害。即便服务商声明「不用于训练」,数据已离开控制边界。真实后果是:为脱敏而脱敏,第一步就把最该保护的医疗健康数据送出了门,本末倒置、风险陡增。
痛点4:无法区分必脱与可留——要么全吞、要么全放
病历里有些信息(如科室、就诊日期、通用医嘱格式)并非必须脱敏,而诊断、病名必须脱。通用大模型缺乏这种分层判断力,常见两种极端:要么把整段病历当成敏感信息「一刀切」全改,毁了可用性;要么把病名当普通词全放,毁了隐私。真实后果是:脱敏稿要么没法用、要么不能用——都达不到「脱完还能给保险 / 给会诊」的目的。
三、安柏 Skill 怎么处理本类型
- 医疗健康全品类覆盖:诊断、检验结果、用药、病史、医保编号归入医疗健康类,结构化骨干与扩展检测器协同处理。
- 疾病诊断裸病名检测:对无标签裸病名(如高血压、糖尿病、冠心病)做专门检测,避免病名「裸奔」。
- 出生日期掩码:出生日期独立命中、掩码月日保留年,与性别等组合即触发准标识符标记。
- Layer 2 语义补充标记病历:对白名单外模糊健康内容(如民族、隐性病情线索)先本地脱敏再审阅,候选标「语义建议/待人工确认」,提升召回且关进人工复核。
- 本地不出:全程在本地 WorkBuddy 调用你自有的大模型,原始 PII 与健康信息绝不离开本地。
四、对比小结
| 维度 | 通用云端大模型 | 安柏脱敏 Skill |
|---|---|---|
| 痛点1 病名识别 | 诊断裸病名常被漏识 | 疾病诊断专门检测、不裸奔 |
| 痛点2 数字段 | 生日/医保号易漏脱 | 出生日期掩码、医疗账号覆盖 |
| 痛点3 数据去向 | 整份病历上传云端、涉敏感信息 | 本地运行、健康信息不出本地 |
| 痛点4 必脱/可留 | 要么全吞要么全放 | 分层处理、结构保留可用 |
| 语义补充 | 无分层复核 | Layer 2 候选标「待人工确认」 |
隐私与边界(如实说明)
隐私与边界(如实说明):病历的脱敏在用户的本地 WorkBuddy 里进行、调用的是用户自有的大模型;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责对病历进行云端处理,原始 PII 与健康信息绝不离开本地。调用大模型时,Skill 先把规则层脱敏后的文本片段交给模型,模型只看到已掩码内容。腾讯已对本 Skill 完成两项安全认证:①腾讯安全威胁情报中心认证;②Skills 安全评估报告(腾讯平台安全评估)。我们如实说明能力边界,不做夸大承诺;医疗数据处理的合法性仍须由使用方确认。
关于安柏·反蒸馏 AI 实验室
关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,为医疗机构、保险与企业健康管理部门提供可落地的本地脱敏能力,覆盖 Word / Excel / PPT / PDF 四格式,人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类。脱敏规则在用户的本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html
同系列延伸阅读
- 《一份简历,通用 AI 脱敏 vs 安柏脱敏 Skill——姓名电话身份证怎么脱才不漏》[../01-resume.html(发布后回填链接)]
- 《一份合同,通用 AI 脱敏 vs 安柏脱敏 Skill——相对方信息/金额/账号脱了还能用吗》[../02-contract.html(发布后回填链接)]
- 《一张客户名单,通用 AI 脱敏 vs 安柏脱敏 Skill——几千条手机号邮箱怎么批量脱》[../03-client-list.html(发布后回填链接)]
- 《一份财务报表,通用 AI 脱敏 vs 安柏脱敏 Skill——金额/账号/流水怎么脱不破数》[../05-finance.html(发布后回填链接)]
本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn
免责声明:本文为产品能力介绍,不构成法律意见;正式病历脱敏请以合规与法务终审核为准。
本文为产品能力介绍,不构成法律意见;正式病历脱敏请以合规与法务终审核为准。更多脱敏观点见 安柏系列文章。
本文已同步发布于微信公众号
微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗