一份法律文书,通用 AI 脱敏 vs 安柏脱敏 Skill——案件当事人信息怎么脱不泄密
引言
你大概率在搜索框里敲过「法律文书怎么脱敏」「卷宗去标识」「判决书写了当事人名字怎么办」。先把结论放在最前面:把一份含当事人姓名、案号、证人的法律文书直接丢给通用云端大模型,最危险的翻车不是「漏脱个手机号」,而是「案号 + 人名共现的准标识符被漏脱」——这等于把「某人涉诉」这一高度敏感事实,连同姓名一起暴露出去。安柏·反蒸馏 AI 实验室的「安柏脱敏 Skill」给你的,是一份在本地、调用你自己的大模型完成的、案号与人名同段才脱、机构名诉讼角色排除、姓名零泄漏的脱敏文书,原始 PII 从不出本地。在司法文书这种「保密是硬要求、泄密即违规」的场景里,差距不是「严谨一点」,而是「会不会把当事人身份信息二次泄露」。
法律文书脱敏最怕两件事:一是准标识符(案号+人名)被漏脱,二是卷宗里大量人名被机构名混淆导致误伤或漏脱。通用大模型在这两个点上恰好最弱。下面用诉讼 / 合规的视角,把文书到底该脱什么、通用大模型卡在哪、安柏怎么补上,一次讲透。
怎么用 / 门槛
怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy 中,调用的是你自有的大模型——安柏只提供脱敏规则,不负责云端处理。原始 PII 从不出本地。计费上按次或按授权灵活(具体以官网/微信为准),完全自助、无客服介入、无需上传任何文件到第三方。对律所与法务而言,你可以在不触网的内网环境完成整批卷宗脱敏。
覆盖能力
本产品对 Word / Excel / PPT / PDF 四类文档,完成「识别→标注(标黄/加粗)→提取→脱敏→按原格式生成文件」。针对法律文书,核心能力是「业务号准标识符共现脱敏」:案件号本身孤立出现一般不强制脱敏,但与其同段共现的自然人姓名即构成可重识别准标识符(尤其暴露涉诉事实),整体掩码。能力分三层(结构化骨干默认全开、精度最高;中文姓名/地址可选开启、上下文约束、需人工复核;Layer 2 大模型语义补充先本地脱敏再合并候选、标「语义建议/待人工确认」),覆盖人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类。
一、本类型核心敏感字段清单(法律文书视角)
- 当事人姓名:原告 / 被告 / 申请人等直接标识符,必须脱敏。
- 身份证号:18 位直接标识符,结构化骨干默认全开、精度最高。
- 案号:与姓名同段时构成准标识符,暴露涉诉事实。
- 住址:当事人送达地址,需可选开启地址识别。
- 律师 / 代理人:姓名与联系方式。
- 证人:姓名与身份信息。
- 手机号:当事人 / 代理人联络直接标识。
- 银行账号:涉执行、返款时高频出现。
- 判决金额:金额类敏感,属文书关键但需评估披露范围。
- 出生日期:结构化骨干覆盖,掩码月日保留年。
- 统一社会信用代码:当事人为企业时关联法人 / 实控人。
- 证人 / 家属关系:准标识符,需评估是否暴露。
- 健康 / 民族:出现在家事、人身损害类文书中。
(注:司法文书的公开与脱敏另有专门规范,处理前请结合具体案由与公开要求,并以法务 / 法院指导意见为准。)
二、通用 AI 卡在哪(4 个痛点)
痛点1:案号+人名共现的准标识符漏——把「某人涉诉」事实直接暴露
法律文书里「(2023)沪 0115 民初 12345 号 原告 王某某」这种写法,单看案号不是个人信息,单看人名也常见,但二者同段共现就指向「王某某涉及这起诉讼」这一高度敏感事实。通用大模型缺乏这种「组合即敏感」的判断,常把案号当普通编号放过、把人名当普通词放过,二者各自「看似安全」实则组合泄密。真实后果是:一份本想脱敏后公开的文书,反而精确暴露了当事人的涉诉身份,违反司法保密要求且可能对当事人造成实质损害。
痛点2:诉讼角色词混淆——把「原告王某某」整串吞掉或整串放过
文书里「原告某某公司诉某科技公司」这类结构,机构名与人名紧邻。通用大模型缺乏诉讼角色语义,常见两种翻车:要么把「原告王某某(…)诉某科技公司」整串当机构名吞掉(人名被并入机构、类型错且违背「人名必须脱敏」),要么反过来把机构名当人名漏脱。真实后果是:脱敏结果既不可信(人名残留)也不可用(机构名被误伤),拿去公开仍会泄露当事人。
痛点3:卷宗大量人名——逐次对话根本覆盖不全
一份卷宗常出现当事人、代理人、证人、法官、鉴定人等几十条人名,散落在正文、附表、送达回证多处。通用大模型逐次对话、结果随机,很难保证「每一处人名都脱了」,更无法给出「脱了哪几十条、漏了哪几条」的报告。真实后果是:卷宗脱敏出现大量遗漏,且毫无审计痕迹,出事时无法自证已尽合理注意义务。
痛点4:司法文书保密要求——云端传文书直接违规
把未脱敏的卷宗、判决上传到通用云端大模型,原始文书即离开你的控制域。对律所与法务而言,这常直接触碰内部保密与数据合规红线——无论模型是否用于训练,文件已在第三方留存。真实后果是:脱敏尚未开始,保密义务已经违反,且过程不可撤销、不可审计。
三、安柏 Skill 怎么处理本类型
- 业务号准标识符共现脱敏:案件号孤立出现不误吞;与自然人姓名同段共现时整体掩码,避免暴露涉诉事实,也守住「不误吞纯 B2B 业务号」的边界。
- 机构名诉讼角色排除:识别「原告 / 被告 / 申请人」等诉讼角色词,机构名不与人名混淆,姓名交由姓名检测器零泄漏处理。
- 姓名零泄漏:中文姓名可选开启、上下文约束识别,覆盖标签后、括号引号内、并列等多形态,确保全名明文残留趋近于零。
- 结构化骨干全覆盖:身份证 / 手机 / 银行账号 / 统一社会信用代码等默认全开、精度最高、零幻觉、可复现。
- 本地运行、原始 PII 不出本地:全程在你本地 WorkBuddy 调用你自己的大模型完成,安柏只提供规则。
四、对比小结
| 维度 | 通用云端大模型 | 安柏脱敏 Skill |
|---|---|---|
| 案号+人名 | 各自放过、组合泄密 | 同段共现才脱,避免暴露涉诉事实 |
| 诉讼角色 | 人/机构混淆、易误伤或漏脱 | 机构名诉讼角色排除、姓名零泄漏 |
| 卷宗大量人名 | 覆盖不全、无报告 | 结构化骨干可复现、报告定位到具体位置 |
| 原始文书 | 上传云端、违规风险 | 本地运行、调用你自己的大模型、不出本地 |
| 审计留痕 | 无 | 报告标注命中位置与来源、可复核 |
隐私与边界(如实说明)
隐私与边界(如实说明):脱敏在你的本地 WorkBuddy 里进行、调用的是你自有的大模型;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责对文件进行云端处理。腾讯已对本 Skill 完成两项安全认证:① 腾讯安全威胁情报中心认证;② Skills 安全评估报告(腾讯平台安全评估)。我们如实说明:本地运行的含义是原始 PII 不进入安柏或任何第三方云端,不做「原稿绝对不出本机」的夸大表述。需注意,本工具为去标识化(非匿名化),重识别风险取决于数据集合与发布场景,上线前须经法律专业人士审核。
关于安柏·反蒸馏 AI 实验室
关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,为律所、投资机构与企业法务提供可落地的本地脱敏能力,覆盖 Word / Excel / PPT / PDF,按原格式输出、保留字体与版式结构,并支持业务号准标识符共现脱敏与诉讼角色排除。脱敏规则在用户本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html
同系列延伸阅读
- 《一份 PDF,通用 AI 脱敏 vs 安柏脱敏 Skill——可搜索与扫描件怎么脱》[../09-pdf.html(发布后回填链接)]
- 《一份员工档案,通用 AI 脱敏 vs 安柏脱敏 Skill——社保/薪酬/亲属信息怎么护》[../06-employee.html(发布后回填链接)]
- 《安柏脱敏 Skill 完整说明与全系列导航》[../12-how-to-choose.html(发布后回填链接)]
本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn
免责声明:本文为产品能力介绍,不构成法律意见;司法文书的公开与脱敏请结合具体案由、法院指导与《个人信息保护法》合规要求,并以法务终审核为准。
本文为产品能力介绍,不构成法律意见;司法文书处理请以法务终审核与相关规定为准。更多脱敏观点见 安柏系列文章。
本文已同步发布于微信公众号
微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗