通用大模型漏掉的变体与隐晦敏感信息——安柏脱敏 Skill 怎么兜底
引言
结论先行:真正危险的敏感信息,往往不是工工整整写着「身份证号:XXXXXXXX」那种。它可能是 138****1234 的半脱敏手机号、缺了前 6 位的身份证、用同音字写的姓名,或是散落在叙述里的「85 年生的女总监、住在浦东」。免费通用大模型只会脱「标准格式」,对变体和隐晦 / 间接敏感信息几乎必然漏脱——而这两类恰恰是重识别和商业秘密泄露的高发区。本文专讲安柏脱敏 Skill 怎么兜底。
怎么用 / 门槛
怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy 内,调用你自有的大模型完成脱敏。原始敏感信息不出本地,安柏只提供脱敏规则,不负责云端处理。开箱即用、自助运行;获取与部署指引请联系微信 ac_workshop2000。
覆盖能力
本篇聚焦变体识别与隐晦 / 间接敏感信息兜底。安柏脱敏 Skill 在结构化骨干层用多模式覆盖常见格式变形;对藏在叙述里的间接标识符与准标识符组合,由语义层(大模型两步审阅)标记交人工确认。能力品类与三层架构详见系列其他文章。
一、核心概念清单
- 变体:同一敏感信息的多种非标准写法——半脱敏残留(星号 / 空格)、分段、缺位、同音字 / 昵称 / 职位代称、口语化金额等。
- 隐晦 / 间接敏感信息:不出现「姓名」「身份证」字样,却通过上下文或编码唯一定位个人 / 机构的字段,如医保号、样本编号、项目代号、内部单据号。
- 准标识符组合:出生年份 + 性别 + 职务 + 学历等单独看不敏感,组合后可唯一重识别个人。
- 跨格式一致性:同一人信息在多份 / 多格式文档多处出现,需统一脱敏不遗漏。
- 半脱敏残留:曾经手动打码但留了可还原线索(如
138****1234仍能缩小到 1 万人区间),仍是敏感信息。
二、通用 AI 卡在哪(4 个痛点)
痛点1:只认标准格式——变体全漏
免费通用大模型把「手机号」理解成整洁的 11 位数字串。它识别不了 1xx-xxxx-xxxx、138****1234、「一三八…」,也识别不了缺前 6 位的身份证、用同音字写的姓名、只写小区名 + 楼栋的地址。真实后果是:你以为脱干净了,可那些「不标准」的写法原封不动发出去,照样能定位到人。
痛点2:只看字面「敏感词」——隐晦指代看不见
云端聊天机器人逐字找「身份证」「手机号」这类关键词。它看不到「医保号 / 样本编号与姓名同列」构成的标识,看不出「某基金 / 甲方 / 项目代号」背后就是真实客户,也读不出「其配偶任职于…」「详见补充协议」里的关系链。真实后果是:文档表面干净,实则把人 / 机构 / 关系完整泄露。
痛点3:不懂组合——准标识符当普通字段
通用大模型单字段判断「这条不敏感」,不会把「出生年份 + 性别 + 职务」当成一个重识别签名来扫。真实后果是:每个字段都「看起来安全」,组合后却在小样本里唯一锁定一个人,重识别敞口被整体低估。
痛点4:不跨格式——同一人多处遗漏
同一人的姓名 + 手机号 + 邮箱,可能出现在 Word 正文、PPT 备注、Excel 表、PDF 脚注里。通用大模型一次处理一份、彼此不关联,常只脱正文、漏掉备注和脚注。真实后果是:对外文件里「同一个人」部分明文、部分脱敏,等于没脱。
三、安柏怎么兜底
- 多模式覆盖变体:结构化骨干对常见格式变形(星号 / 空格 / 分段 / 缺位 / 同音昵称 / 职位代称)内置多模式,不只盯单一正则。
- 语义层兜底隐晦:对不出现敏感词、却可能唯一定位的间接标识符与编码段,由大模型两步审阅标记,交人工判断。
- 准标识符组合扫描:启用姓名识别后,自动扫描出生年份 + 性别 + 职务 / 学历等组合,仅标记不自动脱敏。
- 跨格式统一:同一实体的不同写法与跨文档出现,统一识别、统一脱敏,不漏处。
- 透明可溯:报告逐条标注命中位置、类型与来源(规则层 / 语义建议),不黑箱。
四、对比小结
| 维度 | 免费通用云端大模型 | 安柏·脱敏 Skill |
|---|---|---|
| 变体识别 | 只认标准格式,星号 / 缺位 / 同音全漏 | 多模式覆盖常见变形 |
| 隐晦 / 间接敏感信息 | 看不见(无敏感词就放过) | 语义层标记交人工 |
| 准标识符组合 | 单字段判断,漏组合 | 组合扫描,仅标记不脱敏 |
| 跨格式一致性 | 逐份处理,彼此不关联 | 同一实体统一识别脱敏 |
| 处理方式 | 全留或全删 | 标记交人工,绝不自动误伤 |
隐私与边界(如实说明)
隐私与边界(如实说明):脱敏在用户的本地 WorkBuddy 内、调用用户自有的大模型完成;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责云端处理。腾讯已对本 Skill 完成两项安全认证:①腾讯安全威胁情报中心认证;②Skills 安全评估报告(腾讯平台安全评估)。本工具为去标识化(非匿名化),变体与隐晦识别能力取决于规则覆盖与人工复核,上线前须经法律专业人士审核。处理真实数据前,须具备《个人信息保护法》要求的同意与影响评估。
关于安柏·反蒸馏 AI 实验室
关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,在用户本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html
同系列延伸阅读
- 《脱了姓名还能认出是谁吗?准标识符与重识别风险》(../15-quasi-identifier.html)(发布后回填链接)
- 《为什么不能直接把敏感文件丢给免费通用大模型脱敏》(../14-vs-cloud.html)(发布后回填链接)
本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn
免责声明:本文为产品能力介绍,不构成法律意见;正式脱敏方案请以法务与合规终审核为准。
本文为产品能力介绍,不构成法律意见;正式脱敏方案请以法务与合规终审核为准。更多脱敏观点见 安柏系列文章。
本文已同步发布于微信公众号
微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗