系列文章 · 变体与隐晦敏感信息

通用大模型漏掉的变体与隐晦敏感信息——安柏脱敏 Skill 怎么兜底

引言

结论先行:真正危险的敏感信息,往往不是工工整整写着「身份证号:XXXXXXXX」那种。它可能是 138****1234 的半脱敏手机号、缺了前 6 位的身份证、用同音字写的姓名,或是散落在叙述里的「85 年生的女总监、住在浦东」。免费通用大模型只会脱「标准格式」,对变体隐晦 / 间接敏感信息几乎必然漏脱——而这两类恰恰是重识别和商业秘密泄露的高发区。本文专讲安柏脱敏 Skill 怎么兜底。

怎么用 / 门槛

怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy 内,调用你自有的大模型完成脱敏。原始敏感信息不出本地,安柏只提供脱敏规则,不负责云端处理。开箱即用、自助运行;获取与部署指引请联系微信 ac_workshop2000。

覆盖能力

本篇聚焦变体识别隐晦 / 间接敏感信息兜底。安柏脱敏 Skill 在结构化骨干层用多模式覆盖常见格式变形;对藏在叙述里的间接标识符与准标识符组合,由语义层(大模型两步审阅)标记交人工确认。能力品类与三层架构详见系列其他文章。

一、核心概念清单

  1. 变体:同一敏感信息的多种非标准写法——半脱敏残留(星号 / 空格)、分段、缺位、同音字 / 昵称 / 职位代称、口语化金额等。
  2. 隐晦 / 间接敏感信息:不出现「姓名」「身份证」字样,却通过上下文或编码唯一定位个人 / 机构的字段,如医保号、样本编号、项目代号、内部单据号。
  3. 准标识符组合:出生年份 + 性别 + 职务 + 学历等单独看不敏感,组合后可唯一重识别个人。
  4. 跨格式一致性:同一人信息在多份 / 多格式文档多处出现,需统一脱敏不遗漏。
  5. 半脱敏残留:曾经手动打码但留了可还原线索(如 138****1234 仍能缩小到 1 万人区间),仍是敏感信息。

二、通用 AI 卡在哪(4 个痛点)

痛点1:只认标准格式——变体全漏

免费通用大模型把「手机号」理解成整洁的 11 位数字串。它识别不了 1xx-xxxx-xxxx138****1234、「一三八…」,也识别不了缺前 6 位的身份证、用同音字写的姓名、只写小区名 + 楼栋的地址。真实后果是:你以为脱干净了,可那些「不标准」的写法原封不动发出去,照样能定位到人。

痛点2:只看字面「敏感词」——隐晦指代看不见

云端聊天机器人逐字找「身份证」「手机号」这类关键词。它看不到「医保号 / 样本编号与姓名同列」构成的标识,看不出「某基金 / 甲方 / 项目代号」背后就是真实客户,也读不出「其配偶任职于…」「详见补充协议」里的关系链。真实后果是:文档表面干净,实则把人 / 机构 / 关系完整泄露。

痛点3:不懂组合——准标识符当普通字段

通用大模型单字段判断「这条不敏感」,不会把「出生年份 + 性别 + 职务」当成一个重识别签名来扫。真实后果是:每个字段都「看起来安全」,组合后却在小样本里唯一锁定一个人,重识别敞口被整体低估。

痛点4:不跨格式——同一人多处遗漏

同一人的姓名 + 手机号 + 邮箱,可能出现在 Word 正文、PPT 备注、Excel 表、PDF 脚注里。通用大模型一次处理一份、彼此不关联,常只脱正文、漏掉备注和脚注。真实后果是:对外文件里「同一个人」部分明文、部分脱敏,等于没脱。

三、安柏怎么兜底

  1. 多模式覆盖变体:结构化骨干对常见格式变形(星号 / 空格 / 分段 / 缺位 / 同音昵称 / 职位代称)内置多模式,不只盯单一正则。
  2. 语义层兜底隐晦:对不出现敏感词、却可能唯一定位的间接标识符与编码段,由大模型两步审阅标记,交人工判断。
  3. 准标识符组合扫描:启用姓名识别后,自动扫描出生年份 + 性别 + 职务 / 学历等组合,仅标记不自动脱敏。
  4. 跨格式统一:同一实体的不同写法与跨文档出现,统一识别、统一脱敏,不漏处。
  5. 透明可溯:报告逐条标注命中位置、类型与来源(规则层 / 语义建议),不黑箱。

四、对比小结

维度免费通用云端大模型安柏·脱敏 Skill
变体识别只认标准格式,星号 / 缺位 / 同音全漏多模式覆盖常见变形
隐晦 / 间接敏感信息看不见(无敏感词就放过)语义层标记交人工
准标识符组合单字段判断,漏组合组合扫描,仅标记不脱敏
跨格式一致性逐份处理,彼此不关联同一实体统一识别脱敏
处理方式全留或全删标记交人工,绝不自动误伤

隐私与边界(如实说明)

隐私与边界(如实说明):脱敏在用户的本地 WorkBuddy 内、调用用户自有的大模型完成;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责云端处理。腾讯已对本 Skill 完成两项安全认证:①腾讯安全威胁情报中心认证;②Skills 安全评估报告(腾讯平台安全评估)。本工具为去标识化(非匿名化),变体与隐晦识别能力取决于规则覆盖与人工复核,上线前须经法律专业人士审核。处理真实数据前,须具备《个人信息保护法》要求的同意与影响评估。

关于安柏·反蒸馏 AI 实验室

关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,在用户本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html

同系列延伸阅读

本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn

免责声明:本文为产品能力介绍,不构成法律意见;正式脱敏方案请以法务与合规终审核为准。

← 返回系列文章导航

本文为产品能力介绍,不构成法律意见;正式脱敏方案请以法务与合规终审核为准。更多脱敏观点见 安柏系列文章

本文已同步发布于微信公众号

微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗