系列文章 · 简历 / 招聘背调

一份简历,通用AI脱敏 vs 安柏脱敏 Skill——姓名电话身份证怎么脱才不漏

引言

你大概率在搜索框里敲过「简历脱敏怎么弄」「招聘背调信息怎么打码」「简历发猎头前怎么保护隐私」。先把结论放在最前面:把整份简历直接丢给通用云端大模型去脱敏,便利的另一面是风险——你的姓名、手机号、身份证号、家庭住址会先上传到别人的服务器,再等对方「好心」帮你改回来。安柏·反蒸馏 AI 实验室的「安柏脱敏 Skill」正好反过来:它在你的本地 WorkBuddy 里运行、调用你自有的大模型,原始 PII(个人敏感信息)绝不离开本地,对简历里的姓名、电话、身份证等字段做结构化精准脱敏。在简历这种一人一档、字段密集、还常带证件照的文件里,这中间的差距不是「方便一点」,而是「隐私有没有漏出去」。

招聘与背调场景最怕两件事:一是人名、地址这类「非结构化」信息被漏脱或误吞,二是整份含身份证、银行卡的简历被原样传到云端。通用大模型在这两个点上恰好最弱。下面从合规与隐私保护的视角,把简历到底该脱什么、通用大模型卡在哪、安柏怎么补上,一次讲透。

怎么用 / 门槛

怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy,调用的是你自有的大模型(你自己的 API Key 与额度),安柏只提供脱敏规则,不负责云端处理。使用方式完全自助:把 Word / Excel / PPT / PDF 格式的简历交给 Skill,它自动完成「识别 → 标注(标黄/加粗)→ 提取 → 脱敏 → 按原格式生成文件」。支持按次或授权灵活模式,无需把文件上传到任何第三方平台,全程本地闭环。

覆盖能力

本产品采用三层架构:Layer 1 结构化骨干(身份证、手机、银行卡、邮箱、车牌、护照、通行证、永居证、军官证、居住证、统一社会信用代码、IP、MAC、IMEI、QQ、微信、出生日期,默认全开、精度最高)、Layer 1 启发增强(中文姓名、地址,需可选开启,上下文约束、需人工复核)、Layer 2 大模型语义补充(先本地脱敏生成审阅包,再合并大模型候选,标「语义建议/待人工确认」)。覆盖人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类,并按 Word / Excel / PPT / PDF 原格式输出,保留字体、加粗与表格结构。

一、本类型核心敏感字段清单(简历 / 招聘背调视角)

  1. 姓名:简历主体与紧急联系人、前同事、推荐人姓名,是最直接的可识别标识。
  2. 手机号:本人手机、紧急联系人手机、家庭电话,落入云端即等于对外公开。
  3. 身份证号:背调授权书、入职登记里常见,属最高敏感级别的直接标识符。
  4. 电子邮箱:个人邮箱常含姓名的拼音或拼音组合,可被反查身份。
  5. 家庭住址:详细到门牌的住址,结合姓名即可定位到具体个人。
  6. 籍贯:单独看弱,但与出生年份、学历组合可构成准标识符。
  7. 婚姻状况:敏感个人属性,常作为背调的「背景信息」被收集。
  8. 证件照:照片 / 扫描件里嵌含姓名、证件号,普通文本脱敏扫不到。
  9. 紧急联系人:第三人姓名 + 关系 + 电话,扩散了可识别范围。
  10. 期望薪资 / 当前薪资:金额类敏感信息,对外分享简历时易暴露。
  11. 银行卡号:部分简历附收款账号或工资卡信息,属金融账户。
  12. 毕业院校 / 专业 / 入学年份:与出生年份组合可缩小到具体人群。
  13. 前同事 / 上级姓名:第三人信息,未经同意外传同样有合规风险。
  14. 出生日期:独立可掩码,与性别、学历组合即为准标识符。

(注:《个人信息保护法》将姓名、身份证号、联系方式、生物识别、行踪轨迹等列为敏感个人信息,处理前需具备合法基础与必要的影响评估;本清单供脱敏时对照使用,具体以法规与贵司合规口径为准。)

二、通用 AI 卡在哪(4 个痛点)

痛点1:人名识别差——把「通信」「司法」当姓误吞,又把真名漏掉

通用大模型对中文人名的识别来自通用语料,它并不真正理解「姓名」的边界。常见两类错误:一是把普通词的首字误当成姓——例如「通信记录」「司法程序」里的「通」「司」被当作姓氏吞掉,造成大面积误报;二是遇到无标签的裸名(如「与张小妹电话沟通」)直接漏过,真名原样留在云端。简历里姓名出现在表头、段落、推荐人列表多处,这种「该脱的没脱、不该脱的乱脱」对隐私保护是致命的——漏脱让真人信息外泄,误吞又把简历改得无法使用。真实后果是:你以为脱完了,实际身份证旁的真名还在对方服务器上。

痛点2:只给「建议」不实际脱敏——结论停在聊天框,文件照旧

即便通用大模型偶尔说对一句「建议对手机号打码」,它也停留在文字建议层面:不会真的改写你的 .docx / .pdf 文件,不保留原格式,更不输出可复核的脱敏报告。你要自己打开简历、逐处手动改、自己承担「改得对不对、漏没漏」的责任。它也不标出每一条命中在哪里、脱成了什么样,结论无法追溯——万一到争议时对方质疑「你这版简历的敏感字段处理依据是什么」,你拿不出可追溯的凭据。真实后果是:脱一份简历变成「AI 给方向、人来做苦力」,隐私风险没降多少,责任反而全压在 HR 身上。

痛点3:把整份简历传上云——原始 PII 先出境再回来

把简历贴进通用聊天机器人,意味着姓名、手机、身份证、家庭住址、证件照描述会先完整上传到服务商的服务器。对招聘方而言,这等于把候选人的一整份敏感档案交给了第三方;对候选人而言,其身份证号、住址可能在不知情下被用于模型训练或留存。即便对方声称「不用于训练」,数据已经离开了你的控制边界,是否留存、何时删除都不可见、不可控。真实后果是:脱敏的目的本来是保护隐私,结果第一步就把隐私送出了门——本末倒置。

痛点4:照片 / 扫描件里信息漏脱——文本层扫不到的盲区

简历常含证件照、扫描版身份证、签字页图片。通用聊天机器人处理的是你粘贴进去的文字,图片里的姓名、证件号它要么读不到,要么需要你额外上传图片,进一步放大云端泄露面。即便能 OCR,原图也已出境。真实后果是:文字字段脱得七七八八,照片里的身份证号却完整躺在对方系统里——而身份证恰恰是最该守住的直接标识符。

三、安柏 Skill 怎么处理本类型

  1. 结构化骨干默认脱身份证 / 手机 / 邮箱 / 银行卡:这些类型独立命中、互不干扰、精度最高,不依赖大模型判断,从根上避免漏脱。
  2. 姓名用 --detect-name 上下文锚定、仅显首字:只在标签词(甲方 / 联系人 / 法定代表人等)或称谓(先生 / 女士)附近锚定,避免误吞「通信」「司法」;命中后只显示首字、其余掩码。
  3. 地址用 --detect-address 保留省 / 市 / 区:详细门牌打码,省市区保留,兼顾可用性与隐私;表格姓名列 / 机构列 / 账号列按表头感知自动覆盖。
  4. 照片 / 扫描件先 OCR 再脱敏:图片型内容需先转成可检索文本,Skill 在本地完成识别与脱敏,原始图像不离开本机。
  5. 报告可溯源每条命中:提取报告标注命中位置(段落 / 单元格 / 页码)、类型与脱敏结果,每条都能复盘,谁来审都能追责。

四、对比小结

维度通用云端大模型安柏脱敏 Skill
痛点1 人名识别易误吞「通/司」等、漏裸名上下文锚定、仅显首字、可复现
痛点2 实际脱敏只给建议,不改文件按原格式改写文件 + 可溯源报告
痛点3 数据去向整份简历先上传云端本地运行、原始 PII 不出本地
痛点4 图片信息照片 / 扫描件常漏脱先 OCR 再本地脱敏,图像不出境
隐私边界数据离开控制边界你的大模型 + 本地闭环,安柏只给规则

隐私与边界(如实说明)

隐私与边界(如实说明):简历的脱敏在用户的本地 WorkBuddy 里进行、调用的是用户自有的大模型;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责对简历进行云端处理,原始 PII 绝不离开本地。调用大模型时,Skill 先把规则层脱敏后的文本片段交给模型,模型只看到已掩码内容。腾讯已对本 Skill 完成两项安全认证:①腾讯安全威胁情报中心认证;②Skills 安全评估报告(腾讯平台安全评估)。我们不会把产品包装成「原稿绝对不出本机」之外的夸大承诺——这一点我们如实说明。

关于安柏·反蒸馏 AI 实验室

关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,为投资机构、企业法务与 HR 提供可落地的本地脱敏能力,覆盖 Word / Excel / PPT / PDF 四格式,人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类。脱敏规则在用户的本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html

同系列延伸阅读

本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn

免责声明:本文为产品能力介绍,不构成法律意见;正式敏感信息处理请以合规与法务终审核为准。

← 返回系列文章导航

本文为产品能力介绍,不构成法律意见;正式敏感信息处理请以合规与法务终审核为准。更多脱敏观点见 安柏系列文章

本文已同步发布于微信公众号

微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗