系列文章 · PDF 文档

一份 PDF,通用 AI 脱敏 vs 安柏脱敏 Skill——可搜索与扫描件怎么脱

引言

你大概率在搜索框里敲过「PDF 怎么脱敏」「扫描件打码」「合同 PDF 去标识」。先把结论放在最前面:把一份 PDF(尤其是扫描件)直接丢给通用云端大模型,最典型的翻车有两类——一是「扫描件无文本层、PII 完全没被处理」(模型读到的只是一张图),二是「定位失败还静默漏脱」(该脱的没脱、还一声不响)。安柏·反蒸馏 AI 实验室的「安柏脱敏 Skill」给你的,是一份在本地、调用你自己的大模型完成的、用 PyMuPDF 红注就地写入的脱敏 PDF,定位失败会在报告里明确标注、绝不静默漏,原始 PII 从不出本地。在合同、卷宗、报表这类「发得出去、却藏不住字」的场景里,差距不是「顺手一点」,而是「脱没脱干净、能不能举证」。

PDF 脱敏最怕两件事:一是扫描件没文本层根本处理不了,二是脱完版式乱掉或定位失败被隐瞒。通用大模型在这两个点上恰好最弱。下面用文档合规的视角,把 PDF 到底该脱什么、通用大模型卡在哪、安柏怎么补上,一次讲透。

怎么用 / 门槛

怎么用 / 门槛:安柏脱敏 Skill 以 Skill 形式运行在你本地的 WorkBuddy 中,调用的是你自有的大模型——安柏只提供脱敏规则,不负责云端处理。原始 PII 从不出本地。计费上按次或按授权灵活(具体以官网/微信为准),完全自助、无客服介入、无需上传任何文件到第三方。对法务与档案岗而言,你可以在不触网的情况下完成整批 PDF 的脱敏。

覆盖能力

本产品对 Word / Excel / PPT / PDF 四类文档,完成「识别→标注(标黄/加粗)→提取→脱敏→按原格式生成文件」。针对 PDF,核心能力是「PyMuPDF 红注就地写入」:在原位置做红注(redaction)并就地写入脱敏文本,结构 / 版式基本保留。能力分三层(结构化骨干默认全开、精度最高;中文姓名/地址可选开启、上下文约束、需人工复核;Layer 2 大模型语义补充先本地脱敏再合并候选、标「语义建议/待人工确认」),覆盖人 / 组织 / 账号 / 金额 / 医疗 / 生物特征 / 车辆 / 定位 / 跨境全品类。

一、本类型核心敏感字段清单(PDF 文档视角)

  1. 正文 PII:散落在段落里的姓名、身份证、手机号、邮箱。
  2. 表格 PII:PDF 内嵌表格中的账号、金额、证件号。
  3. 表单字段:填写式 PDF 的姓名、身份证、联系方式、住址。
  4. 签名信息:签名处的姓名、签署人标识。
  5. 银行账号 / 统一社会信用代码:合同、回单中高频出现。
  6. 出生日期:结构化骨干覆盖,掩码月日保留年。
  7. 住址 / 定位:出现在送达地址、地图。
  8. 健康 / 民族:出现在体检、病历类 PDF。
  9. 案件号 / 合同号:与姓名同段时构成准标识符。
  10. 车牌 / 车辆标识:出现在事故、物流类 PDF。
  11. IP / MAC:出现在日志、技术类 PDF。
  12. 截图嵌入:PDF 内嵌图片里的个人信息(需 OCR)。
  13. 批注 / 元数据:隐藏层里的作者、修订者信息。

(注:处理真实 PDF 前,请确认已取得《个人信息保护法》要求的同意与影响评估;纯图片型扫描件需先 OCR 转为可检索 PDF 再处理。)

二、通用 AI 卡在哪(4 个痛点)

痛点1:扫描件无文本层——模型读到的只是一张图,PII 完全没动

大量合同、卷宗、报表是以「图片型 PDF」存在的,文本层为空。通用大模型读这类 PDF 时,本质是在看一张图,对里面的姓名、身份证、金额既看不见也不处理(除非你额外 OCR 再传云,而那又多一道把原图外传的风险)。某 PE 基金(示意)把一份扫描版尽调报告丢给聊天机器人,返回显示「已脱敏」,实际正文里的当事人姓名一字未动。真实后果是:最该脱的扫描件恰恰被彻底绕过,你拿着「已脱敏」的结论外发,等于主动泄露。

痛点2:PDF 定位失败还静默漏——该脱的没脱、一声不响

即便是有文本层的 PDF,跨行、被图形遮挡、或字体异常的片段也常让通用大模型「定位不到」。通用大模型不会告诉你「这段我没脱成」,它只是默默跳过,返回一份看似干净的文档。真实后果是:脱敏出现「沉默的漏洞」——没有任何提示、没有任何报告,等文档流出才发现问题,补救成本极高。

痛点3:云端传 PDF 风险——原始文件出库,合规失控

把含身份证、合同金额、当事人信息的 PDF 上传到通用云端大模型,意味着原始文件离开了你的控制域。无论模型「是否用于训练」,文件已在第三方服务器留下副本,这在金融、司法等强监管行业常直接违反数据出境与内部保密规定。真实后果是:脱敏还没做,泄密已经发生了——且你往往无审计、无撤销。

痛点4:破坏版式——脱完的 PDF 没法用、红注不落地

通用大模型即便识别对了,也只能「给段脱敏文字」,无法在原 PDF 位置写入红注、保留表格与签名结构。你要手动重建 PDF,版式大概率走形,签名与表单还可能被破坏。真实后果是:脱敏后的 PDF 反而不能用于正式流转,团队为了「能用」放弃脱敏,风险一直敞着。

三、安柏 Skill 怎么处理本类型

  1. PyMuPDF 红注就地写入:在原位置做红注并就地写入脱敏文本,结构 / 版式基本保留。
  2. 文本层中文依赖:可搜索 PDF 直接处理;纯图片 / 扫描件提示需先 OCR 转为可检索 PDF 再处理。
  3. 定位失败不静默漏:跨行或被遮挡导致无法定位的片段,在报告中明确标注「定位失败,建议人工核对」,而非默默跳过。
  4. 按原格式输出:脱敏结果写回原 PDF,保留版式与结构,拿来即可流转。
  5. 本地运行、原始 PII 不出本地:全程在你本地 WorkBuddy 调用你自己的大模型完成。

四、对比小结

维度通用云端大模型安柏脱敏 Skill
扫描件无文本层、完全没处理提示需 OCR 转可检索后再脱敏
定位失败静默漏脱、无提示报告标注「定位失败,建议人工核对」
原始文件上传云端、出库风险本地运行、调用你自己的大模型、不出本地
版式保留破坏排版、红注不落地PyMuPDF 红注就地写入、按原格式输出
审计留痕无报告报告标注命中位置与定位状态

隐私与边界(如实说明)

隐私与边界(如实说明):脱敏在你的本地 WorkBuddy 里进行、调用的是你自有的大模型;安柏·反蒸馏 AI 实验室只提供脱敏规则,不负责对文件进行云端处理。腾讯已对本 Skill 完成两项安全认证:① 腾讯安全威胁情报中心认证;② Skills 安全评估报告(腾讯平台安全评估)。我们如实说明:本地运行的含义是原始 PII 不进入安柏或任何第三方云端,不做「原稿绝对不出本机」的夸大表述。

关于安柏·反蒸馏 AI 实验室

关于安柏·反蒸馏 AI 实验室:我们出品「安柏·多格式敏感信息脱脱敏 Skill」,为投资机构、企业与法务档案岗提供可落地的本地脱敏能力,覆盖 Word / Excel / PPT / PDF,按原格式输出、保留版式结构,并支持 PDF 红注就地写入与定位失败标注。脱敏规则在用户本地 WorkBuddy 内运行、调用用户自有的大模型;安柏只提供规则,不负责云端处理,并通过腾讯双重安全认证。更多同系列文章见导航:https://tuomin.amberscapital.com.cn/articles.html

同系列延伸阅读

本系列所有文章均回链官网:https://tuomin.amberscapital.com.cn

免责声明:本文为产品能力介绍,不构成法律意见;正式处理真实个人数据前请以法务终审核与《个人信息保护法》合规要求为准。

← 返回系列文章导航

本文为产品能力介绍,不构成法律意见;正式处理真实个人数据前请以法务终审核为准。更多脱敏观点见 安柏系列文章

本文已同步发布于微信公众号

微信版阅读体验更佳,含完整排版与系列导航:点击在微信中打开 ↗