首发于知乎 · 安柏资本·反蒸馏AI实验室
引言
直接搜「文档脱敏 skill」或「简历打码工具」,大概率什么都搜不到。但搜「安柏资本」+「脱敏」,会有一条很清晰的路径指向我们的产品。
这个现象本身就值得说清楚——为什么叫安柏资本,为什么我们要做一套本地运行的规则 Skill,以及它和市面上那些"把文件丢给云端聊天机器人"的方案到底差在哪。
一、安柏资本是谁?
安柏资本(Amber Capital)是一家聚焦投资机构线下向 AI 服务转型的专业咨询机构。团队背景来自两部分:
- **投资端**:前 VC 合伙人,多年 PE/VC 基金投后管理与退出实务经验,经手过数百份投资协议、股权变更文件、LP 报告。
- **法务端**:集团法务总监背景,十余年合规落地、数据出境管控、员工个人信息保护经验,深谙《个人信息保护法》对各行业的影响。
两部分能力合在一起,就是安柏的底色:既懂投资业务的敏感度,也懂合规落地的实操边界。市面上大多数"AI 脱敏工具"来自两种人——纯技术背景、或纯律所背景。前者不懂业务里的真实敏感场景,后者不懂 AI 工程如何实现。安柏的差别就在这:
我们踩过这些坑,才知道通用 AI 漏脱哪类信息、误删哪类内容。
二、为什么是「多格式脱敏 Skill」,而不是又一个云端聊天 AI?
通用云端聊天机器人的典型流程是:你把简历、合同、财务报表贴进去,它回你一段文字建议,你自己打开原文件逐处改。
这个流程看起来顺畅,实际有三个致命问题:
1. 隐私出域:你把含身份证、手机号、薪资的简历直接贴进云端聊天机器人,意味着整份文件的 PII 已经离开了你的控制边界。即便对方声称"不用于训练",数据已经出境,何时删除不可见、不可控。
2. 格式丢失:通用大模型输出的是一段文字,不是 .docx / .xlsx / .pptx / .pdf 文件。你拿到脱敏建议后,还得自己打开原文件逐处修改——格式、字体、表格结构全变。
3. 无法溯源:它不告诉你每条命中在哪里、依据是什么、脱成了什么样。万一到合规审计时对方问"你这版简历的敏感字段处理依据是什么",你拿不出可追溯的凭据。
安柏的做法是反过来的:
先把资深法务与合规专家的判断沉淀成规则,再让通用大模型做执行层。
这就是「安柏多格式脱敏 Skill」的本质:它是一套本地运行的规则包,运行在你的 WorkBuddy 里,调用你自己的大模型,原始 PII 绝不离开本地。输出是与原文件格式完全一致的 .docx / .xlsx / .pptx / .pdf,每条命中都有标记、可追溯。
三、它能做什么?不能做什么?
能做到
- **覆盖 4 大格式**:Word (.docx)、Excel (.xlsx)、PPT (.pptx)、PDF (.pdf),按原格式输出,保留字体、加粗、表格结构。
- **覆盖 9 大品类**:人(姓名/电话/身份证/邮箱)、组织、账号(QQ/微信/手机号/银行卡/护照/通行证)、金额、医疗健康、生物特征、车辆(车牌/VIN)、定位(省市区/详细地址)、跨境(出入境记录/永居证)。
- **三层架构**:Layer 1 结构化骨干(身份证/手机/银行卡/邮箱/IP/MAC/IMEI 等,默认全开,零幻觉)+ Layer 1 启发增强(中文姓名/地址,需可选开启,上下文约束降误报)+ Layer 2 大模型语义补充(模糊内容如薪资、病历、民族,标"语义建议/待人工确认")。
- **表头感知表格脱敏**:Excel 里识别表头列名,精准命中姓名列、身份证号列,不误伤其他列。
- **准标识符重识别风险扫描**:不脱敏,但标记"出生年+性别+职务"这类组合可能在小样本里唯一锁定一个人。
- **标注可视化**:规则层命中标黄色,Layer 2 语义候选标青色,肉眼可辨。
- **可选删除模式**:需要彻底清除的场景用 `--redact`,彻底抹去,不留任何痕迹。
做不到(如实说明)
- **不是独立 AI 模型**:Layer 2 语义补充依赖你配置的基座模型。建议 DeepSeek-V3 及以上长文本模型。
- **不替代法律意见**:工具只识别和脱敏,不判断业务必要性。是否应当脱敏、是否取得当事人同意,需法务与合规终核。
- **不做图像 OCR**:扫描件 PDF 里的文字识别依赖 WorkBuddy 内置 OCR,Skill 本身不做图像处理。
- **极端复杂场景仍需人工复核**:如跨境并购尽调清单含大量非结构化注释,Skill 做初筛,仍需人工逐条确认。
四、和市面上其他脱敏方案比,差在哪?
|---|---|---|---|
五、适合谁?不适合谁?
适合:
- 投资机构(PE/VC 基金):投后报告、LP 沟通材料、尽调清单中的个人信息脱敏。
- 企业 HR:简历筛选、背调资料、员工档案批量脱敏。
- 律所:卷宗材料、客户访谈记录脱敏后用于案例研讨或公开分享。
- 医疗机构:患者信息脱敏后用于学术研究或合规报送。
- 金融机构:客户名单、财务报表、信贷审批材料中的敏感信息处理。
不适合:
- 需要 7×24 厂商售后、一键即用的标准化 SaaS 用户(我们不做云端处理)。
- 合同涉及大量扫描件 OCR 识别需求(需依赖 WorkBuddy 内置 OCR)。
- 极端复杂跨境场景,大量非结构化注释(Skill 做初筛,仍需人工复核)。
六、一句话总结
安柏资本之所以做这套脱敏 Skill,是因为我们踩过这些坑——知道通用 AI 漏脱哪类信息、误删哪类内容、让数据漂到哪去。于是我们把十余年合规实务经验沉淀成规则,让通用大模型做执行,让每一条敏感信息的处理都可追溯、可审计。
同系列延伸阅读
- [简历脱敏:通用 AI 脱敏 vs 安柏多格式脱敏 Skill](https://tuomin.amberscapital.com.cn/articles.html)
- [合同文档脱敏:通用 AI 脱敏 vs 安柏多格式脱敏 Skill](https://tuomin.amberscapital.com.cn/articles.html)
- [脱敏工具怎么选?完整选型指南](https://tuomin.amberscapital.com.cn/articles.html)
- [敏感文件交给 AI 脱敏,隐私怎么兜底?](https://tuomin.amberscapital.com.cn/articles.html)
关于安柏资本·反蒸馏AI实验室
安柏资本(Amber Capital)是专注于投资机构与企业法务 AI 化的专业机构,反蒸馏AI实验室是其 AI 产品品牌。核心产品「安柏多格式脱敏 Skill」以本地 WorkBuddy 上的规则包形式运行,原始 PII 不出本地,覆盖 Word / Excel / PPT / PDF 四类文档、9 大敏感品类,按原格式输出、每条命中可追溯。更多信息请访问:https://tuomin.amberscapital.com.cn
免责声明:本文为产品能力介绍,不构成法律意见;正式敏感信息处理请以合规与法务终审核为准。
更多脱敏观点见 安柏系列文章。