脱敏卫士合同 AI 审查前置流程:本地脱敏、人工复核与安全副本
把合同交给 AI 审查,真正需要发送的是条款、权利义务、履行条件和风险分配。客户姓名、交易对手全称、联系方式、证件号码、开户地址等真实身份信息,通常不是模型判断违约责任或付款条件的必要输入。
麻烦在于,这两类信息原本混在同一份文档里。直接上传,身份信息会随条款一起进入后续服务;手工全文查找替换,又容易漏掉简称、重复出现的地址以及格式不同的编号。更稳妥的做法,是在 AI 审查之前先形成一份可检查的脱敏副本:原始合同留在本机,副本隐藏真实身份,同时尽量保留条款结构与实体角色。
脱敏卫士在这项任务中承担的是前置处理层。它不替代合同审查,也不承诺自动识别零遗漏;它把导入、识别、复核和导出连成一条可以逐段验收的路径。
AI 审查需要的是条款关系,不是客户真实身份
先看一段经过简化的合同表达:
> 甲方某科技公司应在 2026 年 9 月 30 日前,向乙方张某指定账户支付服务费。逾期后,乙方有权按合同约定主张违约责任。
如果后续问题是付款条件是否清楚、逾期责任是否成立,模型需要区分甲方、乙方、日期、金额和账户分别承担什么语义角色,却不一定需要知道公司全称、自然人姓名和真实账号。把它们改成<组织名称1>、<自然人姓名1>、<日期1>、<金融账户1>后,句子的角色关系仍在,真实值则不再直接出现在副本中。
这也是混淆代指与简单删字的差别。安全副本应避免把合同变成一片无法阅读的遮挡,并尽量保留:
- 条款标题、编号和段落顺序;
- 甲乙方等主体之间的指向关系;
- 姓名、机构、地址、金额、日期等实体类别;
- 同一实体在上下文中的一致代指。
保留这些结构,不代表 AI 的审查结论天然可靠。它只解决一件更前置的事:减少原始敏感信息随合同一起进入后续系统,同时让合同仍具有可分析性。
用一条可检查的链路代替手工查找替换
一份合同从原文变成可交给 AI 的副本,可以拆成五个检查点:材料是否留在受控环境、识别项是否覆盖本次任务、误报和漏报是否处理、输出方式是否适合 AI、导出后的数据流是否明确。
图中是基于产品能力整理的任务流程示意。重点看黄色人工门:没有完成复核,结果不应进入导出环节。
脱敏卫士桌面端可导入.docx、.txt、文字型 PDF、扫描型 PDF 和图片。单个文件进入单篇流程,多份材料则进入批量流程;一次可稳定处理的规模取决于本机配置和可用资源,不应把批量支持理解成固定的无限容量。
桌面端的本地边界也需要说准确:合同、处理过程、任务记录和还原关联信息可留在本机,并支持断网使用;脱敏完成后,用户如果把副本交给云端 AI,副本仍会进入所选服务的数据链路。本地脱敏约束的是原始材料的前置处理,不等于后续模型也在本机运行。
识别合同敏感信息不能只靠一层规则
合同里的敏感信息至少分成三类,识别方法不同。
第一类有相对稳定的字符结构,例如身份证号、手机号、邮箱、统一社会信用代码、合同编号、司法案号和银行卡号。它们适合用预制正则判断,命中条件也更容易解释。
第二类依赖上下文,例如自然人姓名、详细地址、公司、机构和律师事务所名称。单靠字符格式很难判断一个短语究竟是主体名称、地点,还是普通条款内容。脱敏卫士使用 AI/NER 处理这些语义实体,并在结果中保留命中来源,便于复核者区分规则命中和模型识别。
第三类是组织自己的例外,例如内部项目号、业务简称、某类特殊证照格式,以及必须保留或必须隐藏的固定词。它们不适合等待通用规则覆盖,需要由自定义规则、黑名单和白名单补齐:黑名单用于强制处理,白名单用于保护不应被替换的词。
因此,方案配置不应从全选开始,而应从这份合同将被拿去做什么开始。做付款条款审查,主体、联系方式、账号、金额和日期值得重点检查;做知识产权条款分析,还可能需要处理项目代号、产品名称或内部技术标识。选择范围越贴近任务,后面的误报复核越有明确口径。
客户端可按用途维护脱敏要素方案。截图中的选项数量是该示例方案状态,不是所有合同都应照搬的固定配置。
占位符比一片星号更适合后续条款分析
脱敏卫士提供涂黑、星号遮盖和混淆代指三种主要输出方式。三者对应不同的结果契约,没有脱离任务的强弱排序。
本文的目标是把合同交给 AI 审查,因此选择能保留实体类别和编号的混淆代指;公开展示或传统外发可能采用其他方式。
涂黑适合对外展示,读者能知道这里有内容被处理,但 AI 无法从黑块中获得实体类别。星号可以保留部分前后字符,方便人工辨认,却容易把不同实体都压成相似的符号串。混淆代指则使用带类型和序号的标记,例如<组织名称1>与<组织名称2>。模型仍可区分两个主体,也能沿着全文追踪同一个标记。
对合同审查而言,这个区别会直接影响问题怎么问。原文中公司全称被星号替换后,模型可能只看到多个无差别遮盖区;改成有类型的代指后,可以继续提出:<组织名称1>有哪些付款义务、<组织名称2>是否拥有单方解除权、两个主体在违约条款中是否被前后一致地指代。
客户端的占位符视图把原文、脱敏结果和项目清单放在同一工作区,复核者可以观察每个值被识别成什么类型、替换成哪个编号,以及它在正文中的位置。
这张界面用于观察三件事:原值是否被识别、实体类型是否正确、同一代指在结果中是否保持可读。
人工复核不是补丁,而是导出门
任何自动识别都可能遇到误报和漏报。合同里的人名可能同时是品牌词,地址可能省略行政区,内部编号可能长得像日期,扫描件还会受图像质量和 OCR 结果影响。脱敏卫士明确采用自动识别加人工复核的工作方式,不把一次运行包装成百分之百完成。
复核应围绕清单进行,而不是重新从第一页漫无目的地浏览。脱敏列表会展示实体类别、原值、替换结果、来源文件、出现次数与当前启用状态。看到误报,可以关闭不需要处理的项目,或者将必须保留的词加入白名单;看到漏报,可以划词补充。高频出现的漏项再沉淀为自定义规则或黑名单,下一次处理同类合同时继续使用。
清单把识别结果变成可操作对象。复核者可以按类别和来源文件定位,而不是只看一份已经替换后的全文。
导出门至少要回答四个问题:
1. 原始身份值是否仍残留在正文、页眉页脚或附件文字中;
2. 关键主体是否被误识别为普通词,或被拆成多个不一致代指;
3. 条款编号、层级、定义与交叉引用是否仍可读;
4. 本次副本是否只保留 AI 审查真正需要的字段。
复核通过后再导出,流程的责任边界才清楚:识别给出候选结果,人对最终副本负责,AI 只接收已经通过这道门的版本。
交给 AI 的边界在导出之后仍需继续管理
脱敏副本降低了原始身份信息直接外传的风险,但它不是把所有数据治理问题一次消掉。合同条款本身仍可能包含商业秘密、独特交易结构或可重新识别当事人的组合信息。企业还需要决定副本进入哪个 AI 服务、是否允许服务留存、谁能下载分析结果,以及会话和附件多久删除。
任务记录和还原信息也要单独管。脱敏卫士会为已完成任务形成记录,用户可以继续核验、查看处理方式,并在受控环境中进入还原。这样的关联减少了手工保存和配对还原文件的负担,但历史任务、映射关系和还原权限本身仍属于敏感资产,不能与脱敏副本一起无控制地流转。
任务记录用于追踪处理文件、方式、方案和时间;它不是可以随副本一起发送给外部 AI 的普通附件。
一份安全副本怎样验收
在真正上传合同前,可以用下面这组清单做最后检查:
- 输入边界:原始合同是否始终留在被允许的本机或受控环境;
- 识别范围:本次任务所需的姓名、机构、地址、联系方式、账号、合同编号、案号、金额和日期是否按需启用;
- 规则分工:固定格式字段、语义实体与组织例外是否分别由合适的规则处理;
- 复核结果:误报是否关闭,漏报是否补充,同一主体的代指是否一致;
- 结构保留:条款标题、编号、定义、主体关系和交叉引用是否仍能阅读;
- 导出隔离:交给 AI 的是否只有复核后的副本,原文、映射表和还原信息是否留在受控环境;
- 后续数据流:所选 AI 服务的发送、留存、权限和删除策略是否已经确认。
这条前置流程的判断标准很具体:AI 应当能读懂合同中的角色与条款关系,却不需要直接看到客户和交易对手的真实身份。脱敏卫士完成的是从原始合同到可复核副本的转换;副本是否可以发送,则由人工复核结果和后续服务的数据边界共同决定。