判决书、案例上网前要隐去哪些信息?怎么批量脱敏
材料外发、案例上网、给客户看的版本,都要先做脱敏。手工脱敏的问题不在于慢,在于漏——同一个人名在几十页里出现上百次,只要漏一处就等于没做。可行的做法是按「信息类别」而不是按「出现位置」处理:先让系统把整份文档里的敏感信息识别出来并归类,再对每一类统一决定打码还是保留。律社的脱敏能识别 29 类敏感实体,覆盖人名、各类证件号、电话、邮箱、社交账号、地址、健康信息、统一社会信用代码、不动产权证号、车辆信息、商业秘密、技术参数、案号等,同一类可以一次批量打码或批量保留,也能逐条编辑替换值。这样漏一处的概率大幅下降,而且替换值可控——把当事人统一换成「张某」比直接涂黑更保留可读性。
操作流程
- 先确定这份材料的脱敏口径给客户看、对外发布、案例上网,三者要求不同。先定清楚哪些类别必须隐去、哪些可以保留,再动手。
- 上传文档,让系统按类识别支持 docx、pdf 与常见图片格式。系统识别后按类别归集,不是逐处孤立标记。
- 按类批量决定逐类勾选打码或保留。案号、金额这类常需保留,姓名、证件号、联系方式通常必须隐去。
- 逐条微调替换值需要保留可读性时,把替换值改成「张某」「某公司」这类代称,而不是一律涂黑。多个当事人时注意代称不要互相混淆。
- 补手动遮盖并检查特殊元素自动识别之外的内容可以在 PDF 上手动框选遮盖。签章与二维码要单独确认——二维码扫开可能直接暴露原始信息。
注意事项
- 扫描件没有文字层时走 OCR 定位后遮盖,命中即遮盖整个词或整个文本块,可能连带遮住相邻字。这是已知边界,脱敏后必须通读一遍成品。
- 不支持旧版 doc 格式,需要先另存为 docx。
- 脱敏不只是遮住姓名。住址、工作单位、特殊病情、车牌、账号尾号这类组合起来也可能定位到具体个人。
- 涉及个人信息处理的合规要求以现行法律法规与所在机构的规定为准,本文说的是操作方法。
律社在这一步做了什么
律社的文档脱敏场景支持 docx、pdf、png、jpg、jpeg、webp(不支持旧版 doc),自动识别 29 类敏感实体,同类可批量打码或批量保留,也可逐条编辑替换值,支持在 PDF 上手动框选区域遮盖,并带印章检测与二维码检测。扫描件按页判断有无文字层,没有文字层的走 OCR 定位后遮盖。产出可导出 DOCX、PDF、PNG、JPEG 或 WebP。
常见问题
脱敏需要处理哪些类别的信息?
律社按 29 类敏感实体识别,包括人名、各类证件号、电话、邮箱、社交账号、地址、健康信息、统一社会信用代码、不动产权证号、车辆信息、商业秘密、技术参数、案号等。具体哪些必须隐去,取决于这份材料的用途和所在机构的规定。
扫描件能脱敏吗?
可以。系统按页判断有无文字层,没有文字层的走 OCR 定位后遮盖。需要注意 OCR 命中后是遮盖整个词或整个文本块,可能连带遮住相邻的字,所以脱敏后要通读一遍成品。
涂黑和替换成代称哪个好?
看用途。对外发布、案例上网通常用代称(张某、某公司)更好,能保留行文可读性;仅作内部隔离时直接遮盖更省事。律社两种都支持,替换值可以逐条编辑。