数据脱敏,哪些信息不能简单替换遮盖

把身份证中间几位打成星号、把手机号中间换成 0000,很多单位就认为数据“安全了”。但遮盖改变的是字符,不是可识别性:剩余部分仍可枚举还原,几个无害字段组合起来仍能唯一定位到人,同一批数据多次发布还能把星号拼回去。脱敏做错比不做更危险,它会让一份本该严管的数据,以“已脱敏”的名义流出去。
一、为什么“打码”不等于安全
1. 打码遮的是字符,不是信息结构
结论:打码遮掉的是字符,不是可识别性。
例子:11010119900307XXXX 后四位被遮,但前六位是行政区划码,7 至 14 位是出生日期,第 17 位是性别码,与公示名单关联即可圈出人。
怎么用:先算唯一率。身份证、手机号接近 100% 唯一,打星无效,应整体替换或删除。
2. 星号留下的候选集可以枚举
结论:138****1234 的候选空间只有 10000 个,可枚举还原。
例子:5 万条用户表保留号段与后四位,攻击者生成 10000 个号码与通讯录做交集,命中率极高。
怎么用:改用保留格式加密(FPE)或令牌化,密钥分离保管,不要保留前后缀再掩码。
3. 多次发布会把星号拼回去
结论:脱敏不是一次性动作,多次发布会让遮蔽失效。
例子:3 月发布名单 A,5 月发布字段相同但掩码位置不同的名单 B,按行对齐后星号互补,号码被拼回;推文与附件规则不一致同样会被还原。
怎么用:同一数据源对外发布走同一套规则与版本记录,发布前做跨版本比对。
二、六类不能简单替换遮盖的信息
1. 直接标识符
结论:姓名、身份证号、手机号、银行卡号、社保号、护照号不能靠掩码,只能替换或删除。
例子:6222****1234 保留发卡行 BIN 和后四位,用于分析就是漏洞,加交易时间即可在流水里定位到具体卡。
机制:这类字段熵本就高,遮中间不改变唯一性。GB/T 35273-2020 要求以不可复原为目标。
怎么用:建字段敏感度清单,命中字段默认走 FPE 或令牌化;明文展示最小保留位数为 0。
2. 准标识符组合
结论:出生日期、性别、邮编单独无害,合起来能唯一定位到人。
例子:体检表删了姓名,保留 1962-05-14、女、100086,与公示名单连接即命中唯一记录。Sweeney 1997 年称美国约 87% 的人口可被这三项唯一确定。
机制:重识别靠组合,掩码只改了单字段的值,不降低组合的区分度。
怎么用:枚举 2 至 4 个字段的组合统计唯一条数,唯一率超阈值就泛化或分桶。
3. 生物特征与图像
结论:人脸、指纹、声纹、虹膜不可撤销,打码不消除可识别性。
例子:监控截图给眼部打马赛克,脸型、颧骨、下颌线仍在,比对模型照样匹配;声纹变声后语速、口音仍保留,熟人一听即知。
机制:特征信息分布在整个样本里,局部遮盖破坏不了整体特征向量的可比性。
怎么用:交付前做整体替换(换脸、重录、合成)或不入库;保留的放隔离环境留审计。
4. 位置与轨迹数据
结论:时序特征很难消除,降低坐标精度也不一定安全。
例子:订单经纬度精确到 1 公里看似安全,但一周订单排序后起点在小区、终点在写字楼,轨迹就指向了人;夜间常驻基站等同住址。
机制:识别力来自重复出现的模式,不是单次坐标的精度。
怎么用:先做停留点聚合(居住、办公、医疗),再泛化到行政区,常驻点抑制或替换。
5. 细粒度时间戳
结论:精确到秒的交易时间是常被忽略的准标识符,与金额一组合就能定位。
例子:流水保留 2024-03-11 14:23:07、128.50 元、便利店,百万级表上多数记录因此唯一,对齐小票即反查持卡人。
机制:粒度越细区分度越高,时间戳天然是跨源关联键。
怎么用:按用途定粒度,统计用日期或月份,追溯场景换成相对基准的偏移值。
6. 自由文本与备注字段
结论:客服备注、诊断描述是脱敏盲区,规则化掩码必然漏。
例子:备注写“客户张某某(王经理介绍来的,他爱人李女士也办过)”,姓名打码,关系和称谓仍在;叙述性诊断用正则抓不干净。
机制:文本中的敏感信息没有固定位置和格式,掩码只能覆盖预设模式。
怎么用:先用命名实体识别标注人名、地名、机构、时间、联系方式,再人工抽样复核,比例不低于 10%;高敏整段摘要化或删除。
三、隐蔽的三类攻击
1. 链接攻击
结论:你的数据没有名字,不代表别人手里的表没有名字。
例子:公开的先进个人名单含姓名、单位、出生年月,已脱敏体检数据含同样三项,两表一连接结果就落到了人头上。
怎么用:威胁建模时列全外部数据源(公示、招投标、论文附表、裁判文书)并测连接成功率;能连上的组合必须泛化。
2. 同质化攻击
结论:即使满足 k-匿名,等价类内取值一致,隐私照样泄露。
例子:某医疗数据一个等价类里 5 条记录诊断字段相同,攻击者知道目标在此类即得结论,无需分辨是哪一条。
机制:k-匿名只保证分不清是哪一条,不保证看不出是什么值。
怎么用:叠加 l-多样性,类内敏感属性至少 l 个取值,一般取 2、高敏取 3;医疗、风控再加 t-接近性。
3. 差分推断与成员推断
结论:对外提供统计接口时,脱敏数据仍可能被反复查询问出来。
例子:开放平台按区县、年龄段、病种查人数,攻击者叠加条件直到结果收敛为 1,即确认目标病情。
怎么用:接口加最小单元阈值(小于 11 条不出数)、限制查询次数;发布前设 ε(0.1 至 1.0)对计数加噪。
四、合规红线怎么卡
1. 去标识化不等于匿名化
结论:两者法律后果完全不同,很多单位混为一谈。
例子:姓名换编号、手机号打星属于去标识化,借助额外信息仍能识别自然人,《个人信息保护法》照样适用;不能复原的才是匿名化。
怎么用:交付文档标注每档归属,不用“已脱敏”含糊表述;不能证明不可复原的按个人信息管。
2. 标准依据
结论:脱敏方案要有标准可依,不能凭经验拍脑袋。
例子:GB/T 35273-2020《信息安全技术 个人信息安全规范》给出个人信息去标识化的目标、过程与管理要求;GB/T 37988-2019 中脱敏落在数据处理与数据交换两个过程域。
机制:标准给的是过程要求,不是结果标准,单靠一项技术不能自动合规。
怎么用:把条款映射成动作——清单从哪来、谁审批、怎么验证、密钥谁保管,逐条落到责任人。
3. 档案领域的开放审核
结论:档案开放不能照搬个人信息脱敏逻辑,要按《档案法》与开放鉴定执行。
例子:一批 1985 年的知青返城审批档案既有住址、健康等隐私又有史料价值。按《档案法》须先做开放鉴定,不宜开放的延期或控制使用。
机制:敏感判定不只看能否定位到人,还看历史、经济、安全等维度,判定主体是保管单位。
怎么用:加工阶段就按卷、件、页标注敏感线索(含身份证号、个人履历、涉密标识),审核时逐页复核。
4. 判定口径:能不能单条定位
结论:给一线一个可执行的判定口径,比讲概念有用。
例子:把处理后的数据交给不了解业务的第三方,让他只用公开信息尝试定位单条记录到自然人,能定位就不算脱敏成功。
怎么用:报告给出样本量、尝试条数、成功条数,重识别率等于成功数除以样本量;一般阈值 5%,政务医疗 1%。
五、正确做法:分级分类、方法选型、验证闭环
1. 先分级分类,再选方法
结论:方法取决于字段用途和敏感度,不是越重越好。
例子:同为手机号,客服回访要能还原则用令牌化或 FPE,建模用假名化,公开统计直接删除。
怎么用:按公开、内部共享、受控使用、可用不可见四档划分场景逐字段定方法:保格式用 FPE,统计用泛化,建模用分桶,高唯一字段抑制删除,跨系统关联用假名化,演示用合成数据。
2. 必须做重识别验证
结论:脱敏做完了不等于做对了,验证是必需环节。
例子:抽 10000 条模拟攻击者用企业公示信息做连接,若 600 条被唯一命中,重识别率 6%,超阈值就加大泛化再测。
机制:k-匿名指每条记录至少与 k-1 条记录在同一等价类内不可区分,k 越大命中唯一的概率越低。
怎么用:k 按场景设,内部共享 5 以上,对外发布 10 以上,医疗、未成年人、轨迹类 20 以上;样本脚本结果留档。
3. 交付要有规则清单与验证报告
结论:没有文档的处理结果,审计时等于没做。
例子:交付包应含字段敏感度分级表、脱敏规则清单(含 k 值等参数)、密钥保管说明、重识别验证报告、例外审批记录。
怎么用:规则清单做成 YAML 或 JSON,与脱敏脚本版本绑定,每次变更留版本号,保证可复现、可追溯。
4. 先试标小批,再放量
结论:脱敏项目最容易在放量阶段翻车,小批试点能提前暴露问题。
例子:300 万条的档案数字化项目,先抽 3000 条探查标注交业务方确认,再取 3 万条跑首轮脱敏与验证,达标后放量,全量后抽 1% 终检。
怎么用:把试点产出(分级表、规则清单、验证报告)设为放量准入门槛;每 50 万条设抽检点,异常即暂停。
六、总结
低唯一性字段(数量、金额、类别编码)可以泛化或分桶;直接标识符、准标识符组合、生物特征、轨迹、细粒度时间戳和自由文本不能简单替换,只能加密、令牌化、泛化或删除。判定标准:单条记录能否被定位到自然人。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
