数据脱敏到底是什么?要怎么做到脱敏?

随着《数据安全法》《个人信息保护法》《网络数据安全管理条例》相继落地,“数据脱敏”这个词在企业 IT 部门、法务部门和数据团队里出现的频率越来越高。但很多人对脱敏的理解还停留在“把手机号中间几位换成星号”这个层面。实际上,数据脱敏是一套系统的数据保护技术,目标是在保证数据可用性的前提下,尽可能降低敏感信息泄露的风险。这篇文章我们就把数据脱敏讲清楚:它到底是什么?有哪些常用方法?企业又该如何落地?
一、数据脱敏的定义与核心目标
数据脱敏,英文叫 Data Masking 或 Data Desensitization,是指对敏感数据进行处理,使其在特定使用场景下不再能直接识别到具体个人或泄露核心机密,同时尽量保持数据本身的格式和可用性。
简单说,脱敏要做到两件事:
- 防泄露:让未经授权的人看不到真实敏感信息;
- 仍可用:让拿到数据的人能继续用于开发、测试、分析、展示等合法用途。
数据脱敏的核心目标是找到一个平衡点:安全与可用之间的平衡。脱敏过度,数据失去价值;脱敏不足,隐私和安全风险仍在。
二、哪些数据需要脱敏
并不是所有数据都需要脱敏。通常需要脱敏的数据包括以下几类:
1. 个人身份信息
姓名、身份证号、护照号、手机号、电子邮箱、家庭住址、车牌号等。
2. 金融账户信息
银行卡号、信用卡号、支付账号、交易流水、账户余额等。
3. 生物识别信息
人脸照片、指纹、虹膜、声纹、基因数据等。
4. 医疗健康信息
病历、诊断结果、体检报告、医保信息等。
5. 企业核心商业信息
客户名单、供应商信息、合同金额、核心技术参数、战略计划等。
6. 政务敏感信息
干部档案、案件信息、执法记录、公民办事记录等。
判断是否需要脱敏,关键看两个维度:一是数据本身是否敏感,二是使用场景是否存在泄露风险。同一份数据,在内部生产环境可能不需要脱敏,但发给外包团队或用于公开演示时就必须脱敏。
三、常见的数据脱敏方法
数据脱敏的方法很多,按处理方式大致可分为静态脱敏、动态脱敏、不落地脱敏三大类。
1. 静态脱敏
静态脱敏是指在数据离开生产环境之前,先对敏感数据进行一次性处理,生成一份脱敏后的数据副本。常用于开发测试、数据分析、数据外发等场景。
常见静态脱敏技术包括:
- 替换:用固定值或随机值替换敏感内容。例如把所有手机号统一替换成“13800138000”。
- 遮蔽/掩码:只保留部分信息,其余用星号或其他符号遮挡。例如身份证显示为“110**********1234”。
- 截断:只保留数据的一部分。例如只保留邮箱的域名部分。
- 加密:用对称加密或非对称加密对数据加密,只有授权方才能解密。
- 哈希:把数据映射为固定长度的摘要,常用于密码、指纹等不可逆场景。
- 泛化:把具体值替换为范围值。例如把年龄“28 岁”替换为“25-30 岁”。
- 洗牌/重排:打乱原有数据的对应关系,保持统计分布但破坏个体对应。
- 合成数据:用算法生成与真实数据统计特征相似的假数据,替代真实数据。
2. 动态脱敏
动态脱敏是指数据本身不变,在用户查询或访问时,根据用户身份、权限、场景实时对结果进行脱敏。
比如同一个客户信息表:
- 客服人员查询时,能看到完整的联系方式;
- 数据分析人员查询时,手机号被掩码处理;
- 外部合作方查询时,只能看到脱敏后的统计结果。
动态脱敏的优势是同一份数据可以服务不同角色,不需要维护多份副本。常用于数据库查询、API 接口、BI 报表等场景。
常用工具有数据库代理网关、API 网关、数据安全平台等。
3. 不落地脱敏
不落地脱敏是指数据在流转过程中直接处理,不落地到中间存储。比如数据从 A 系统同步到 B 系统时,经过脱敏网关实时处理,B 系统只保存脱敏后的数据。
这种方式减少了敏感数据在多个地方落地的风险,适合跨系统数据交换、数据共享平台等场景。
四、脱敏不是简单地“打码”
很多企业做脱敏时容易犯几个错误:
错误一:以为掩码就安全了
把“张三”显示成“张*”,把手机号显示成“138****8888”,确实能降低直接识别的风险,但如果结合其他字段,比如性别、地区、职业、年龄,攻击者仍可能通过关联分析还原出真实身份。
错误二:脱敏后数据还能反推
例如用简单的替换规则,把所有人名按字典顺序替换为“用户 A”“用户 B”“用户 C”,虽然看不出真实姓名,但只要知道替换规则,或者通过其他公开渠道对照,仍然可能反推。
错误三:只脱敏一处,忽略其他副本
数据在企业里往往有多个副本:生产库、测试库、备份、日志、报表、Excel 文件。如果只脱敏了其中一个,其他副本仍是风险点。
错误四:脱敏影响业务可用性
过度脱敏会导致数据无法使用。例如把所有地址都替换为“北京市”,统计分析就无法按区县细分;把所有金额都泛化为“0-100 万”,风控模型就失去了精度。
因此,脱敏方案必须根据使用目的、风险等级、合规要求量身定制,而不是一刀切。
五、企业如何落地数据脱敏
数据脱敏的落地,本质上是一个涉及制度、流程、技术和人员的系统工程。
第一步:识别敏感数据
先回答三个问题:
- 企业有哪些数据?
- 其中哪些属于敏感数据?
- 敏感程度如何分级?
可以通过数据资产盘点、数据分类分级来完成。国家相关标准如 GB/T 35273《信息安全技术 个人信息安全规范》、GB/T 37988《信息安全技术 数据安全能力成熟度模型》都提供了分类分级的参考。
第二步:明确脱敏场景和策略
不同场景需要不同的脱敏策略。例如:
| 使用场景 | 脱敏目标 | 常用方法 |
|---|---|---|
| 开发测试 | 防止真实数据泄露 | 静态脱敏、合成数据 |
| 数据分析 | 保护个体隐私,保留统计特征 | 泛化、聚合、差分隐私 |
| 对外展示 | 防止直接识别 | 掩码、截断、替换 |
| 数据共享 | 满足最小必要原则 | 字段级脱敏、动态脱敏 |
| 生产环境 | 按角色控制可见内容 | 动态脱敏、权限控制 |
第三步:选择合适的技术工具
企业可以根据自身情况选择:
- 数据库自带脱敏功能:如 Oracle Data Redaction、SQL Server Dynamic Data Masking;
- 专业脱敏软件:如 Informatica Persistent Data Masking、IBM InfoSphere Optim、绿盟、启明星辰等国产数据安全产品;
- 自研脱敏组件:对特定字段、特定业务规则进行定制化处理;
- 数据安全平台:集成分类分级、脱敏、审计、加密、水印等多种能力。
第四步:建立流程和审计机制
脱敏不是一次性的技术操作,而需要持续管理。要建立:
- 数据申请和审批流程;
- 脱敏规则版本管理;
- 脱敏效果验证机制;
- 数据使用审计日志;
- 定期风险评估和策略更新。
六、脱敏与加密、匿名化的区别
很多人把脱敏、加密、匿名化混为一谈,其实它们有本质区别。
加密:数据本身被转换成密文,授权方可以通过密钥还原。它的重点是“谁能看”,而不是“能不能看”。
脱敏:数据被处理后通常不可逆,或者只在特定规则下可逆。重点是“降低敏感程度”。
匿名化:让数据无法再识别到具体个人。匿名化是脱敏的一种高阶形态,要求更严格。根据《个人信息保护法》,匿名化后的信息不再属于个人信息。
去标识化:移除或替换可直接识别个人身份的信息,但保留间接识别可能性。去标识化后的数据在某些条件下仍可能重新识别。
企业在选择技术方案时,应清楚自己需要的是哪一种保护级别。
七、几个行业的脱敏实践
金融行业
银行、保险、证券企业需要保护客户账户、交易记录、征信信息。常见做法是对开发测试环境使用静态脱敏,对客服、风控等岗位使用动态脱敏,对外报送使用聚合统计结果。
医疗行业
医院、药企、医保机构需要保护患者病历、诊断、用药、基因信息。临床研究中常用患者 ID 重编码、出生日期泛化、地址模糊化等方式,既保护隐私,又保留研究价值。
政务行业
政府部门需要保护公民个人信息、案件信息、涉密资料。政务数据共享平台通常采用分类分级、字段级脱敏、使用审计、水印追踪等多重手段。
互联网和零售
电商、社交平台需要保护用户账号、行为数据、交易数据。除了脱敏,还常用差分隐私、联邦学习等技术,在不暴露个体数据的前提下完成模型训练。
八、写在最后
数据脱敏不是“打个码”那么简单,也不是买一款软件就能一劳永逸。它是数据安全治理的重要组成部分,需要结合企业数据现状、业务场景、合规要求、技术能力来系统设计。
企业在落地脱敏时,要记住几个关键原则:
- 按需脱敏:不同场景用不同策略;
- 最小可用:只给必要的人看必要的数据;
- 全链路覆盖:不仅脱敏生产数据,还要关注测试、备份、日志、外发等所有环节;
- 持续运营:脱敏策略要随着业务变化和法规更新不断优化。
关于我们
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
