海天雷鹰印章海天雷鹰
ARTICLE行业洞察

数据脱敏到底是什么?要怎么做到脱敏?

发布日期

  随着《数据安全法》《个人信息保护法》《网络数据安全管理条例》相继落地,“数据脱敏”这个词在企业 IT 部门、法务部门和数据团队里出现的频率越来越高。但很多人对脱敏的理解还停留在“把手机号中间几位换成星号”这个层面。实际上,数据脱敏是一套系统的数据保护技术,目标是在保证数据可用性的前提下,尽可能降低敏感信息泄露的风险。这篇文章我们就把数据脱敏讲清楚:它到底是什么?有哪些常用方法?企业又该如何落地?


  一、数据脱敏的定义与核心目标

  数据脱敏,英文叫 Data Masking 或 Data Desensitization,是指对敏感数据进行处理,使其在特定使用场景下不再能直接识别到具体个人或泄露核心机密,同时尽量保持数据本身的格式和可用性

  简单说,脱敏要做到两件事:

  • 防泄露:让未经授权的人看不到真实敏感信息;
  • 仍可用:让拿到数据的人能继续用于开发、测试、分析、展示等合法用途。

  数据脱敏的核心目标是找到一个平衡点:安全与可用之间的平衡。脱敏过度,数据失去价值;脱敏不足,隐私和安全风险仍在。


  二、哪些数据需要脱敏

  并不是所有数据都需要脱敏。通常需要脱敏的数据包括以下几类:

  1. 个人身份信息

  姓名、身份证号、护照号、手机号、电子邮箱、家庭住址、车牌号等。

  2. 金融账户信息

  银行卡号、信用卡号、支付账号、交易流水、账户余额等。

  3. 生物识别信息

  人脸照片、指纹、虹膜、声纹、基因数据等。

  4. 医疗健康信息

  病历、诊断结果、体检报告、医保信息等。

  5. 企业核心商业信息

  客户名单、供应商信息、合同金额、核心技术参数、战略计划等。

  6. 政务敏感信息

  干部档案、案件信息、执法记录、公民办事记录等。

  判断是否需要脱敏,关键看两个维度:一是数据本身是否敏感,二是使用场景是否存在泄露风险。同一份数据,在内部生产环境可能不需要脱敏,但发给外包团队或用于公开演示时就必须脱敏。


  三、常见的数据脱敏方法

  数据脱敏的方法很多,按处理方式大致可分为静态脱敏、动态脱敏、不落地脱敏三大类。

  1. 静态脱敏

  静态脱敏是指在数据离开生产环境之前,先对敏感数据进行一次性处理,生成一份脱敏后的数据副本。常用于开发测试、数据分析、数据外发等场景。

  常见静态脱敏技术包括:

  • 替换:用固定值或随机值替换敏感内容。例如把所有手机号统一替换成“13800138000”。
  • 遮蔽/掩码:只保留部分信息,其余用星号或其他符号遮挡。例如身份证显示为“110**********1234”。
  • 截断:只保留数据的一部分。例如只保留邮箱的域名部分。
  • 加密:用对称加密或非对称加密对数据加密,只有授权方才能解密。
  • 哈希:把数据映射为固定长度的摘要,常用于密码、指纹等不可逆场景。
  • 泛化:把具体值替换为范围值。例如把年龄“28 岁”替换为“25-30 岁”。
  • 洗牌/重排:打乱原有数据的对应关系,保持统计分布但破坏个体对应。
  • 合成数据:用算法生成与真实数据统计特征相似的假数据,替代真实数据。

  2. 动态脱敏

  动态脱敏是指数据本身不变,在用户查询或访问时,根据用户身份、权限、场景实时对结果进行脱敏。

  比如同一个客户信息表:

  • 客服人员查询时,能看到完整的联系方式;
  • 数据分析人员查询时,手机号被掩码处理;
  • 外部合作方查询时,只能看到脱敏后的统计结果。

  动态脱敏的优势是同一份数据可以服务不同角色,不需要维护多份副本。常用于数据库查询、API 接口、BI 报表等场景。

  常用工具有数据库代理网关、API 网关、数据安全平台等。

  3. 不落地脱敏

  不落地脱敏是指数据在流转过程中直接处理,不落地到中间存储。比如数据从 A 系统同步到 B 系统时,经过脱敏网关实时处理,B 系统只保存脱敏后的数据。

  这种方式减少了敏感数据在多个地方落地的风险,适合跨系统数据交换、数据共享平台等场景。


  四、脱敏不是简单地“打码”

  很多企业做脱敏时容易犯几个错误:

  错误一:以为掩码就安全了

  把“张三”显示成“张*”,把手机号显示成“138****8888”,确实能降低直接识别的风险,但如果结合其他字段,比如性别、地区、职业、年龄,攻击者仍可能通过关联分析还原出真实身份。

  错误二:脱敏后数据还能反推

  例如用简单的替换规则,把所有人名按字典顺序替换为“用户 A”“用户 B”“用户 C”,虽然看不出真实姓名,但只要知道替换规则,或者通过其他公开渠道对照,仍然可能反推。

  错误三:只脱敏一处,忽略其他副本

  数据在企业里往往有多个副本:生产库、测试库、备份、日志、报表、Excel 文件。如果只脱敏了其中一个,其他副本仍是风险点。

  错误四:脱敏影响业务可用性

  过度脱敏会导致数据无法使用。例如把所有地址都替换为“北京市”,统计分析就无法按区县细分;把所有金额都泛化为“0-100 万”,风控模型就失去了精度。

  因此,脱敏方案必须根据使用目的、风险等级、合规要求量身定制,而不是一刀切。


  五、企业如何落地数据脱敏

  数据脱敏的落地,本质上是一个涉及制度、流程、技术和人员的系统工程。

  第一步:识别敏感数据

  先回答三个问题:

  • 企业有哪些数据?
  • 其中哪些属于敏感数据?
  • 敏感程度如何分级?

  可以通过数据资产盘点、数据分类分级来完成。国家相关标准如 GB/T 35273《信息安全技术 个人信息安全规范》、GB/T 37988《信息安全技术 数据安全能力成熟度模型》都提供了分类分级的参考。

  第二步:明确脱敏场景和策略

  不同场景需要不同的脱敏策略。例如:

使用场景脱敏目标常用方法
开发测试防止真实数据泄露静态脱敏、合成数据
数据分析保护个体隐私,保留统计特征泛化、聚合、差分隐私
对外展示防止直接识别掩码、截断、替换
数据共享满足最小必要原则字段级脱敏、动态脱敏
生产环境按角色控制可见内容动态脱敏、权限控制

  第三步:选择合适的技术工具

  企业可以根据自身情况选择:

  • 数据库自带脱敏功能:如 Oracle Data Redaction、SQL Server Dynamic Data Masking;
  • 专业脱敏软件:如 Informatica Persistent Data Masking、IBM InfoSphere Optim、绿盟、启明星辰等国产数据安全产品;
  • 自研脱敏组件:对特定字段、特定业务规则进行定制化处理;
  • 数据安全平台:集成分类分级、脱敏、审计、加密、水印等多种能力。

  第四步:建立流程和审计机制

  脱敏不是一次性的技术操作,而需要持续管理。要建立:

  • 数据申请和审批流程;
  • 脱敏规则版本管理;
  • 脱敏效果验证机制;
  • 数据使用审计日志;
  • 定期风险评估和策略更新。
26_数据脱敏_方法

  六、脱敏与加密、匿名化的区别

  很多人把脱敏、加密、匿名化混为一谈,其实它们有本质区别。

  加密:数据本身被转换成密文,授权方可以通过密钥还原。它的重点是“谁能看”,而不是“能不能看”。

  脱敏:数据被处理后通常不可逆,或者只在特定规则下可逆。重点是“降低敏感程度”。

  匿名化:让数据无法再识别到具体个人。匿名化是脱敏的一种高阶形态,要求更严格。根据《个人信息保护法》,匿名化后的信息不再属于个人信息。

  去标识化:移除或替换可直接识别个人身份的信息,但保留间接识别可能性。去标识化后的数据在某些条件下仍可能重新识别。

  企业在选择技术方案时,应清楚自己需要的是哪一种保护级别。


  七、几个行业的脱敏实践

  金融行业

  银行、保险、证券企业需要保护客户账户、交易记录、征信信息。常见做法是对开发测试环境使用静态脱敏,对客服、风控等岗位使用动态脱敏,对外报送使用聚合统计结果。

  医疗行业

  医院、药企、医保机构需要保护患者病历、诊断、用药、基因信息。临床研究中常用患者 ID 重编码、出生日期泛化、地址模糊化等方式,既保护隐私,又保留研究价值。

  政务行业

  政府部门需要保护公民个人信息、案件信息、涉密资料。政务数据共享平台通常采用分类分级、字段级脱敏、使用审计、水印追踪等多重手段。

  互联网和零售

  电商、社交平台需要保护用户账号、行为数据、交易数据。除了脱敏,还常用差分隐私、联邦学习等技术,在不暴露个体数据的前提下完成模型训练。


  八、写在最后

  数据脱敏不是“打个码”那么简单,也不是买一款软件就能一劳永逸。它是数据安全治理的重要组成部分,需要结合企业数据现状、业务场景、合规要求、技术能力来系统设计。

  企业在落地脱敏时,要记住几个关键原则:

  • 按需脱敏:不同场景用不同策略;
  • 最小可用:只给必要的人看必要的数据;
  • 全链路覆盖:不仅脱敏生产数据,还要关注测试、备份、日志、外发等所有环节;
  • 持续运营:脱敏策略要随着业务变化和法规更新不断优化。

  关于我们

  公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。

  累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。

  如果您有档案数字化、试题录入、数据标注方面的需求,欢迎联系我们:


  本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。