6.6 数据脱敏和分类分级
一句话讲明白
数据要共享就得先"卸妆"——把能认出人的信息模糊化(脱敏);同时给数据分门别类、定级定密,重要的多护一层。
生活类比
医院把病历给科研机构做研究:
- 直接交原始病历 = 谁得了什么病全暴露,绝对不行。
- 脱敏 = 把"张三、身份证号、××小区 3 栋 501"改成"患者 A、1101*、××区",但*年龄分布、性别比例、病情分布这些统计特征必须保留,否则研究就没意义了。
- 还有个坑:如果某小区只有一户姓张,光凭"住址"就能反推出姓名 → 住址也得一起脱(规避融合风险)。
- 分类分级 = 先分门别类(个人信息、诊疗数据、财务数据),再定级(公开/内部/核心),不同级别用不同保护力度。
正经定义
数据脱敏是对各类数据所包含的自然人身份标识、用户基本资料等敏感信息进行模糊化、加扰、加密或转换后,形成无法识别、无法推算演绎、无法关联分析原始用户身份标识等的新数据,以便在非生产环境、非可控环境、生产环境、数据共享、数据发布等环境中安全地使用脱敏后的真实数据集。
拆解与流程
一、敏感数据与密级
敏感数据(隐私数据/敏感信息):不当使用或未经授权被接触或修改后,会产生不利于国家和组织的负面影响和利益损失,或不利于个人依法享有的个人隐私的所有信息。可分为个人敏感数据、商业敏感数据、国家秘密数据。
常见的敏感数据:姓名、身份证号码、地址、电话号码、银行账号、邮箱地址、所在城市、邮编、密码类(查询密码、取款密码、登录密码)、组织机构名称、营业执照号码、交易日期、交易金额等。
敏感程度五级(必背):L1 公开、L2 保密、L3 机密、L4 绝密、L5 私密。
二、脱敏方式
| 分类 | 说明 |
|---|---|
| 可恢复类 | 脱敏后可通过一定方式恢复成原数据,主要指各类加解密算法规则 |
| 不可恢复类 | 被脱敏部分用任何方式都不能恢复,一般分替换算法和生成算法两类 |
脱敏方式主要由应用场景决定。例如发布数据场景,既要考虑直接表示信息,又要考虑非表示信息,防止通过推算演绎、关联分析定位到用户身份。
三、六条脱敏原则(必背)
| 原则 | 一句话 |
|---|---|
| 算法不可逆原则 | 除特定场合的可恢复需求外,脱敏算法通常应不可逆,防止用非敏感数据推断、重建敏感原始数据 |
| 保持数据特征原则 | 脱敏后仍具原数据特征,数值分布范围、指定格式(如信用卡号前 4 位指代银行)、姓名字段符合语言认知,高要求时还要保持频率分布、字段唯一性 |
| 保留引用完整性原则 | 被脱敏字段若是主键,相关引用记录必须同步更改 |
| 规避融合风险原则 | 预判非敏感数据集多源融合的风险,对可能生成敏感数据的非敏感字段同样脱敏(例:为隐藏姓名与病情的对应关系改了姓名,若住址唯一可反推姓名,则住址也要改) |
| 脱敏过程自动化原则 | 脱敏必须在规则引导下自动化进行,才能达到可用性要求 |
| 脱敏结果可重复原则 | 某些场景下对同一字段每轮脱敏结果都相同或都不同,满足可测性、模型正确性、安全性要求 |
建设要点:建立脱敏制度与生产数据使用管理制度,明确敏感信息数据字典规范和生产数据申请、提取、安全预处理、使用、清理、销毁各环节流程。
四、数据分类
数据分类是根据内容的属性或特征,将数据按一定的原则和方法进行区分和归类,建立分类体系和排列顺序。两个要素:分类对象(若干被分类的实体)+ 分类依据(取决于对象的属性或特征)。
分类应以相对最稳定的本质属性为依据;对具有交叉、双重或多重本质属性的信息,还应符合交叉性、双重或多重性原则。数据处理者进行分类时应优先遵循国家、行业的分类要求,无行业规则时可从组织经营维度分类。
五、数据分级
数据分级是指按照数据遭到破坏(攻击、入侵、篡改、非法使用等)后对国家安全、社会秩序、公共利益以及公民、法人和其他组织的合法权益(受侵害客体)的危害程度,对数据进行定级,主要为数据全生命周期管理进行安全策略制定。
常用分级维度:按特性分级、基于价值(公开、内部、重要核心等)、基于敏感程度(公开、秘密、机密、绝密等)、基于司法影响范围(境内、跨区、跨境等)。
国家数据安全角度的基本框架(必背三级):一般数据、重要数据、核心数据。可在基本框架定级基础上,结合行业规则或组织需求,考虑影响对象、影响程度两个要素进行分级。
| 级别 | 国家安全 | 公共利益 | 个人合法权益 | 组织合法权益 |
|---|---|---|---|---|
| 核心数据 | 严重危害 | 一般危害、严重危害 | 严重危害 | 严重危害 |
| 重要数据 | 一般危害、严重危害 | 一般危害、严重危害 | 严重危害 | 严重危害 |
| 一般数据 | 无危害 | 无危害、轻微危害、一般危害 | 轻微危害、一般危害、严重危害 | 无危害、轻微危害、一般危害、严重危害 |
表格记忆只需抓住一条:核心数据一定涉及"国家安全严重危害";一般数据对国家安全"无危害",中间是重要数据。
考试怎么考
- 题型:选择题。
- 教材原题:属于常见敏感程度划分的是 → A. L1 公开、L2 保密、L3 机密、L4 绝密、L5 私密。
- 必背:密级五级 L1-L5;脱敏六原则;国家数据三级(一般/重要/核心)。
- 常见问法:
- "脱敏后主键变了,引用记录要不要改?" → 要,同步更改(保留引用完整性)
- "为隐藏姓名改了姓名,住址唯一可反推姓名怎么办?" → 住址一并脱敏(规避融合风险)
- "数据分级的两个考虑要素是?" → 影响对象、影响程度
- 陷阱词:把"脱敏算法通常应可逆"说对(错,通常不可逆);把数据分级依据说成"数据量的大小"(错,是遭到破坏后的危害程度)。
易混辨析
| 对比 | 数据分类 | 数据分级 |
|---|---|---|
| 依据 | 内容的属性或特征 | 遭到破坏后的危害程度 |
| 回答 | 这是什么类型的数据 | 这数据有多重要、该保护到什么程度 |
| 要素 | 分类对象 + 分类依据 | 影响对象 + 影响程度 |
| 对比 | 可恢复脱敏 | 不可恢复脱敏 |
|---|---|---|
| 典型手段 | 加解密算法规则 | 替换算法、生成算法 |
| 适用 | 特定需要还原的场合 | 发布、共享、开发测试等大多数场景 |
一秒记忆
"脱 敏 六 原 则:不 可 逆、保 特 征、留 引 用、避 融 合、自 动 化、可 重 复。密 级 五 级:公、保、机、绝、私;国 家 三 档:一 般、重 要、核 心。"