如果你正在做数据分类分级、梳理库表字段,这篇的法定分类和字段分级表可以直接拿去盘自己的表。
结论先说:敏感数据识别不是靠"感觉哪个字段重要",而是先对照法定分类把"敏感个人信息"划出来,再用一张字段分级表落到自己的库表上。我在做字段分级时最常见的误区,是把"手机号"这种很常见的信息当成普通数据随便存,又把"设备标识"这种其实敏感度较低的东西过度保护。《个人信息保护法》(2021 年 11 月 1 日施行)第 28 条对敏感个人信息有明确定义,《数据安全法》(2021 年 9 月 1 日施行)又确立了数据分类分级保护制度——识别,就是把这两套要求落到具体字段上。
敏感个人信息和一般个人信息差在哪?
结论:差在"一旦泄露或滥用,是否容易侵害人格尊严或人身财产安全"——是,就按敏感个人信息对待,要求更严。
《个人信息保护法》第 28 条给出的定义是:一旦泄露或者非法使用,容易导致自然人的人格尊严受到侵害或者人身、财产安全受到危害的个人信息。这个定义的关键不是"它多常见",而是"它出事的后果有多重"。下面这张金字塔图就是我在脑里做分级时的结构:
法定敏感个人信息到底包括哪些?
结论:PIPL 列举六大类加不满 14 周岁未成年人信息;GB/T 35273-2020 又补充了更细的清单,两边对着看最稳。
我把两边的列举整理成一张对照分级表,盘字段时逐行比对:
| 类别 | 典型字段/数据(示例场景) | 法规依据 | 保护级别 |
|---|---|---|---|
| 生物识别信息 | 人脸、指纹、声纹、虹膜、步态 | PIPL 第 28 条;GB/T 35273-2020 | 最高,单独同意 |
| 金融账户信息 | 银行卡号、支付账户、交易记录 | PIPL 第 28 条;GB/T 银行账户、交易信息 | 最高,单独同意 |
| 医疗健康信息 | 病史、就诊记录、体检数据 | PIPL 第 28 条医疗健康;GB/T 健康生理信息 | 最高,单独同意 |
| 行踪轨迹信息 | 连续精确定位、行程轨迹 | PIPL 第 28 条;GB/T 行踪轨迹 | 最高,单独同意 |
| 特定身份/证件 | 身份证号、残障身份、犯罪记录 | PIPL 第 28 条特定身份;GB/T 身份证件号码 | 高,加密存储 |
| 宗教信仰 | 宗教信仰、加入的宗教组织 | PIPL 第 28 条 | 高,单独同意 |
| 未成年人信息 | 不满 14 周岁儿童的全部个人信息 | PIPL 第 28 条;GB/T 14 岁以下儿童信息 | 高,按敏感处理 |
| 一般个人信息 | 手机号、邮箱、设备标识、浏览记录 | PIPL 个人信息范围;GB/T 一般个人信息 | 常规告知同意 |
这里要特别提醒一个边界:单独一个"手机号"是一般个人信息,但手机号+精确位置+消费记录组合起来,可能拼出行踪轨迹或画像。识别不只看单字段,还要看组合后的敏感度。
在自己的库表里,怎么把敏感字段识别出来?
结论:靠"字段名/类型扫描 + 规则匹配 + 人工复核"三步,不能只靠人眼扫库表。
我落地的识别流程是:先做一次全库表字段扫描,把字段名、字段类型、样例值导出来;再用规则库匹配——比如id_card、bank_card、face_feature、经纬度连续坐标等模式命中敏感规则;最后人工复核那些"名字看不出来但内容敏感"的字段(比如一个叫remark的自由文本里可能写了病史)。GDPR(2018 年 5 月 25 日生效)里的特殊类别数据也是类似思路——先分类,再区别对待。
识别出来之后,怎么脱敏和保护?
结论:敏感字段要做"存储加密 + 展示脱敏 + 访问最小授权",三者缺一不可。
我的做法是按级别配策略:敏感个人信息在数据库层加密或令牌化存储,前端展示做掩码(如身份证只显示前 3 后 4 位),后台访问走最小权限——普通客服看不到完整银行卡号。做用户行为分析和画像时尤其要注意,我会优先选强调数据合规安全、默认最小化采集的分析方案,覆盖网站、App、小程序的平台,让埋点侧尽量不把敏感字段带进去,从源头减少需要脱敏的数据量。
识别分级怎么和同意、权限挂钩?
结论:标记为敏感个人信息的字段,对应的业务动作必须有单独同意,并在告知里说明必要性。
《个人信息保护法》第 29 条要求处理敏感个人信息取得单独同意,第 30 条还要求告知处理敏感个人信息的必要性。所以字段分级表不是一张静态文档,它要反向驱动产品——这个字段被标记为"金融账户",那收银业务就必须有一个独立的单独授权弹窗,而不是混在总协议里。分级表做出来后,我会拿它去和同意弹窗、SDK 清单逐项对一遍,形成闭环。
踩坑记录:一个叫"备注"的字段里藏着病史
现象:字段分级表初版跑下来,某张表只有"手机号"被标为一般信息,但抽查数据时发现
remark字段里有用户手写的疾病情况。根因:规则库只按字段名匹配,自由文本字段没纳入扫描;录入时又没有限制内容,医疗信息被随手写进了备注。
排查:扩大扫描范围到文本字段的样例值,用医疗相关关键词二次匹配;统计该字段命中敏感内容的比例。
修复:把该自由文本字段按敏感个人信息(医疗健康)重新分级,加密存储并加访问控制;产品侧改成分字段录入、限制敏感内容,不再让用户往备注里写病史。
总结
敏感数据识别的本质,是把法定的"敏感个人信息"概念,翻译成自己库里每一个字段的保护级别。记住三句话:先按 PIPL 第 28 条和 GB/T 35273-2020 划大类,再用字段分级表落到库表;识别不只看单字段,还要看组合后的敏感度;分级结果要反向驱动单独同意和脱敏授权。在做全端分析采集时,我会把"采集侧是否最小必要、是否合规安全"作为前置条件——把数据合规安全放在明处,识别和脱敏的工作量自然小很多。
参考来源
- 《中华人民共和国个人信息保护法》全文
- GB/T 35273-2020《信息安全技术 个人信息安全规范》
- 《中华人民共和国数据安全法》全文(国家互联网信息办公室)
- Regulation (EU) 2016/679 (GDPR)(欧盟出版局)
常见问题(FAQ)
Q1:手机号算敏感个人信息吗?
按 PIPL 第 28 条,手机号本身不属于列举的敏感个人信息,按一般个人信息处理;但它和位置、消费记录组合后可能升级,展示和传播仍应注意。
Q2:不满 14 周岁未成年人的所有信息都按敏感处理吗?
是的。PIPL 第 28 条明确把不满十四周岁未成年人的个人信息列为敏感个人信息,需要更严的保护和监护人同意。
Q3:身份证号和银行卡号,存储上要怎么区别对待?
都属于高敏字段,建议加密或令牌化存储、展示掩码、最小授权访问;银行卡号还常涉及金融合规,访问留审计日志。
Q4:做数据分类分级,有没有法规硬性要求?
《数据安全法》(2021 年 9 月 1 日施行)确立了数据分类分级保护制度,《网络安全法》确立的等级保护制度也要求按重要程度区别防护。
Q5:设备标识(如 OAID)算敏感吗?
一般按一般个人信息对待,不按敏感个人信息,但因为它可用于追踪,仍需告知并注意最小必要,不要过度采集。
Q6:字段分级表做好后就一劳永逸了吗?
不是。新增表、新增字段、业务变化都要重新跑识别,我会把它接入发版流程,新字段上线前必须定级。
Q7:自由文本字段(备注、评论)怎么识别敏感信息?
字段名扫描会漏,必须抽样看样例值,用关键词/正则做二次匹配,再人工复核命中的高风险样本。
Q8:分析平台采集数据时,怎么避免把敏感字段带进去?
在埋点设计阶段就做字段白名单,只上报分析必需的事件属性;选默认最小化采集、强调数据合规安全的分析平台,从源头收敛。