一句话:这一章讲"数据从生到死的全过程"——从外面采进来、洗干净、存起来、治理好、变成资产、分析出价值,全程还得脱敏和分级防止泄露。 它是第 1~8 章里最"时髦"的一章(数据仓库、数据资产、数据要素、数据分类分级都在这),也是近年第 3 版改动最大的一章。考试以选择题为主(一般 3-6 分),偶尔…
数据采集是"把数据弄进来",预处理是"把弄进来的脏数据洗干净"——洗完的数据要达到准确、完整、一致、唯一、适时、有效。
这一节就回答三个问题:数据放哪儿(存储介质与形式)、放不下了怎么挪(归档)、弄丢了怎么救(备份与容灾)。
数据治理就是给数据立规矩、编目录、查质量、建模型,让组织里每个人都知道"有什么数据、在哪、什么意思、能不能信"。
这一节讲怎么把一堆原始数据,沉淀成能反复用、能对外服务、还能当资产估值的数据仓库和数据资产。
这一节讲怎么把分散的数据合到一块(集成)、从中挖出规律(挖掘)、包装成服务给人用(数据服务)、画成图让人看懂(可视化)。
数据要共享就得先"卸妆"——把能认出人的信息模糊化(脱敏);同时给数据分门别类、定级定密,重要的多护一层。
6.7 本章练习 > 教材原题见 P270(5 道选择题 + 5 道思考题,思考题答案教材标注为"略")。以下为知识库自编自测 10 题,覆盖本章全部高频考点,建议闭卷做完再对答案。 教材原题速览 | 题号 | 考点 | 答案 | |---|---|---| | 1 | 不属于数据预处理促成因素 →…
一句话:这一章讲"数据从生到死的全过程"——从外面采进来、洗干净、存起来、治理好、变成资产、分析出价值,全程还得脱敏和分级防止泄露。
它是第 1~8 章里最"时髦"的一章(数据仓库、数据资产、数据要素、数据分类分级都在这),也是近年第 3 版改动最大的一章。考试以选择题为主(一般 3-6 分),偶尔在案例题里作为背景("某政务数据平台存在哪些数据治理问题")。
记住一条主线就够:采集 → 预处理 → 存储 → 治理建模 → 仓库/资产 → 分析应用 → 脱敏分级。
一句话串起来:先把数据弄进来洗干净(6.1),找个可靠地方存好并保证丢了能恢复(6.2),再用元数据、标准和模型把它管明白(6.3),沉淀成数据仓库和数据资产(6.4),通过分析挖掘出价值(6.5),全程用脱敏和分类分级守住安全底线(6.6)。
| 节 | 一句话 | 重要度 | 常考题型 |
|---|---|---|---|
| 6.1 数据采集和预处理 | 三类数据、四种采集方法、五类脏数据怎么洗 | 高 | 选择 |
| 6.2 数据存储及管理 | 存储介质/形式、归档、三种备份策略、RPO 与 RTO | 极高 | 选择 |
| 6.3 数据治理和建模 | 元数据、标准化四阶段、数据质量指标、三类数据模型 | 极高 | 选择 |
| 6.4 数据仓库和数据资产 | 数据仓库四组件、主题库三层、资源化与资产化、三个目录 | 高 | 选择 |
| 6.5 数据分析及应用 | 数据集成方法、挖掘五任务五流程、可视化七类 | 高 | 选择 |
| 6.6 数据脱敏和分类分级 | 脱敏方式/原则、五级密级、一般/重要/核心数据 | 高 | 选择 |
| 6.7 本章练习 | 自测 | — | — |