6.5 数据分析及应用
一句话讲明白
这一节讲怎么把分散的数据合到一块(集成)、从中挖出规律(挖掘)、包装成服务给人用(数据服务)、画成图让人看懂(可视化)。
生活类比
超市经营:
- 数据集成 = 把收银系统、会员系统、供应商系统的数据拼到一张"统一视图"上,而不是每个系统各查各的。
- 数据挖掘 = 从几百万张小票里发现"买啤酒的人常常也买尿布"(关联分析)、把顾客分成几类(聚类)、预测某个客户会不会流失(分类与预测)、揪出异常刷卡(孤立点分析)。
- 数据服务 = 给店长一个能查、能看、能下载的看板。
- 可视化 = 把枯燥的数字变成柱状图、热力图、趋势线,一眼看出问题。
正经定义
数据集成就是将驻留在不同数据源中的数据进行整合,向用户提供统一的数据视图,使用户能以透明的方式访问数据。目标是充分利用已有数据,在尽量保持其自治性的前提下维护数据源整体上的一致性,提高数据共享利用效率。
数据挖掘是指从大量数据中提取或"挖掘"知识,即从大量的、不完全的、有噪声的、模糊的、随机的实际数据中,提取隐含在其中的、人们不知道的、却是潜在有用的知识。
拆解与流程
一、数据集成
数据源具有存储位置分散、数据类型异构、数据库产品多样的特点。
三种集成方法:
| 方法 | 做法 |
|---|---|
| 模式集成(虚拟视图方法) | 最早采用,也是其他方法的基础;把各数据源共享的视图集成为全局模式,用户透明访问,集成系统把请求转换到本地视图执行 |
| 复制集成 | 把数据复制到其他数据源并维护整体一致性;可整体复制,也可只传播变化的数据,减少访问量、提高性能 |
| 混合集成 | 既保留虚拟视图,又提供复制;简单请求用复制,复杂请求用模式集成 |
四种数据访问接口标准:ODBC(业界广泛接受的数据库访问 API,基于 X/Open 和 ISO/IEC 调用接口规范,用 SQL 作访问语言,由应用程序接口、驱动程序管理器、驱动程序和数据源 4 个组件组成)、JDBC(执行 SQL 的 Java API)、OLE DB(基于 COM,能操作所有类型数据,甚至可离线存取)、ADO(应用层接口,可用于 VC/VB/Delphi 及 Web 开发,是常用的数据访问手段)。
Web Services 三要素:WSDL(服务描述,What/How/Where)、SOAP(消息传递协议,基于 XML)、UDDI(集中存放和查找 WSDL 描述文件,起目录服务器作用)。
数据网格技术:面向大型数据集的分布式管理与分析体系结构,四种透明性——分布透明性、异构透明性、数据位置透明性、数据访问方式透明性。
二、数据挖掘
与传统数据分析的 4 点不同:①数据量更大(数据越大效果越好);②方法上综合统计、人工智能、可视化;③传统分析是回顾型、验证型(已发生什么),挖掘是预测型、发现型;④成熟度上,传统分析相当成熟,挖掘部分方法仍在发展。
五大任务(必背):
| 任务 | 干什么 |
|---|---|
| 数据总结 | 对数据进行浓缩,给出总体综合描述(求和值、均值、方差、最大值、最小值,画直方图、散点图) |
| 关联分析 | 找出隐藏的关联网,描述一组数据项的密切度或关系,生成的规则带有置信度 |
| 分类和预测 | 用分类函数/分类模型(分类器)把数据分派到不同组,并预测新数据属于哪组 |
| 聚类分析 | 数据缺乏描述信息或无法组织成分类模型时使用;按相近程度度量分成若干子集合,集合内性质相近、集合间相差较大 |
| 孤立点分析 | 检测出与其他记录存在偏差的异常记录(离群点分析),偏差含大量潜在信息 |
数据挖掘流程 5 阶段:确定分析对象 → 数据准备(数据选择 + 数据预处理:清洗/集成/变换/归约)→ 数据挖掘(模型构建 + 挖掘处理)→ 结果评估 → 结果应用。参与人员:业务分析人员、数据挖掘人员、数据管理人员。
三、数据服务
三种:数据目录服务(快捷发现和定位所需数据资源,解决"不知道有哪些数据、不知道在哪、不知道怎么拿")、数据查询与浏览及下载服务(关键字检索定位数据集列表,获准后下载)、数据分发服务(核心内容是数据发布、数据发现、数据评价)。
四、数据可视化(7 类表现方式)
| 类型 | 说明 |
|---|---|
| 一维数据可视化 | 简单线性数据,如文本、数字表格、程序源代码 |
| 二维数据可视化 | 由两种主要描述属性构成,如宽度和高度、城市平面图、楼层平面图;最常见的是 GIS |
| 三维数据可视化 | 描述立体信息,构成计算机模型供操作与试验,预测实际行为 |
| 多维数据可视化 | 描述事物的属性超过三维,往往需要降维 |
| 时态数据可视化 | 二维的特例,其中一维是时间轴,是最常见最有用的方式之一 |
| 层次数据可视化 | 树形数据,每个节点(根节点除外)有一个父节点,如商业组织、计算机文件系统、家谱图 |
| 网络数据可视化 | 节点可与任意数量的其他节点有关系,没有固有层次结构,节点间可有多条连接路径 |
考试怎么考
- 题型:选择题。
- 教材原题:关于数据集成定义描述较准确的是 → D. 将驻留在不同数据源中的数据进行整合。
- 必背:三种集成方法、四种接口标准、Web Services 三要素、挖掘五大任务与五流程、可视化 7 类。
- 常见问法:
- "最早采用、也是其他方法基础的数据集成方法是?" → 模式集成(虚拟视图方法)
- "起目录服务器作用、集中存放 WSDL 的是?" → UDDI
- "'买啤酒的人常买尿布'属于?" → 关联分析
- "数据缺乏描述信息、无法组织成分类模型时应采用?" → 聚类分析
- "以时间轴为其中一维的可视化是?" → 时态数据可视化
- 陷阱词:把模式集成说成"复制数据"(复制集成才是);把 SOUP/WSDL 角色说反——WSDL 描述服务、SOAP 传消息、UDDI 做目录。
易混辨析
| 对比 | 传统数据分析 | 数据挖掘 |
|---|---|---|
| 数据量 | 较小 | 大,越大越好 |
| 方法 | 主要统计学 | 统计 + AI + 可视化 |
| 取向 | 回顾型、验证型(发生了什么) | 预测型、发现型(将发生什么、为什么) |
| 成熟度 | 相当成熟 | 部分方法仍在发展 |
| 对比 | 聚类分析 | 分类和预测 |
|---|---|---|
| 前提 | 没有现成类别、缺乏描述信息 | 已有类别/属性模型 |
| 做法 | 按相近程度分成子集合 | 用分类器把数据分派到已知组,并预测新数据 |
一秒记忆
"集 成 三 招:模 式、复 制、混 合;接 口 四 件:ODBC、JDBC、OLE DB、ADO;挖 掘 五 务:总 结、关 联、分 类、聚 类、孤 立 点;流 程 五 步:选 对 象、备 数 据、挖、评、用。"