数据挖掘第三版第六章课后习题答案

3.1数据质量可以从多方面评估,包括准确性、完整性和一致性问题。对于以上每个问题,讨论数据质量的评估如何依赖数据的应用目的,给出例子。提出数据质量的其他两个尺度。 答:精确性:描述数据是否与其对应的客观实体的特征相一致。

完整性:描述数据是否存在缺失记录或缺失字段。

一致性:描述同一实体的同一属性的值在不同的系统或数据集中是否一致。

数据质量依赖于数据的应用。对于给定的数据库,两个不同的用户可能有完全不同的评估。例如,市场分析人员可能访问公司的销售事务数据库(该数据库里面并非是所有的顾客信息都是可以得到的。其他数据没有包含在内,可能只是因为输入时认为是不重要的,相关的数据没有记录可能是由于理解错误,或者因为设备故障),得到顾客地址的列表。有些地址已经过时或不正确,但毕竟还有80%的地址是正确的。市场分析人员考虑到对于目标市场营销而言,这是一个大型顾客数据库,因此对该数据库的准确性还算满意,尽管作为销售的经理,你发现数据是不正确的。

另外两种度量尺度:有效性:描述数据是否满足用户定义的条件或在一定的域值范围内。

唯一性:描述数据是否存在重复记录。

3.3在习题2.2中,属性age 包括如下值(以递增序):13、15、16、16、19、20、20、21、22、22、22、25、25、25、25、30、33、33、35、35、35、35、36、40、45、46、52、70 (a)使用深度为3的箱,用箱均值光滑以上数据。说明你的步骤,讨论这种技术对给定数据的效果。

答:划分为(等频的)箱:

箱1:13、15、16、16、19、20、20、21、22

箱2:22、25、25、25、25、30、33、33、35

箱3:35、35、35、36、40、45、46、52、70

用箱均值光滑:

箱1:18、18、18、18、18、18、18、18、18

箱2:28.1、28.1、28.1、28.1、28.1、28.1、28.1、28.1、28.1

箱3:43.78、43.78、43.78、43.78、43.78、43.78、43.7843.78、43.78、43.78

分箱方法通过考察数据的“近邻”来光滑有序数据值,进而去掉“噪声”,即去掉被测量的变量的随机误差或方差。

(b)如何确定该数据的离群点?

答:可以通过聚类来检测离群点。即将类似的值组织成群或“簇”,直观地,落在簇集合之外的值被视为离群点。

(c)还有什么方法来光滑数据?

答:另外的方法是回归:用函数拟合数据来光滑数据。这种技术被称为回归。线性回归涉及找出拟合两个属性(或变量)的“最佳”直线,使得一个属性可以用来预测另一个。

3.5如下规范化方法的值域是什么?

(a)最小-最大规范化

答:[new_min, new_max]

(b)Z分数规范化

答:[(old_min-mean)/σ,(old_max-mean)/σ]

(c)Z分数规范化,使用均值绝对偏差而不是标准差、

答:(-∞,+∞)

(d)小数定标规范化

答:(-1.0,1.0)

3.7使用习题3.3给出的age 数据,回答以下问题:

(a)使用最小-最大规范化将age 值35变换到[0.0,1.0]区间。 答:35-13/70-13=0.3860

(b)使用z 分数规范化变换age 值35,其中age 的标准差为12.94岁。 答:均值为

29.67857

计算得0.4112

(c)使用小数定标规范化变换age 值35

答:0.35

(d)指出对于给定的数据,你愿意使用哪种方法。陈述你的理由。 答:我更喜欢用z 分数规范化,因为z 分数不受离群点影响

3.9假设12个销售价格记录已经排序,如下所示:

5, 10, 11, 13, 15, 35, 50, 55, 72, 92, 204, 215

使用如下个方法将它们划分成三个箱。

(a)等频(等深)划分

箱1:5,10,11, ,13

箱2:15,35,50,55

箱3:72,92,204,215

(b)等宽划分

箱1:5,10,11,13,15,35,50

箱2:55,72,92

箱3:204,215

3.1数据质量可以从多方面评估,包括准确性、完整性和一致性问题。对于以上每个问题,讨论数据质量的评估如何依赖数据的应用目的,给出例子。提出数据质量的其他两个尺度。 答:精确性:描述数据是否与其对应的客观实体的特征相一致。

完整性:描述数据是否存在缺失记录或缺失字段。

一致性:描述同一实体的同一属性的值在不同的系统或数据集中是否一致。

数据质量依赖于数据的应用。对于给定的数据库,两个不同的用户可能有完全不同的评估。例如,市场分析人员可能访问公司的销售事务数据库(该数据库里面并非是所有的顾客信息都是可以得到的。其他数据没有包含在内,可能只是因为输入时认为是不重要的,相关的数据没有记录可能是由于理解错误,或者因为设备故障),得到顾客地址的列表。有些地址已经过时或不正确,但毕竟还有80%的地址是正确的。市场分析人员考虑到对于目标市场营销而言,这是一个大型顾客数据库,因此对该数据库的准确性还算满意,尽管作为销售的经理,你发现数据是不正确的。

另外两种度量尺度:有效性:描述数据是否满足用户定义的条件或在一定的域值范围内。

唯一性:描述数据是否存在重复记录。

3.3在习题2.2中,属性age 包括如下值(以递增序):13、15、16、16、19、20、20、21、22、22、22、25、25、25、25、30、33、33、35、35、35、35、36、40、45、46、52、70 (a)使用深度为3的箱,用箱均值光滑以上数据。说明你的步骤,讨论这种技术对给定数据的效果。

答:划分为(等频的)箱:

箱1:13、15、16、16、19、20、20、21、22

箱2:22、25、25、25、25、30、33、33、35

箱3:35、35、35、36、40、45、46、52、70

用箱均值光滑:

箱1:18、18、18、18、18、18、18、18、18

箱2:28.1、28.1、28.1、28.1、28.1、28.1、28.1、28.1、28.1

箱3:43.78、43.78、43.78、43.78、43.78、43.78、43.7843.78、43.78、43.78

分箱方法通过考察数据的“近邻”来光滑有序数据值,进而去掉“噪声”,即去掉被测量的变量的随机误差或方差。

(b)如何确定该数据的离群点?

答:可以通过聚类来检测离群点。即将类似的值组织成群或“簇”,直观地,落在簇集合之外的值被视为离群点。

(c)还有什么方法来光滑数据?

答:另外的方法是回归:用函数拟合数据来光滑数据。这种技术被称为回归。线性回归涉及找出拟合两个属性(或变量)的“最佳”直线,使得一个属性可以用来预测另一个。

3.5如下规范化方法的值域是什么?

(a)最小-最大规范化

答:[new_min, new_max]

(b)Z分数规范化

答:[(old_min-mean)/σ,(old_max-mean)/σ]

(c)Z分数规范化,使用均值绝对偏差而不是标准差、

答:(-∞,+∞)

(d)小数定标规范化

答:(-1.0,1.0)

3.7使用习题3.3给出的age 数据,回答以下问题:

(a)使用最小-最大规范化将age 值35变换到[0.0,1.0]区间。 答:35-13/70-13=0.3860

(b)使用z 分数规范化变换age 值35,其中age 的标准差为12.94岁。 答:均值为

29.67857

计算得0.4112

(c)使用小数定标规范化变换age 值35

答:0.35

(d)指出对于给定的数据,你愿意使用哪种方法。陈述你的理由。 答:我更喜欢用z 分数规范化,因为z 分数不受离群点影响

3.9假设12个销售价格记录已经排序,如下所示:

5, 10, 11, 13, 15, 35, 50, 55, 72, 92, 204, 215

使用如下个方法将它们划分成三个箱。

(a)等频(等深)划分

箱1:5,10,11, ,13

箱2:15,35,50,55

箱3:72,92,204,215

(b)等宽划分

箱1:5,10,11,13,15,35,50

箱2:55,72,92

箱3:204,215


相关文章

  • 大学几乎所有学科的课本答案[2]
  • 大学几乎所有学科的课本答案! 来源: 任明嘉的日志 经济金融 [PDF格式]<会计学原理>同步练习题答案 [Word格式]<成本会计>习题及答案(自学推荐,23页) [Word格式]<成本会计>配套习题集 ...查看


  • 大学计算机基础课后习题详细答案
  • 第一章课后习题参考答案 一.填空题 1. 处理.处理 2. 黑盒.程序 3. 输入设备.运算器.存储器.控制器.输出设备 4. 运算器.控制器.中央处理器 5. 存储器.数据 6. 计算机硬件.软件 7. 电子管.晶体管.集成电路.超大规模 ...查看


  • 在大学里寻找课后答案的必去之处
  • 3500份课后答案,很值得收藏,这里只介绍了一部分. 还有很多,可以去课后答案网(http://www.khdaw.com/bbs)查找. ##################[公共基础课-答案]#################### 新 ...查看


  • 数据库原理及应用教程第3版课后题答案
  • 第一章习题参考答案 一.选择题 1. C 2. B 3. D 4. C 5. D 6. A 7. A 8. B 9. D 10. B 11. C 12. D 13. A 14. D 15. B 16. C 17. D 18. A 19. D ...查看


  • Access 2010数据库应用基础教程课后习题答案
  • 第1章 1. 数据库(Database,DB) 就是数据的集合,例如,日常生活中,我们用笔记本记录亲朋好友的联系方式,将他们的姓名.地址.电话等信息都记录下来.这个"通讯录"就是一个最简单的"数据库" ...查看


  • 大学课后题答案
  • 不用买参考书了!大学课本答案大全!--爱死你了!( 为什么大四才发现啊) 2008-12-18 16:50 | (分类:) 注册可用 公共课程 http://www.10xiao.com/forum-6-1.html 新视野大学英语读写教程 ...查看


  • 计算机组成原理第五版课后习题答案
  • 计算机组成原理 第一章 4. 冯. 诺依曼型的计算机的主要设计思想是什么?它包括哪些主要组成部分? 答:设计思想为:数字计算机的数制采用二进制:计算机应该按照程序顺序执行.主要组成部分有:运算器.控制器.存储器.输入和输出设备. 5什么是存 ...查看


  • 数据库系统课后习题及答案
  • 数据库系统课后习题及答案 第1章 绪论 习题参考答案 1.试述数据.数据库.数据库管理系统.数据库系统的概念.(3.4.5页) 答:描述事物的符号记录称为数据:数据库是长期储存在计算机内的.有组织的.可共享的数据集合:数据库管理系统是位于用 ...查看


  • 大学课本答案大全
  • 不用买参考书了!大学课本答案大全! 公共课程 http://www.10xiao.com/forum-6-1.html 新视野大学英语读写教程第四册答案 http://www.10xiao.com/thread-7-1-1.html 新视野 ...查看


热门内容