- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
3.1 数据质量可以从多方面评估,包括准确性、完整性和一致性问题。对于以上每个问题,讨论数据质量的评估如何依赖数据的应用目的,给出例子。提出数据质量的其他两个尺度。答:精确性:描述数据是否与其对应的客观实体的特征相一致。
完整性:描述数据是否存在缺失记录或缺失字段。
一致性:描述同一实体的同一属性的值在不同的系统或数据集中是否一致。
数据质量依赖于数据的应用。 对于给定的数据库, 两个不同的用户可能有完全不同的评
估。例如, 市场分析人员可能访问公司的销售事务数据库 (该数据库里面并非是所有的顾客
信息都是可以得到的。 其他数据没有包含在内, 可能只是因为输入时认为是不重要的, 相关
的数据没有记录可能是由于理解错误,或者因为设备故障), 得到顾客地址的列表。有些地
址已经过时或不正确,但毕竟还有 80%的地址是正确的。市场分析人员考虑到对于目标市
场营销而言, 这是一个大型顾客数据库, 因此对该数据库的准确性还算满意, 尽管作为销售
的经理,你发现数据是不正确的。
另外两种度量尺度: 有效性:描述数据是否满足用户定义的条件或在一定的域值范围内。唯一性:描述数据是否存在重复记录。
3.3 在习题 2.2 中,属性 age 包括如下值(以递增序): 13、 15、 16、 16、 19、20、 20、21、
22、 22、 22、 25、 25、 25、 25、30、 33、33、 35、 35、 35、 35、 36、 40、 45、 46、 52、 70
(a)使用深度为 3 的箱,用箱均值光滑以上数据。说明你的步骤,讨论这种技术对给定数据
的效果。
答:划分为(等频的)箱:
箱 1: 13、15、 16、16、 19、20、 20、21、 22箱 2: 22、25、 25、25、 25、30、 33、33、 35箱 3: 35、35、 35、36、 40、45、 46、52、 70用箱均值光滑:
箱 1: 18、18、 18、18、 18、18、 18、18、 18
箱 2: 28.1、 28.1、 28.1、 28.1、 28.1、28.1、 28.1、 28.1、28.1
箱 3: 43.78、 43.78、 43.78 、43.78、 43.78、 43.78、 43.7843.78、 43.78、 43.78
分箱方法通过考察数据的“ 近邻” 来光滑有序数据值,进而去掉“ 噪声” ,即去掉被测量的变量的随机误差或方差。
(b) 如何确定该数据的离群点?
答:可以通过聚类来检测离群点。即将类似的值组织成群或“ 簇” ,直观地,落在簇集合之外的值被视为离群点。
(c) 还有什么方法来光滑数据?
答:另外的方法是回归: 用函数拟合数据来光滑数据。这种技术被称为回归。线性回归涉及
找出拟合两个属性(或变量)的“ 最佳” 直线,使得一个属性可以用来预测另一个。
3.5 如下规范化方法的值域是什么?
(a)最小 -最大规范化
答: [new_min, new_max]
(b)Z 分数规范化
答: [(old_min - mean)/σ , (old_max - mean)/σ ]
(c)Z 分数规范化,使用均值绝对偏差而不是标准差、答: (-∞, +∞)
(d) 小数定标规范化答: (- 1.0,1.0)
3.7 使用习题 3.3 给出的 age 数据,回答以下问题:
(a)使用最小 -最大规范化将 age 值 35 变换到 [0.0,1.0] 区间。
答: 35-13/70-13=0.3860
(b) 使用 z 分数规范化变换 age 值 35,其中 age 的标准差为 12.94 岁。
答:均值为
29.67857
计算得 0.4112
(c) 使用小数定标规范化变换 age 值 35
答: 0.35
(d) 指出对于给定的数据,你愿意使用哪种方法。陈述你的理由。
答:我更喜欢用 z 分数规范化,因为 z 分数不受离群点影响
3.9 假设 12 个销售价格记录已经排序,如下所示:
5, 10, 11, 13, 15, 35, 50, 55, 72, 92, 204, 215使用如下个方法将它们划分成三个箱。
(a)等频(等深)划分箱 1:5, 10, 11,, 13
箱 2: 15,35, 50,55
箱 3: 72,92, 204, 215
(b) 等宽划分
箱 1: 5,10,11,13,15,35,50
箱 2:55,72,92箱 3:204,215
您可能关注的文档
- (最新完整版)人教版七年级英语下七单元教案.doc
- (最新完整版)人教版三年级数学下册第七单元测试题.doc
- (最新完整版)人教版三年级下册第二单元《一位数除三位数笔算除法》教学设计.doc
- (最新完整版)人教版三年级下册语文教学进度表.doc
- (最新完整版)人教版三年级下册语文期中考试试卷.doc
- (最新完整版)人教版三年级下学期解决问题专项练习.doc
- (最新完整版)人教版五年级上册语文第一单元导读课.doc
- (最新完整版)人教版五年级数学上册期末复习试卷(含答案).doc
- (最新完整版)人教版五年级数学下册教案-单元教案-第4单元-最小公倍数.doc
- (最新完整版)人教版五年级数学下册期中测试题.doc
最近下载
- ACS800 07传动(500到2800kW)硬件手册(中文).pdf VIP
- axxon轴芯新版机台点胶机编程及操作说明.pptx VIP
- ACS880 替换 ACS800 技术指导.pdf VIP
- 公路交通情况统计调查制度 2021 .pdf VIP
- acs800调试程序.docx VIP
- ACS800ACS800 600调试指导与故障分析.ppt VIP
- ACS800变频器说明书ACS800变频器说明书.doc VIP
- JZ-25-01A 美的大多联技术手册(25.6).pdf VIP
- 货拉拉租车合同范本.docx VIP
- en-ACS800-304-704整流单元硬件手册-res.pdf VIP
文档评论(0)