- 25
- 0
- 约4.12千字
- 约 6页
- 2023-09-23 发布于湖北
- 举报
数据挖掘概念与技术 (第三版)课后答案——第⼆章
======需要原版答案请留⾔ !!=======
2.1 再给三个⽤于数据散布特征的常⽤统计量 (即未在本章讨论过的),并讨论如何在⼤型数据库中有效的计算它们。
1.异众⽐率(variation ratio) :⽤Vr表⽰,其定义为 :
,其中∑fi表⽰变量值的总频数,∑fm表⽰众数组的频数。异众⽐率主要⽤于衡量众数对⼀组数据的代表程度。异众⽐越⼤,说明⾮
众数组的频数占总频数的⽐重越⼤,众数的代表性就越差 ;异众⽐越⼩,说明⾮众数组的频数占总频数的⽐重越⼩,众数的代表性就
越好。异众⽐率主要适合测度分类数据的离散程度,当然,对于顺序数据与数值数据也可以进⾏计算。
2.标准分数 (standard score):变量值与其平均数的差除以标准差后的值。设标准分数为z,则有
标准分数给出了⼀组数据中各数值的相对位置。实际上,z分数只是将原始数据进⾏了线性变换,它并没有改变⼀个数据在该组数据中
的位置,也没有改变该组数据的分布形状。
3.相对离散程度 :离散系数 (coefficient of variation) :⼀组数据的标准差与其相应的平均数之⽐称为离散系数,也称变异系数。
为了消除变量值⽔平⾼低 (即两个相同类型的属性其值的分布差别特别⼤,⽐
原创力文档

文档评论(0)