数据挖掘课件教案编写 .ppt

*;*;*;*;*;*;*;;确认数据质量 关键数据能否获取 是否存在许多的缺失值或无效值 是否有足够的历史数据;5.2 数据准备;聚集 对连续型变量可以用常见的统计量进行聚集:求和、平均、标准差、中位数、众数等。 对于离散型的变量是具体情况而定。例如每个变量值的取值次数。 合并:经过抽取、转换和聚集后的数据一般由多个数据集组成,最后需要将这些数据合并为一个供数据挖掘算法使用的宽表,在合并过程中要注意: 数据的一致性问题 数据格式的错误问题 重复数据;数据抽样:数据集多大时,受挖掘算法的时间复杂度和空间复杂度的影响,可能需要对数据进行抽样。 随机抽样:有放回的、无放回的 分层抽样:把数据分成若干个子集(称为层),再对每个子集进行随机抽样。适合层间差距比较大、而层内差距比较小的情况。 其他抽样: 等距抽样:按照数据的顺序,每隔m个就抽取一个实例 整群抽样:将数据分成若干群,然后再对群随机抽样,抽取到的群中的所有实例都作为样本 渐进抽样:和数据挖掘算法配合使用。先使用较小的随机样本训练算法,然后逐渐增大样本的大小,直至所得到的模型的精确度趋于稳定为主。;训练集和测试集的划分:训练集用于模型的构建、测试集用于模型的评估。 一般数据集的划分: 单一训练集和单一测试集:数据集分成两部分。一般常用的划分比例是2:1,即训练集转原数据集的2/3,测试集占1/3。 交叉验证法:把数据集随机平均分成

文档评论(0)

1亿VIP精品文档

相关文档