*;*;*;*;*;*;*;;确认数据质量
关键数据能否获取
是否存在许多的缺失值或无效值
是否有足够的历史数据;5.2 数据准备;聚集
对连续型变量可以用常见的统计量进行聚集:求和、平均、标准差、中位数、众数等。
对于离散型的变量是具体情况而定。例如每个变量值的取值次数。
合并:经过抽取、转换和聚集后的数据一般由多个数据集组成,最后需要将这些数据合并为一个供数据挖掘算法使用的宽表,在合并过程中要注意:
数据的一致性问题
数据格式的错误问题
重复数据;数据抽样:数据集多大时,受挖掘算法的时间复杂度和空间复杂度的影响,可能需要对数据进行抽样。
随机抽样:有放回的、无放回的
分层抽样:把数据分成若干个子集(称为层),再对每个子集进行随机抽样。适合层间差距比较大、而层内差距比较小的情况。
其他抽样:
等距抽样:按照数据的顺序,每隔m个就抽取一个实例
整群抽样:将数据分成若干群,然后再对群随机抽样,抽取到的群中的所有实例都作为样本
渐进抽样:和数据挖掘算法配合使用。先使用较小的随机样本训练算法,然后逐渐增大样本的大小,直至所得到的模型的精确度趋于稳定为主。;训练集和测试集的划分:训练集用于模型的构建、测试集用于模型的评估。
一般数据集的划分:
单一训练集和单一测试集:数据集分成两部分。一般常用的划分比例是2:1,即训练集转原数据集的2/3,测试集占1/3。
交叉验证法:把数据集随机平均分成
原创力文档

文档评论(0)