2025年数据挖掘探索数据的奥秘(青岛工学院)网课章节测试答案
1.(选择题)某数据集存在30%的缺失值,变量类型为连续型,且缺失模式为随机缺失(MCAR)。以下哪种处理方法最合理?
A.直接删除缺失值所在行
B.用变量均值填充
C.用最近邻插值法填充
D.用回归模型预测填充
答案:B
解析:当缺失值比例在30%以内且为随机缺失时,直接删除(选项A)会损失过多信息;最近邻插值(选项C)适用于时间序列或空间相关数据;回归预测(选项D)需要其他变量与缺失变量有强相关性,否则易引入偏差。连续型变量随机缺失时,均值填充是最简洁且误差较小的方法,因此选B。
2.(判断
原创力文档

文档评论(0)