2025年数据挖掘探索数据的奥秘(青岛工学院)网课章节测试答案.docx

2025年数据挖掘探索数据的奥秘(青岛工学院)网课章节测试答案.docx

2025年数据挖掘探索数据的奥秘(青岛工学院)网课章节测试答案

1.(选择题)某数据集存在30%的缺失值,变量类型为连续型,且缺失模式为随机缺失(MCAR)。以下哪种处理方法最合理?

A.直接删除缺失值所在行

B.用变量均值填充

C.用最近邻插值法填充

D.用回归模型预测填充

答案:B

解析:当缺失值比例在30%以内且为随机缺失时,直接删除(选项A)会损失过多信息;最近邻插值(选项C)适用于时间序列或空间相关数据;回归预测(选项D)需要其他变量与缺失变量有强相关性,否则易引入偏差。连续型变量随机缺失时,均值填充是最简洁且误差较小的方法,因此选B。

2.(判断

文档评论(0)

1亿VIP精品文档

相关文档