- 1
- 0
- 约1.12万字
- 约 31页
- 2026-10-09 发布于四川
- 举报
2026年全国大学生数据分析科普知识竞赛题库及答案
一、判断题(共20题,每题1分)
1.样本量越大,统计分析结果的准确性一定越高。
答案:错误。当抽样存在系统偏差(如抽样框覆盖不全、无应答率过高)时,即使样本量无限扩大,结果依然会偏离真实总体特征;此外样本量超过阈值后,精度提升的边际效益会快速下降,盲目增大样本还会提升非抽样误差。
2.皮尔逊相关系数r=0,说明两个变量之间不存在任何关联。
答案:错误。皮尔逊相关系数仅衡量变量间的线性相关程度,r=0只代表不存在线性相关,可能存在非线性关联(如二次函数关系、周期性关联)。
3.数据清洗过程中,缺失值一律采用均值填充的方式处理,操作简便且对分析结果影响最小。
答案:错误。缺失值处理需结合缺失机制选择方案:完全随机缺失可采用均值、中位数填充;随机缺失需通过多重插补、回归插补处理;非随机缺失需单独设置虚拟变量标识,直接用均值填充会扭曲变量分布、引入估计偏差。
4.主成分分析(PCA)的核心目标是通过线性变换将高维数据映射到低维空间,要求降维后的各主成分相互正交。
答案:正确。PCA通过协方差矩阵特征分解得到正交的主成分向量,在最大程度保留原始数据方差信息的前提下消除变量间的多重共线性。
5.假设检验中,p值小于显著性水平α时,说明原假设成立的概率低于α。
答案:错误。p值的统计定义是“在原假设成立的前提下,观测到当前样本及更极
原创力文档

文档评论(0)