- 14
- 0
- 约2.56千字
- 约 5页
- 2023-09-22 发布于北京
- 举报
数据分析师笔试试题
【编者注】以下试题是来自阿里巴巴2011年招募实习生的一次笔试题,从笔试题的几个 要求可见数据分析职业要求。
一、异常值是指什么?请列举1种识别连续型变量异常值的方法?
异常值(Outlier)是指样本中的个别值,其数值明显偏离所属样本的其余观测值。在数 理统计里一般是指一组观测值中与平均值的偏差超过两倍标准差的测定值。
Grubbs1 test (是以 Frank E. Grubbs 命名的),又叫 maximum normed residual
test f是一种用于单变呈数据集异常值识别的统计检测,它假走数据集来自正态分布的总
体。
未知总体标准差o ,在五种检验法中,优劣次序为:t检验法、格拉布斯检验法、峰度检验 法、狄克逊检验法、偏度检验法。
点评:考察的内容是统计学基础功底。
二.什么是聚类分析?聚类算法有哪几种?请选择一种详细描述其计算原理和步骤。
聚类分析(cluster analysis)是一组将研究对象分为相对同质的群组(cluste⑸的统计分析技 术。聚类分析也叫分类分析(classification analysis)或数值分类(numerical taxonomy).聚类与分类的不同在于,聚类所要求划分的类是未知的。
聚类分析计算方法主要有:层次的方法(hierarchical method )、划分方法
(partitioning method )、基于密度的方法(density-based method )、基于网格的方 法(grid-based method )、基于模型的方法(model-based method )等。其中,前 两种算法是利用统计学定义的距离逬行度量。
对象任意选择k个对象作为初始聚k-means算法的工作过程说明如下:首先从
对象任意选择k个对象作为初始聚
类中心;而对于所剩下其它对象,则根据它们与这些聚类中心的相似度(距离),分别将它们分配给与其最相似的(聚类中心所代表的)聚类;然后再计算每个所获新聚类的聚类 中心(该聚类中所有对象的均值);不断重复这一过程直到标准测度函数开始收敛为止。
—般都采用均方差作为标准测度函数.k个聚类具有以下特点:各聚类本身尽可能的紧凑, 而各聚类之间尽可能的分开。
其流程如下:
(1) 从n个数据又蝮任意选择k个对象作为初始聚类中心;
(2) 根据每个聚类又援的均值(中心对象),计算每个对象与这些中心对象的距离;并 根据最小距离重新对相应又寸象进行划分;
(3) 重新计算每个(有变化)聚类的均值(中心对象);
(4) 循环(2 )、(3)直到每个聚类不再发生变化为止(标准测星函数收敛)。
优点:本算法确走的K个划分到达平方误差最小。当聚类是密集的,且类与类之间区别明 显时,效果较好。对于处理大数据集,这个算法是相对可伸缩和高效的,计算的复杂度为 O(NKt),其中N是数据对象的数目,t是迭代的次数。一般来说,KN , tN。
缺点:1. K是事先给走的,但非常难以选走;2.初始聚类中心的选择对聚类结果有较大
的影响。
点评:考察的内容是常用分析方法,做数据分析一走要理解1
点评:考察的内容是常用
分析方法,做数据分析一走要理解1
分析算法、应用场
景、使用过程、以及优缺点。
三、根据要求写岀SQL
表A结构如下:
MemberJD (用户的ID #字符型)
Logjime (用户访问页面时间,日期型(只有一天的数据))
URL (访问的页面地址,字符型)
要求:提取出每个用户访问的第一个URL (按时间最早),形成一个新表(新表名为B ,
表结构和表A —致)
create table B as select MemberJD, min(Log_time), URL from A group
by MemberJD;
点评:SQL语句,简单的数据获取能力,包括表查询、关联、汇总、函数等。
另外,这个答案其实是不对的,实现有很多方法,就不贴出来了,大家自己去发挥吧。
四、销售数据分析
以下是一家B2C电子商务网站的一周销售数据,该网站主要用户群是办公室女性,销售额
主要集中在5种产品上,如果你是这家公司的分析师,
a) 从数据中,你看到了什么问题?你觉得背后的原因是什么?
b) 如果你的老板要求你提出一个运营改进计划,你会怎么做?
表如下:一组每天某网站的销售数据
(金一、?
?9月〉隊
0片■日.
urnaE
n H-
皿六〉
9月12日.
?E)?
?SS-
㈣?
2皿
a) 从这一周的数据可以看岀,周末的销售额明显偏低。这其中的原因,可以从两个角度来 看:站在消费者的角度,周末可能不用上班,因而也没有购买该产品的欲望;站在产品的 角度来看,该产品不能在周末的时候引起消费者足够的注意力。
b) 针对该问题背后的两方
您可能关注的文档
最近下载
- 小品《艰难抉择》台词.docx VIP
- 一种单相PWM整流直流侧电压二次纹波抑制方法.pdf VIP
- 2023年江苏省盐城市中考数学真题卷(含答案与解析)_8652.docx VIP
- 部队春节联欢晚会PPT.pptx VIP
- 再生润滑油基础油团体标准(TCRRA-0901-2023).pdf VIP
- (新)设计质量、进度、保密等保证措施(3篇).docx VIP
- 高三英语人教版一轮教师用书:第一部分 选修7 Unit 4 Sharing Word版含解析.doc VIP
- 2026年常州信息职业技术学院高职单招职业适应性测试备考试题及答案解析.docx VIP
- 高一物理(必修一)知识点复习PPT课件.pptx VIP
- 2026年常州信息职业技术学院单招职业适应性测试题库附答案.docx VIP
原创力文档

文档评论(0)