- 0
- 0
- 约1.49千字
- 约 3页
- 2026-09-16 发布于北京
- 举报
大数据大数据公司大数据分析实习生实习报告
一、摘要
2023年7月1日至2023年8月31日,我在一家专注于大数据分析的公司担任数据分析实习生。期间,我负责处理每日用户行为数据,通过Python清洗并整合超过200万条记录,构建了用户活跃度模型,准确率达92%。运用Hadoop和Spark处理TB级日志数据,识别出3个关键用户流失因素,提出优化建议后,产品部门反馈用户留存率提升5%。熟练应用SQL、Python及Tableau,掌握了数据清洗的标准化流程和特征工程的基本方法,这些方法论可应用于后续类似业务场景中。
二、实习内容及过程
2023年7月1日到8月31日,我在一家做大数据分析的公司实习。主要目标是熟悉业务场景,把学校学的数据挖掘和机器学习知识用上。公司挺大,有专门的数据平台,我跟着团队做用户行为分析。
我的任务就是每天收用户数据,用Python和SQL先清洗,然后做探索性分析。7月中旬开始参与一个项目,分析用户流失原因。数据量挺大,每天新增数据超过200万条,存HDFS上。我用了Spark的DataFrameAPI处理,花了两天时间跑完整个清洗流程,比单独用Python快不少。
8月初遇到个坎,模型效果不理想,准确率只有85%,比预期低。后来发现是特征选择没做好,有些特征根本没用了。我就重新整理特征,把不相关的剔除,还用了PCA降维,最后准确率提到92%。
团队用的技术
原创力文档

文档评论(0)