互联网公司数据挖掘实习生实习报告.docxVIP

  • 0
  • 0
  • 约1.74千字
  • 约 4页
  • 2026-09-18 发布于北京
  • 举报

互联网公司数据挖掘实习生实习报告.docx

互联网公司数据挖掘实习生实习报告

一、摘要

2023年7月1日至2023年8月31日,我在某知名互联网公司担任数据挖掘实习生。通过处理平台用户行为日志数据,完成用户画像标签体系搭建,覆盖核心用户群体,准确率达92%。运用Python进行数据清洗与特征工程,结合Spark进行大规模数据处理,优化推荐算法特征维度,使召回率提升15%。实践过程中,系统掌握Pandas、SparkMLlib等工具,形成标准化数据处理流程,适用于高维稀疏数据场景。该方法论在后续迭代中可直接应用于相似业务场景。

二、实习内容及过程

2023年7月1日到8月31日,我在一家做推荐系统的团队实习。初期主要是熟悉业务,了解用户行为日志的构成,比如页面浏览、点击、加购这些事件。导师给我一套2023年3月的离线数据,让我尝试搭建用户画像标签。数据量有30G,用Spark处理挺慢的,内存还经常爆。我花了两天把代码优化了,加了一些特征筛选,把处理时间缩短到3小时,准确率从85%提到92%。

项目里有个挑战是处理高维稀疏数据。用户行为特征几百个,大部分是0。我用了LSA(低秩稀疏表示)降维,再结合TFIDF提取关键词,最后用逻辑回归打标签。验证集上F1值达到0.78,比直接用原始特征好不少。团队用的平台比较老旧,有些脚本写得很混乱,调试起来费劲。我就自己建了个小环境,用Jupyter写实验脚本,跑完自动生成报告,效率高多了

文档评论(0)

1亿VIP精品文档

相关文档