- 5
- 0
- 约4.58千字
- 约 23页
- 2024-01-04 发布于湖南
- 举报
手把手教你用机器学习进行数据分析-聚类分析
本文适合有一定PythonPandas基础,但又对机器学习/数据分析感兴趣又不熟悉的朋友们。如果你对Pandas还不熟悉,戳这里查看之前写的有关用pandas进行数据清理的文章。希望通过本文的内容,你也可以独立做一个通过机器学习进行数据分析的项目。如果本文反响比较好,可能会考虑出个系列~
这个项目的数据是美国各个社区的犯罪数据(communitycrimedata),里面有美国各个community(城市或者城镇或者县)的人口特征的数据(包括种族、年龄、家里几口人、有几个孩子等等)、经济情况(有多少人贫困、有多少人需要公共福利、平均收入、投资收入等等)、执法相关的数据(有多少巡警、有多少人报案、有多少警车)和犯罪率(分为暴力犯罪率和非暴力犯罪率),一共2215行,每行代表一个community的情况。
分析的目标是对这些community进行分类,看什么类别的community犯罪率高。进一步如果你想选择居住地或者警察需要分配警力都可以根据你分类的结果来做决策。
解决方案:
这需要我们用机器学习里的聚类算法(clusteringalgorithm)来解决这个问题,我选择的是聚类算法里最常用的K-meansclustering。
编程语言:Python。
数据分析难点:
1.列非常多,有147列,这非常不利于我们应用
原创力文档

文档评论(0)