数据挖掘技术与应用:检测与处理特征重复值.docxVIP

  • 30
  • 0
  • 约4千字
  • 约 3页
  • 2021-11-23 发布于江西
  • 举报

数据挖掘技术与应用:检测与处理特征重复值.docx

检测与处理特征重复值 准备数据 准备数据detail.csv,将数据文件detail.csv放到Linux本地的/course/DataAnalyze/data目录,并读取数据 In[1]: import os import pandas as pd os.chdir(/course/DataAnalyze/data) detail = pd.read_csv(./detail.csv,index_col=0,encoding = gbk, engine = python) 特征重复 在pandas中相似度的计算方法为corr,使用该方法计算相似度时,默认为“pearson”法,可以通过“method”参数调节,目前还支持“spearman”法和“kendall”法。求出菜品订单详情表(midetail1.xlsx)数据中counts列和amounts列的“kendall”法相似度矩阵,如 REF _Ref491954843 \h 代码 45所示。 代码 STYLEREF 1 \s4SEQ 代码 \* ARABIC \s 15 求出counts和amounts两列数据的相似度矩阵 In[5]: corrDet = detail[[counts,amounts]].corr(method=kendall)## 求取销量和售价的相似度 print(销量和售价的kendall相似

文档评论(0)

1亿VIP精品文档

相关文档