- 30
- 0
- 约4千字
- 约 3页
- 2021-11-23 发布于江西
- 举报
检测与处理特征重复值
准备数据
准备数据detail.csv,将数据文件detail.csv放到Linux本地的/course/DataAnalyze/data目录,并读取数据
In[1]:
import os
import pandas as pd
os.chdir(/course/DataAnalyze/data)
detail = pd.read_csv(./detail.csv,index_col=0,encoding = gbk, engine = python)
特征重复
在pandas中相似度的计算方法为corr,使用该方法计算相似度时,默认为“pearson”法,可以通过“method”参数调节,目前还支持“spearman”法和“kendall”法。求出菜品订单详情表(midetail1.xlsx)数据中counts列和amounts列的“kendall”法相似度矩阵,如 REF _Ref491954843 \h 代码 45所示。
代码 STYLEREF 1 \s4SEQ 代码 \* ARABIC \s 15 求出counts和amounts两列数据的相似度矩阵
In[5]:
corrDet = detail[[counts,amounts]].corr(method=kendall)## 求取销量和售价的相似度
print(销量和售价的kendall相似
您可能关注的文档
最近下载
- [分班考小升初] 江苏省苏州市相城区南京师范大学苏州实验学校2026年苏教版考试数学仿真模拟试卷 [有答案].pdf VIP
- 高校学科竞赛培训方案及题库.docx VIP
- 行业职业技能竞赛物业管理员考试试题真题及答案.docx VIP
- 2026届苏州工业园区小升初语数英综合素养摸底卷3套(含答案解析评分标准).docx VIP
- —北京积分落户介绍和申报流程—.PDF VIP
- 2026年治河及泥沙治理工程技术人员专项题库.docx VIP
- PEP版三年级英语下册Unit 3 C Reading time.pptx VIP
- 单相流体对流传热...ppt VIP
- 上古卷轴4完整控制台秘籍(含有物品汉化对照).pdf
- 零星维修批量发包企业入围服务方案投标文件(技术方案).doc
原创力文档

文档评论(0)