数据挖掘技术与应用:检测与处理记录重复值.docxVIP

  • 24
  • 0
  • 约2.27千字
  • 约 2页
  • 2021-11-23 发布于江西
  • 举报

数据挖掘技术与应用:检测与处理记录重复值.docx

检测与处理记录重复值 准备数据 准备数据detail.csv,将数据文件detail.csv放到Linux本地的/course/DataAnalyze/data目录。 检测处理记录重复 菜品订单详情表中的dishes_name特征,存放了每个订单的菜品。为找出所有已点菜品,最简单的方法就是利用去重操作实现。方法一是利用列表(list)去重,如 REF _Ref523216394 \h 代码 41所示。 代码 STYLEREF 1 \s4SEQ 代码 \* ARABIC \s 11 利用list去重 In[1]: import os import pandas as pd os.chdir(/course/DataAnalyze/data) detail = pd.read_csv(./detail.csv,index_col=0,encoding = gbk, engine = python) ##方法一 ##定义去重函数 def delRep(list1): list2=[] for i in list1: if i not in list2: list2.append(i) return list2 dishes=list(detail[dishes_name]) ##将dishes_name从数据框中提取

文档评论(0)

1亿VIP精品文档

相关文档