数据挖掘中易犯的10大错误.docxVIP

  • 1
  • 0
  • 约5.16千字
  • 约 9页
  • 2021-12-05 发布于天津
  • 举报
PAGE 1 PAGE 1 数据挖掘中易犯的10大错误 不要简洁地信任你用单个方法分析的结果,至少要和传统方法(比如线性回归或线性判别分析)做个比较。 1.太关注训练(FocusonTraining) IDMer:就象体育训练中越来越注意实战训练,因为单纯的封闭式训练常常会训练时状态神勇,比赛时一塌糊涂。 实际上,只有样本外数据上的模型评分结果才真正有用!(否则的话,直接用参照表好了!) 例如: -癌症检测(Cancerdetection):MDAnderson的医生和研究人员(1993)使用神经网络来进行癌症检测,惊异地发觉,训练时间越长(从几天延长至数周),对训练集的性能改善特别稍微,但在测试集上的性能却明显下降。 -机器学习或计算机科学研究者常常试图让模型在已知数据上表现最优,这样做的结果通常会导致过度拟合(overfit)。 解决方法: 解决这个问题的典型方法是重抽样(Re-Sampling)。重抽样技术包括:bootstrap、cross-validation、jackknife、leave-one-out...等等。 2.只依靠一项技术(RelyonOneTechnique) IDMer:这个错误和第10种错误有相通之处,请同时参照其解决方法。没有

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档