数据分析介绍之三——单变量数据观察之核密度估计.pdfVIP

  • 22
  • 0
  • 约3.3千字
  • 约 4页
  • 2023-06-11 发布于上海
  • 举报

数据分析介绍之三——单变量数据观察之核密度估计.pdf

数据分析介绍之三——单变量数据观察之核密度估计 数据分析介绍之三——单变量数据观察之核密度估计 ⼀、核密度估计 上⼀篇结尾处谈到了直⽅图的⼏个缺点,幸运的是,除了这些问题之外,还有经典直⽅图的替代⽅案。 称为核密度估计。 内核密度估计(KDEs)是⼀种⽐较新的技术。 与直⽅图和许多其他经典数据分析⽅法相⽐,它们⼏乎要求合理的现代计算机的计算能⼒有 效。 即使是相当适中的数据集,它们也不能⽤纸和铅笔⼿⼯完成。 (有趣的是,计算和图形功能的可访问性如何能够新的⽅式来思考数 据!) 为了形成KDE,我们在每个数据点的位置放置⼀个内核,即⼀个平滑的,强峰值的函数。 然后,我们将来 ⾃所有内核的贡献加起来,获得 ⼀个平滑的曲线,我们可以在x轴的任意点进⾏评估。 图2-4显⽰了⼀个例⼦。 这是我们以前在图2-1中看到的数据集的另⼀个表⽰。 虚线框是数据集的直⽅图(bin宽度等于 1),实线是具有 不同带宽的相同数据集的两个KDE(稍后将解释此概念)。 单个内核函数的形状可以清楚地看出来——例如,通过考虑低于20的三个数据 点。您还可以看到最终曲线如何由单个内核组成,特别是当您查看30到40之间的点。 我们可以使⽤任何平滑,强峰值的函数作为内核,只要它集成到1; 换句话说,由单个内核形成的曲线下⾯积必须为1.(这是必要的,以确保 ⽣成的KDE

文档评论(0)

1亿VIP精品文档

相关文档