- 16
- 0
- 约1.81千字
- 约 18页
- 2021-09-02 发布于北京
- 举报
机器学习(Machine Learning)聚类算法大纲2018年10月6日聚类任务、性能度量、距离计算实战2018年10月13日原型聚类实战2018年10月20日密度聚类、层次聚类实战大纲 聚类任务 性能度量 距离计算大纲 聚类任务 性能度量 距离计算聚类任务在“无监督学习”任务中研究最多、应用最广. 聚类目标:将数据集中的样本划分为若干个通常不相交的子集(“簇”,cluster). 聚类既可以作为一个单独过程(用于找寻数据内在的分布结构), 也可作为分类等其他学习任务的前驱过程.聚类任务形式化描述 假定样本集 包含 个无标记样本,每个样本 是一个 维的特征向量,聚类算法将样本集 划分成 个不相交的簇 ,其中 ,且 。相应地,用 表示样本 的“簇标记”(即cluster label),即 。于是,聚类的结果可用包含 个元素的簇标记向量 表示。大纲 聚类任务 性能度量 距离计算性能度量聚类性能度量,即聚类“有效性指标”(validity index)直观来讲: 我们希望“物以类聚”,即同一簇的样本尽可能彼此相似,不同簇的样本尽可能不同。换言之,聚类结果的“簇内相似度”(intra-cluster similarity)高,且“簇间相似度”(inter-cluster similarity)低,这样的聚类效果较好.聚类性能度量指标:外部指标 (externa
原创力文档

文档评论(0)