04.30 聚类算法之凝聚聚类

2018-04-30 01:12:43 機器學習之路

一、原型聚类和层次聚类

原型聚类也称基于原型的聚类(prototype-based clustering)，这类算法假设聚类结构能够通过一组原型刻画，先对原型进行初始化，然后对原型进行迭代更新求解。采用不同的原型表示、不同的求解方式，产生不同的算法。常用的原型聚类算法有k-means算法。

层次聚类(hierarchical clustering)是一种基于原型的聚类算法，试图在不同层次对数据集进行划分，从而形成树形的聚类结构。数据集的划分可采用"自底向上"的聚合策略，也可以采用"自顶向下"的分拆策略。层次聚类算法的优势在于，可以通过绘制树状图(dendrogram)，帮助我们使用可视化的方式来解释聚类结果。层次聚类的另一个优点就是，它不需要事先指定簇的数量。

二、凝聚层次聚类

层次聚类可以分为凝聚(agglomerative)层次聚类和分裂(divsive)层次聚类。分裂层次聚类采用的就是"自顶而下"的思想，先将所有的样本都看作是同一个簇，然后通过迭代将簇划分为更小的簇，直到每个簇中只有一个样本为止。凝聚层次聚类采用的是"自底向上"的思想，先将每一个样本都看成是一个不同的簇，通过重复将最近的一对簇进行合并，直到最后所有的样本都属于同一个簇为止。

在凝聚层次聚类中，判定簇间距离的两个标准方法就是单连接(single linkage)和全连接(complete linkage)。单连接，是计算每一对簇中最相似两个样本的距离，并合并距离最近的两个样本所属簇。全连接，通过比较找到分布于两个簇中最不相似的样本(距离最远)，从而来完成簇的合并。

凝聚层次聚类除了通过单连接和全连接来判断两个簇之间的距离之外，还可以通过平均连接(average linkage)和ward连接。使用平均连接时，合并两个簇所有成员间平均距离最小的两个簇。使用ward连接，合并的是使得SSE增量最小的两个簇。

三、全连接的凝聚层次聚类

基于全连接的凝聚层次聚类主要包括下面几个步骤：

1、获取所有样本的距离矩阵

2、将每个数据点作为一个单独的簇

3、基于最不相似(距离最远)样本的距离，合并两个最接近的簇

4、更新样本的距离矩阵

5、重复2到4，直到所有样本都属于同一个簇为止。

下面通过代表来实现基于全连接的凝聚层次聚类

1、获取样本

随机产生5个样本，每个样本包含3个特征(x、y、z)

聚类算法之凝聚聚类

2、获取所有样本的距离矩阵

通过SciPy来计算距离矩阵，计算每个样本间两两的欧式距离，将矩阵矩阵用一个DataFrame进行保存，方便查看

聚类算法之凝聚聚类

3、获取全连接矩阵的关联矩阵

通过scipy的linkage函数，获取一个以全连接作为距离判定标准的关联矩阵(linkage matrix)。

聚类算法之凝聚聚类

第一列表的是簇的编号，第二列和第三列表示的是簇中最不相似(距离最远)的编号，第四列表示的是样本的欧式距离，最后一列表示的是簇中样本的数量。

4、通过关联矩阵绘制树状图

使用scipy的dendrogram来绘制树状图

聚类算法之凝聚聚类

通过上面的树状图，可以直观的发现。首先是s1和s5合并，s2和s3合并，然后s2、s3、s4合并，最后再和s1、s5合并。

5、结合树状图和热度图

在实际应用中，可以将树状图和热力图结合使用，通过不同的颜色来代表样本矩阵中的独立值。

聚类算法之凝聚聚类

通过热力图与树状图结合，能够更加直观的发现特征对于簇划分的影响，不同颜色代表欧式距离的大小。

6、使用sklearn实现凝聚聚类

聚类算法之凝聚聚类

使用sklearn的AgglomerativeClustering可以很容易的实现凝聚聚类，需要设置返回簇的数量。

分享到:

閱讀更多 機器學習之路 的文章

關鍵字: 算法原型聚类

疫情还没结束，又一场“灾难”逼近！算法，终究吞噬了人的智商

中文数字一二三+算法——多个数连续加计算方法

它用“算法+红娘”模式帮小镇青年找对象，一年拿下4000万用户

我们还有一场更为关键的战役要打，这就是人和“算法”的斗争！

人和“算法”的斗争！人类又一场灾难来袭！

影响店铺排名的五大因素

10.31 教你快速掌握梁钢筋算量的基本方法

关于天干地支知识点讨论

快速掌握梁钢筋施工算量基本方法

双十一预警！羊毛党的狂欢！！

看图说话之线性回归算法

PID参数的通俗解释，要不要了解一下？

PID分析及参数调整

PS教程：高低频磨皮其实很简单，高低频原理的超详细说明

卖得很好的产品，销量莫名下降怎么办？

常用算法之滑动窗口

一个著名的最贪心也最厉害的算法——Dijkstra算法

拼多多店铺如何快速提升销量和排名？

更新后的扫地机有多了哪些功能

洪量老师：企业是企业家带着一群人做一件有意义的事情

称球问题的通用解法

快速求出淘汰赛中轮空场次-最简单的算法

如何分配社会悲剧

巧算79764168÷7986

终于有人把数据、信息、算法、统计、概率和数据挖掘都讲明白了！

生产成本控制：减少消除控制法，如何控制生产中两类减少三类消除

铜排计算方法、折弯经验计算表、铜排载流量，铜排截面积计算公式

一文了解刀具和刀具半径补偿，想不看都难！

算法“急转弯”——燃香计时

为什么有的身份证号末位数字是“X”的，有什么特殊的含义吗？

梁钢筋算量的基本方法

「坐在马桶上看算法」算法6：只有五行的Floyd最短路算法

最快最简单的排序——桶排序

火爆刷单界的“凌晨单”，到底是什么逻辑？

十大经典图算法PageRank

懂你背后的苦

限流算法：漏桶与令牌桶

09.26 学术动态：单绕组无轴承开关磁阻电机的绕组开路故障容错控制策略

08.30 终于有人把数据、信息、算法、统计、概率和数据挖掘都讲明白了！

08.13 超全的人工及材料用量算法造价人员都在用！

06.22 教孩子最快速算法

05.15 限流算法之令牌桶算法、漏桶算法

05.07 自建房钢筋算量不求人，记住各部位钢筋计算公式，自己也能做预算

04.24 目前最快最简单的神速排序算法——桶排序

02.18 算法——递归（以汉诺塔为例）

02.02 即使不背九九乘法表也能用画线数点法来计算乘法

01.26 “儿童邪典片”肆虐，算法“价值中立”论最该批！

头条年底上头条的方式竟然是这样的！

人脸识别算法的巅峰之际，为什么需求最痛的安防行业还是无法大规模应用？

沈巍先生杂谈（358）说好的快手不倒，陪伴到老呢？个个都是戏精

转念一想，这种看似不正常的状态才是正常的，随着时间的推移，很多过去迷迷糊糊的人慢慢就看清了，是进是退跟着内心走就好，别管什么善始善终，不要被这种论调道德绑架，过段时间，你觉得可以，再回来就行，开关在你自己手里，一秒钟就能完成进退。

出海奋斗是有胆识后浪的更优选项

东南亚11国，除去东帝汶，其他10国组成东盟。东南亚有多热，从很多国际资本的快速涌入都有目共睹。养老产业：泰国、越南、菲律宾、马来西亚、印尼都是大受欧美日韩退休人士欢迎的亚洲养老目的地。

甲有5套房，不上班，收房租；乙有1套房，上班赚工资；丙租房子.

每逢佳节被相亲，单身青年看这里！

“非常战疫

为珠峰“量身高”，为啥要人上去？

6日，2020珠峰高程测量行动测量登山队举行出发仪式，30多名计划登顶的测量登山队员当日从海拔5200米的珠峰登山大本营向更高海拔出发，计划抓住近日的天气窗口，择日登顶测量。如果成功，这将成为我国专业测绘人员首次登顶珠峰测高。

我省获国家局通报表扬

湖南名字最尴尬的城市，90%的人都会想歪，当地人：思想有问题！

湖南省作为中国中南地区的一个省份，经济强劲，地位独特，有着十足的发展后劲。湖南经济总量在全国排名第九。湖南也是华夏文明的发祥地，境内的炎帝陵，成为华夏儿女寻根祭祖的重要场所。南岳衡山就在湖南衡阳。湖南张家界景区成为驰名中外的旅游景点。湖南湘西凤凰古镇成为中国驰名十大古镇之一。

超六成前浪点赞《后浪》，全球白手起家90后富豪人均财富190亿

再不来一场精致野餐，我就要被开除中产籍了

《新周刊》创刊于1996年8月18日，由南方出版传媒股份有限公司主管、主办，以“中国最新锐的生活方式周刊”为定位，推出过一系列极具影响力的专题报道，是中国期刊市场最具代表性和影响力的杂志之一，享有“话题策源地”的美誉。

工程师我只服中国，曾经放生到三峡的1万条鱼，如今怎么样了？

每一个大项目其实都会面临一个问题，那就是生态环境，因为所涉及的范围实在太广了，所以需要考虑的问题都是多方面的，三峡就是我国早期的一个超大体量的工程，而三峡所涉及的问题也很多。三峡其实一直都是我国的骄傲，但是关于三峡的质疑声，其实也一点都不少，特别是关于三峡环境方面的质疑声。

后疫情时代的五个营销启示

现象级白酒——李渡高粱酒，作为沉浸式/场景化营销的开创者，早在几年前就使用互联网工具助力，疫情爆发后一系列的操作自然游刃有余了，销量同比增加170%，线上销量更是增加400%。

丘北县双龙营镇人民政府普者黑村委会、矣则村委会太阳能路灯采购安装项目竞争性谈判公告

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了金子一直是我们中国人比较喜欢投资的一个东西，黄金饰品也是中国女性非常喜欢购买的东西，大家都知道，金子具有保值的功能，所以很多人既喜欢在银行购买金条用于投资，又喜欢去一些金店购买黄金饰品。

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了大家都会知道，每到夏天，我们的沿海地区都是一个多风多雨的季节，这时候我们出门也是需要随时带上雨具，避免突然有暴风雨这些天气的出现。

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了每次一到假期，就非常害怕到达火车站，可以说是基本上都是人山人海的感觉。很多人会为了方便去选择去乘坐动车和高铁。现在我们无论是出差还是去旅游也都是会选择去坐动车，又快又方便，主要还会很舒服。

肖战视频专访：眼里带着故事，请不要听说他，这一次，请他说

这是肖战春节后，经历过这么多事后首次参加采访。视频中他依然是面带微笑，依旧是少年的样子。但是眼里到这故事，说话也变得小心谨慎，谈吐措辞也是越来越严谨了。

秦山核电应急行动水平优化项目招标公告

从中国电力集采招标网（www.dljczb.

巴基斯坦SK水电站消防及火灾报警系统设备采购招标招标公告

从中国电力集采招标网（www.dljczb.

中煤能源新疆鸿新煤业苇子沟煤矿瓦斯抽采机械设备采购招标公告

从中国电力集采招标网（www.dljczb.

县域社区团购，在平台发展上有哪些优势？

社区团购的迅速发展，已经不再局限于各大城市中的小区。渐渐的扩大范围，发展到一些城市边缘的县城乡镇。像是兴盛优选、十荟团、食享会、考拉精选、美家买菜等月流水上亿的社区团购头部企业，都很重视下沉市场的布局和开拓。

和王为念离婚，与“假奶奶”常香玉对簿公堂，55岁小香玉生活如诗

戏曲是以古代故事以及现代经典故事为题材的艺术表演，也是历史悠久的综合舞台艺术样式，表演戏曲难度很高，但戏曲人才依旧人才辈出，说起在戏曲圈中的佼佼者，陈百玲必是其一。

眼力测试：由4字组成的白菜，1秒看出4个字的智商都很高

这是一幅白菜图，由4字组成的，1秒看出4个字的智商都很高！你看出来了吗？

看图猜字：这个不简单，你能猜对几个？全猜对眼力非凡

这福图上的图你能猜对几个？全猜对眼力非凡，猜对3个眼力160，猜对3个是近视眼！你能猜对几个字？

眼力测试：火焰中藏了4个字，看出3个算达标，全看出眼力200

熊熊火焰中藏了4个字，看出3个算达标，全看出眼力200！你能全部看出来吗？

小米硬刚德国双立人，400年非洲灌木做家用砧板，不发霉砍不坏

民以食为天。

眼力测试：美女图中藏了5个汉字，全部看出来的眼力超群

这幅美女图中藏了5个汉字，你能不能看出来是哪几个汉字呢？全部看出来的眼力超群！

最萌Hodler，刚出生就收到比特币大学教育基金的宝宝

作为比特币爱好者，Izabella的父母在她出生当日于《泰晤士报》刊登了一则附带比特币地址的小广告，希望广大读者能够捐出小部分比特币给他们女儿作为大学教育基金。

《瞭望大湾区》：全国中高风险区域今日“清零”

《晨会解读》：中山证券投资顾问杨立华：连续上涨过后注意把握好操作节奏

孙松峰：幸福生活唱出来

河南市场安全网讯（www.hnscjgw.com）

衡水：守护一湖碧水打造生态之城

长城网衡水讯（记者张梅胜

英国小伙第一次体验中国网吧，就被电脑屏幕吓到直言：这是个啥

网吧其实不管是对于哪个国家的人来说，都是极具吸引力的，而在中国对于八九四年的年轻人和学生来说，网吧简直就是快乐源泉，但是也是老师家长中的眼中钉，肉中刺。相信很多人小时候可能都有过被家长从网吧里揪出来的不甚美好的回忆。

微商到底多能吹牛！哈哈哈哈哈千万别屏蔽，每天都是快乐源泉

虽然有的时候在朋友圈里有很多微商不停的发朋友圈，让大家觉得有些困扰和烦闷，有一种私生活被侵扰的感觉。但是不要忙着屏蔽他们，有的时候这些总是吹得天花乱坠的微商也能给人们带来快乐的源泉。

2020珠峰高程复测出发仪式今日举行小米10全程助力丈量世界新高度

5月6日，2020珠峰高程测量登山队伍出发仪式正式举行，30多名队员当日从海拔5200米的登山大本营向更高海拔出发，开启珠峰冲顶测量。队员们力争抓住近日的天气窗口，择日登顶测量。如果成功，这将是我国专业测绘人员首次登顶珠峰测高。

“十大沂蒙工匠”齐玉祥：钢花璀璨照亮青春之路

一支焊枪、一面防护罩，钢花白昼繁星，在刺耳的噪声中点亮四壁，焊工齐玉祥用13年的青春，打磨出了人生最璀璨的钢花。2007年，齐玉祥毕业后进入山东华源锅炉有限公司工作。刚进公司没多久，由于工作需要，他被分配到了焊接岗位。

日本的丈母娘，卖萌发嗲也是蛮有技术的

国内这点估计是比不过了

消费水平最高的5座城市，北上广深均在列，另一座你知道是哪吗？

我们都知道在地大物博的中国，拥有很多城市，而它们之间的等级划分也都是不同的，等级越高，往往消费就会越高，那么说起国内消费水平最高的几座城市，伙伴们都知道是哪里吗？接下来就让小编带大家去了解一下吧，看看有没有你心中的那个。

德国爱他美怎么样？"断货王"爱他美值得买吗？

哈哈。每次都会用iGepir 姐姐推荐来的，小宝从6个月混养喝起，现在快1岁半了，一直喝爱他美，不上火，购入量大，也算全心全意支持国际妈咪了

广东有望合并的3座城市：合并成功后，将诞生一座千万人口的城市

相信大家都知道，目前广东是中国经济实力最强的城市，哪怕是国内富有的浙江和江苏，在经济上也被广东牢牢按住。你要知道广东可是中国唯一有一线城市的省份，而且还是两座。光靠这一点就能让全国所有的省份羡慕，但比较遗憾的是，广东的经济发展似乎并不平衡。

国外奶粉怎么样？去哪买靠谱？线下实体店一定比网店安全吗？

之前买的一直是国际妈咪的海外仓，但是疫情的缘故怕被吧断粮所以在海外仓直邮了一箱又在自贸仓补了一箱，反正奶粉是消耗品，不担心吃不完hhh。自贸仓物流速递还是很快的，重庆保税区发货，4天到达。

四川潜力大的城市：还是重要的恐龙化石产地，被誉为“恐龙之乡”

对此有的网友说:很多人可能不知道，其实我们自贡还有飞机制造，汽车制造，新能源汽车，及新能源电池研发与制造产业，虽然刚起步，但未来可期!

00后，吾辈当自强

当记者采访她时，她说了一句让人永生难忘的话:“其实我们并不是什么逆行者，只不过是一些普通人在坚守自己的使命。

“我来！”

十天，我应该可以读完一本《百年孤独》，应该可以学会用吉他弹一首歌，还应该可以追完一部电视剧《庆余年》。

东北唯一新一线城市：被誉为“东方鲁尔”，经济却不如省内地级市

众所周知这几年东北的经济，确实没有以前增长得那么快了。原因相信大家也很清楚，简单点说就是南方更适合发展经济。因此中国的经济重心向南移动，所以在未来的几年甚至几十年里面，中国南方的经济都会比北方强。特别是广东省跟浙江省的经济水平，目前已经超越世界上大部分国家了。

人生有尺，做人有度

“救命钱”变“唐僧肉” 扶贫最后一公里处“蝇贪”频现！

家境殷实的90后海归女为何“沉迷”偷快递？

青春洋溢，不加过分修饰，真实的少女感，你喜欢吗？

4名网友预谋绑架一董事长，汇合后剧情突变……

江苏的第二个“苏州”，并非南京和无锡，而是这座低调的城市

说起苏州的大名，相信是无人不知，无人不晓的，作为我国名副其实的最强地级市，苏州近些年属实为人们带来了很大惊喜，甚至在经济发展上也已经远超省会南京，而今天小编要为大家带来的则是江苏境内的“第二个苏州”，发展潜力巨大，并非南京和无锡，而是这座十分低调的城市。

04.30 聚类算法之凝聚聚类

一、原型聚类和层次聚类

二、凝聚层次聚类

三、全连接的凝聚层次聚类

相關文章:

疫情还没结束，又一场“灾难”逼近！算法，终究吞噬了人的智商

中文数字一二三+算法——多个数连续加计算方法

它用“算法+红娘”模式帮小镇青年找对象，一年拿下4000万用户

我们还有一场更为关键的战役要打，这就是人和“算法”的斗争！

人和“算法”的斗争！人类又一场灾难来袭！

影响店铺排名的五大因素

10.31 教你快速掌握梁钢筋算量的基本方法

关于天干地支知识点讨论

快速掌握梁钢筋施工算量基本方法

双十一预警！羊毛党的狂欢！！

看图说话之线性回归算法

PID参数的通俗解释，要不要了解一下？

PID分析及参数调整

PS教程：高低频磨皮其实很简单，高低频原理的超详细说明

卖得很好的产品，销量莫名下降怎么办？

常用算法之滑动窗口

一个著名的最贪心也最厉害的算法——Dijkstra算法

拼多多店铺如何快速提升销量和排名？

更新后的扫地机有多了哪些功能

洪量老师：企业是企业家带着一群人做一件有意义的事情

称球问题的通用解法

快速求出淘汰赛中轮空场次-最简单的算法

如何分配社会悲剧

巧算79764168÷7986

终于有人把数据、信息、算法、统计、概率和数据挖掘都讲明白了！

生产成本控制：减少消除控制法，如何控制生产中两类减少三类消除

铜排计算方法、折弯经验计算表、铜排载流量，铜排截面积计算公式

一文了解刀具和刀具半径补偿，想不看都难！

算法“急转弯”——燃香计时

为什么有的身份证号末位数字是“X”的，有什么特殊的含义吗？

梁钢筋算量的基本方法

「坐在马桶上看算法」算法6：只有五行的Floyd最短路算法

最快最简单的排序——桶排序

火爆刷单界的“凌晨单”，到底是什么逻辑？

十大经典图算法PageRank

懂你背后的苦

限流算法：漏桶与令牌桶

09.26 学术动态：单绕组无轴承开关磁阻电机的绕组开路故障容错控制策略

08.30 终于有人把数据、信息、算法、统计、概率和数据挖掘都讲明白了！

08.13 超全的人工及材料用量算法 造价人员都在用！

06.22 教孩子最快速算法

05.15 限流算法之令牌桶算法、漏桶算法

05.07 自建房钢筋算量不求人，记住各部位钢筋计算公式，自己也能做预算

04.24 目前最快最简单的神速排序算法——桶排序

02.18 算法——递归（以汉诺塔为例）

02.02 即使不背九九乘法表也能用画线数点法来计算乘法

01.26 “儿童邪典片”肆虐，算法“价值中立”论最该批！

头条年底上头条的方式竟然是这样的！

人脸识别算法的巅峰之际，为什么需求最痛的安防行业还是无法大规模应用？

沈巍先生杂谈（358）说好的快手不倒，陪伴到老呢？个个都是戏精

出海奋斗是有胆识后浪的更优选项

甲有5套房，不上班，收房租；乙有1套房，上班赚工资；丙租房子.

每逢佳节被相亲，单身青年看这里！

为珠峰“量身高”，为啥要人上去？

我省获国家局通报表扬

湖南名字最尴尬的城市，90%的人都会想歪，当地人：思想有问题！

超六成前浪点赞《后浪》，全球白手起家90后富豪人均财富190亿

再不来一场精致野餐，我就要被开除中产籍了

工程师我只服中国，曾经放生到三峡的1万条鱼，如今怎么样了？

后疫情时代的五个营销启示

丘北县双龙营镇人民政府普者黑村委会、矣则村委会太阳能路灯采购安装项目竞争性谈判公告

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了

肖战视频专访：眼里带着故事，请不要听说他，这一次，请他说

秦山核电应急行动水平优化项目招标公告

巴基斯坦SK水电站消防及火灾报警系统设备采购招标招标公告

中煤能源新疆鸿新煤业苇子沟煤矿瓦斯抽采机械设备采购招标公告

县域社区团购，在平台发展上有哪些优势？

和王为念离婚，与“假奶奶”常香玉对簿公堂，55岁小香玉生活如诗

眼力测试：由4字组成的白菜，1秒看出4个字的智商都很高

看图猜字：这个不简单，你能猜对几个？全猜对眼力非凡

眼力测试：火焰中藏了4个字，看出3个算达标，全看出眼力200

小米硬刚德国双立人，400年非洲灌木做家用砧板，不发霉砍不坏

眼力测试：美女图中藏了5个汉字，全部看出来的眼力超群

08.13 超全的人工及材料用量算法造价人员都在用！

衡水：守护一湖碧水打造生态之城

2020珠峰高程复测出发仪式今日举行小米10全程助力丈量世界新高度