使用Apriori算法进行关联分析（1）

2018-05-17 15:21:37 一兒口山石

1.1关联分析

关联分析是一种在大规模数据集中寻找有趣关系的任务。这些关系可以有两种形式：频繁项集或关联规则。

频繁项集（frequent Item sets）：是经常出现在一块的物品集合；

关联关系（association rules）：暗示两种物品之间可能存在很强的关系；

如下给出了一个某杂货店的交易清单。

频繁项集是指经常在一起的物品集合，如图中{葡萄酒，尿布，豆奶}就是频繁项集的一个例子。同时也能找到关联规则诸如：尿布à葡萄酒规则，意味着如果有人买了尿布就很有可能也会购买葡萄酒。

一个项集的支持度（support）被定义为数据集中包含该项集的记录所占的比例。从上图中可以达到{豆奶}的支持度为4/5，而{豆奶，尿布}在5条交易记录中有出现3次，因而{豆奶，尿布}的支持度为3/5。

可信度或置信度（confidence）是针对一条诸如{尿布}à{葡萄酒}的关联规则来定义的。这条规则被定义为：“支持度（{尿布，葡萄酒}）/（{尿布}）”。如上图所示的，{尿布，葡萄酒}的支持度为3/5，尿布支持度为4/5，所以“尿布à葡萄酒”的可信度为3/4=0.75。这意味着对于所有包含“尿布”的所有记录。

1.2Apriori原理

假设一家杂货铺，那些经常被一起购买的商品被假设为：商品0，商品1，商品2,和商品3。按照前面提到的支持度规则，得到某件商品的支持度需要所有商品可能出现的组合进行遍历，就是说，4种商品就有15种组合出现的可能。比如说商品{1}的支持度为：1/15。显然有一个很明显的问题：N中商品的数据集共有2N-1种项集组合。假设有100种商品就会有1.26*1030种可能的项集组合，这对于现代计算机来说是一个长时间的运算过程。

Apriori原理就是说如果某个项集是频繁的，那么他的子集也是频繁的。反过来看，如果一个项集是非频项集，那么它的所有超集也是非频繁的。

1.3使用Apriori算法发现频繁项集

对于去购买某杂货店的商品，假设存在N种，理论上存在2的N次方-1中购买组合可能。

按照上图给出一个示例：假设存在一些商品项集分别用1,2,3,4,5表示。

假定存在数据集dataSet：[[1, 3, 4], [2, 3, 5], [1, 2, 3, 5], [2, 5]]

由数据集获得第一个候选项集合C1：[frozenset([1]), frozenset([2]), frozenset([3]), frozenset([4]), frozenset([5])]，C1中包含了每个frozenset中的单个物品项

构建集合表示数据集D：[set([1, 3, 4]), set([2, 3, 5]), set([1, 2, 3, 5]), set([2, 5])]；

按照数据集计算支持度：Support(1) = 1/2;Support(2) = 3/4; Support(3) = 3/4; Support(4) = 1/4; Support(5) = 3/4；

和最小支持度作对比得到L1：[frozenset([1]), frozenset([3]), frozenset([2]), frozenset([5])]；

经过上述步骤，得到的L1列表出现的事物至少出现在50%以上的记录中（物品4并没有达到最小支持度，所以清除出列表）。

重复以上步骤，通过减少商品减少查找频繁项集的工作量。

1.4从频繁项集中挖掘关联规则

首先默认从频繁项集中寻找关联规则，很显然一个频繁项集{豆奶，莴苣}假设存在一个关联规则“豆奶à莴苣”，意味着购买豆奶的人很大可能会购买莴苣，但是这个规则反过来“莴苣à豆奶”却并不一定成立。（从逻辑研究上来讲，箭头左边的集合称作前件，箭头右边称为后件）。

前面也提到频繁项集使用支持度来量化，而关联规则也有自己的量化方式：可信度。一条关联规则的可信度PàH的可信度定义为support（P|H）/support（P），在python中符号|表示集合中的并操作。与频繁项集一般，关联规则也可以观察到：如果某条规则并不满足最小可信度的要求，那么该规则的子集也不可能满足最小可信度要求。

分享到:

閱讀更多 一兒口山石 的文章

關鍵字: 关联葡萄酒分析

吴伟召：证据证明力与证据综合认证基础理论初探

#安全提示每日一图#

“疑与确诊邻居走同楼梯被传染”，北京通报首例境外输入关联病例

昨日新增报告境外输入病例31例，境外输入关联病例1例涉及的小区

系统的基本特征

EPLAN应用技巧(10)-成对的关联参考

费曼学习法实际使用过程中的体会

EPLAN应用技巧(9)-关联参考触点映像的显示

关联烟标这样玩

非同相接地故障分析

来点分析图

设备故障分析处理

成型不良与模具设计分析

SolidWorks工程图打开后图纸没有了空白了怎么办？还能找回来吗？

分析下细思极恐的小故事吧

风险的辨识、分析与管控

闪送年度分析报告

哪两句诗句毫无关联，连接起来却十分和谐？听网友的回答

「分析」初三看现在，初二看未来——评2019初三一模数学

全局之眼

被问及难以回答的问题时，可反问对方其他有关联的事

这三种避免逾期的方法，最有效！

002297 博云新材财务分析

怎样去炒一个爆款呢？直通车测图，还有没有别的方法呢？

江苏鼎盛二手挖机市场提供挖掘机电路大全「值得收藏」

双关联：“琐事无绝对”，邀对下联

挖掘机电路问题你真的都了解吗

新初一：七年级第一次月考分析

道德修养及失德与健康分析表

创业公司如何快速推广微信小程序，从这五个渠道入手

同一个法人关联公司达196家这家公司是要做什么？

教您一招辨别经营异常的公司切莫和税务有问题的公司合作

小程序新手教程之注册小程序（2）

尺寸链计算及公差分析

七星产品培训会，火爆全场！

吴小康于津平：产品关联密度与企业新产品出口稳定性

成交三大系统和流程（下）

规律图分析，今晚就看你的了20180805

哪两句诗句毫无关联，连接起来却十分和谐？网友们好有才！

哪两句诗句毫无关联，连接起来却十分和谐？

线索常见的形式

「即速应用」最新免费制作小程序教程，看完赶紧收藏！

辰东《圣墟》《遮天》《完美》关联

06.01 做精益改善，先要分析效率

树与风的奇妙关联

亚盘分析，百家欧赔！

Mybatis的关联映射

活动策划与活动执行有哪些不同？

沈巍先生杂谈（358）说好的快手不倒，陪伴到老呢？个个都是戏精

转念一想，这种看似不正常的状态才是正常的，随着时间的推移，很多过去迷迷糊糊的人慢慢就看清了，是进是退跟着内心走就好，别管什么善始善终，不要被这种论调道德绑架，过段时间，你觉得可以，再回来就行，开关在你自己手里，一秒钟就能完成进退。

出海奋斗是有胆识后浪的更优选项

东南亚11国，除去东帝汶，其他10国组成东盟。东南亚有多热，从很多国际资本的快速涌入都有目共睹。养老产业：泰国、越南、菲律宾、马来西亚、印尼都是大受欧美日韩退休人士欢迎的亚洲养老目的地。

甲有5套房，不上班，收房租；乙有1套房，上班赚工资；丙租房子.

每逢佳节被相亲，单身青年看这里！

“非常战疫

为珠峰“量身高”，为啥要人上去？

6日，2020珠峰高程测量行动测量登山队举行出发仪式，30多名计划登顶的测量登山队员当日从海拔5200米的珠峰登山大本营向更高海拔出发，计划抓住近日的天气窗口，择日登顶测量。如果成功，这将成为我国专业测绘人员首次登顶珠峰测高。

我省获国家局通报表扬

湖南名字最尴尬的城市，90%的人都会想歪，当地人：思想有问题！

湖南省作为中国中南地区的一个省份，经济强劲，地位独特，有着十足的发展后劲。湖南经济总量在全国排名第九。湖南也是华夏文明的发祥地，境内的炎帝陵，成为华夏儿女寻根祭祖的重要场所。南岳衡山就在湖南衡阳。湖南张家界景区成为驰名中外的旅游景点。湖南湘西凤凰古镇成为中国驰名十大古镇之一。

超六成前浪点赞《后浪》，全球白手起家90后富豪人均财富190亿

再不来一场精致野餐，我就要被开除中产籍了

《新周刊》创刊于1996年8月18日，由南方出版传媒股份有限公司主管、主办，以“中国最新锐的生活方式周刊”为定位，推出过一系列极具影响力的专题报道，是中国期刊市场最具代表性和影响力的杂志之一，享有“话题策源地”的美誉。

工程师我只服中国，曾经放生到三峡的1万条鱼，如今怎么样了？

每一个大项目其实都会面临一个问题，那就是生态环境，因为所涉及的范围实在太广了，所以需要考虑的问题都是多方面的，三峡就是我国早期的一个超大体量的工程，而三峡所涉及的问题也很多。三峡其实一直都是我国的骄傲，但是关于三峡的质疑声，其实也一点都不少，特别是关于三峡环境方面的质疑声。

后疫情时代的五个营销启示

现象级白酒——李渡高粱酒，作为沉浸式/场景化营销的开创者，早在几年前就使用互联网工具助力，疫情爆发后一系列的操作自然游刃有余了，销量同比增加170%，线上销量更是增加400%。

丘北县双龙营镇人民政府普者黑村委会、矣则村委会太阳能路灯采购安装项目竞争性谈判公告

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了金子一直是我们中国人比较喜欢投资的一个东西，黄金饰品也是中国女性非常喜欢购买的东西，大家都知道，金子具有保值的功能，所以很多人既喜欢在银行购买金条用于投资，又喜欢去一些金店购买黄金饰品。

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了大家都会知道，每到夏天，我们的沿海地区都是一个多风多雨的季节，这时候我们出门也是需要随时带上雨具，避免突然有暴风雨这些天气的出现。

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了每次一到假期，就非常害怕到达火车站，可以说是基本上都是人山人海的感觉。很多人会为了方便去选择去乘坐动车和高铁。现在我们无论是出差还是去旅游也都是会选择去坐动车，又快又方便，主要还会很舒服。

肖战视频专访：眼里带着故事，请不要听说他，这一次，请他说

这是肖战春节后，经历过这么多事后首次参加采访。视频中他依然是面带微笑，依旧是少年的样子。但是眼里到这故事，说话也变得小心谨慎，谈吐措辞也是越来越严谨了。

秦山核电应急行动水平优化项目招标公告

从中国电力集采招标网（www.dljczb.

巴基斯坦SK水电站消防及火灾报警系统设备采购招标招标公告

从中国电力集采招标网（www.dljczb.

中煤能源新疆鸿新煤业苇子沟煤矿瓦斯抽采机械设备采购招标公告

从中国电力集采招标网（www.dljczb.

县域社区团购，在平台发展上有哪些优势？

社区团购的迅速发展，已经不再局限于各大城市中的小区。渐渐的扩大范围，发展到一些城市边缘的县城乡镇。像是兴盛优选、十荟团、食享会、考拉精选、美家买菜等月流水上亿的社区团购头部企业，都很重视下沉市场的布局和开拓。

和王为念离婚，与“假奶奶”常香玉对簿公堂，55岁小香玉生活如诗

戏曲是以古代故事以及现代经典故事为题材的艺术表演，也是历史悠久的综合舞台艺术样式，表演戏曲难度很高，但戏曲人才依旧人才辈出，说起在戏曲圈中的佼佼者，陈百玲必是其一。

眼力测试：由4字组成的白菜，1秒看出4个字的智商都很高

这是一幅白菜图，由4字组成的，1秒看出4个字的智商都很高！你看出来了吗？

看图猜字：这个不简单，你能猜对几个？全猜对眼力非凡

这福图上的图你能猜对几个？全猜对眼力非凡，猜对3个眼力160，猜对3个是近视眼！你能猜对几个字？

眼力测试：火焰中藏了4个字，看出3个算达标，全看出眼力200

熊熊火焰中藏了4个字，看出3个算达标，全看出眼力200！你能全部看出来吗？

小米硬刚德国双立人，400年非洲灌木做家用砧板，不发霉砍不坏

民以食为天。

眼力测试：美女图中藏了5个汉字，全部看出来的眼力超群

这幅美女图中藏了5个汉字，你能不能看出来是哪几个汉字呢？全部看出来的眼力超群！

最萌Hodler，刚出生就收到比特币大学教育基金的宝宝

作为比特币爱好者，Izabella的父母在她出生当日于《泰晤士报》刊登了一则附带比特币地址的小广告，希望广大读者能够捐出小部分比特币给他们女儿作为大学教育基金。

《瞭望大湾区》：全国中高风险区域今日“清零”

《晨会解读》：中山证券投资顾问杨立华：连续上涨过后注意把握好操作节奏

孙松峰：幸福生活唱出来

河南市场安全网讯（www.hnscjgw.com）

衡水：守护一湖碧水打造生态之城

长城网衡水讯（记者张梅胜

英国小伙第一次体验中国网吧，就被电脑屏幕吓到直言：这是个啥

网吧其实不管是对于哪个国家的人来说，都是极具吸引力的，而在中国对于八九四年的年轻人和学生来说，网吧简直就是快乐源泉，但是也是老师家长中的眼中钉，肉中刺。相信很多人小时候可能都有过被家长从网吧里揪出来的不甚美好的回忆。

微商到底多能吹牛！哈哈哈哈哈千万别屏蔽，每天都是快乐源泉

虽然有的时候在朋友圈里有很多微商不停的发朋友圈，让大家觉得有些困扰和烦闷，有一种私生活被侵扰的感觉。但是不要忙着屏蔽他们，有的时候这些总是吹得天花乱坠的微商也能给人们带来快乐的源泉。

2020珠峰高程复测出发仪式今日举行小米10全程助力丈量世界新高度

5月6日，2020珠峰高程测量登山队伍出发仪式正式举行，30多名队员当日从海拔5200米的登山大本营向更高海拔出发，开启珠峰冲顶测量。队员们力争抓住近日的天气窗口，择日登顶测量。如果成功，这将是我国专业测绘人员首次登顶珠峰测高。

“十大沂蒙工匠”齐玉祥：钢花璀璨照亮青春之路

一支焊枪、一面防护罩，钢花白昼繁星，在刺耳的噪声中点亮四壁，焊工齐玉祥用13年的青春，打磨出了人生最璀璨的钢花。2007年，齐玉祥毕业后进入山东华源锅炉有限公司工作。刚进公司没多久，由于工作需要，他被分配到了焊接岗位。

日本的丈母娘，卖萌发嗲也是蛮有技术的

国内这点估计是比不过了

消费水平最高的5座城市，北上广深均在列，另一座你知道是哪吗？

我们都知道在地大物博的中国，拥有很多城市，而它们之间的等级划分也都是不同的，等级越高，往往消费就会越高，那么说起国内消费水平最高的几座城市，伙伴们都知道是哪里吗？接下来就让小编带大家去了解一下吧，看看有没有你心中的那个。

德国爱他美怎么样？"断货王"爱他美值得买吗？

哈哈。每次都会用iGepir 姐姐推荐来的，小宝从6个月混养喝起，现在快1岁半了，一直喝爱他美，不上火，购入量大，也算全心全意支持国际妈咪了

广东有望合并的3座城市：合并成功后，将诞生一座千万人口的城市

相信大家都知道，目前广东是中国经济实力最强的城市，哪怕是国内富有的浙江和江苏，在经济上也被广东牢牢按住。你要知道广东可是中国唯一有一线城市的省份，而且还是两座。光靠这一点就能让全国所有的省份羡慕，但比较遗憾的是，广东的经济发展似乎并不平衡。

国外奶粉怎么样？去哪买靠谱？线下实体店一定比网店安全吗？

之前买的一直是国际妈咪的海外仓，但是疫情的缘故怕被吧断粮所以在海外仓直邮了一箱又在自贸仓补了一箱，反正奶粉是消耗品，不担心吃不完hhh。自贸仓物流速递还是很快的，重庆保税区发货，4天到达。

四川潜力大的城市：还是重要的恐龙化石产地，被誉为“恐龙之乡”

对此有的网友说:很多人可能不知道，其实我们自贡还有飞机制造，汽车制造，新能源汽车，及新能源电池研发与制造产业，虽然刚起步，但未来可期!

00后，吾辈当自强

当记者采访她时，她说了一句让人永生难忘的话:“其实我们并不是什么逆行者，只不过是一些普通人在坚守自己的使命。

“我来！”

十天，我应该可以读完一本《百年孤独》，应该可以学会用吉他弹一首歌，还应该可以追完一部电视剧《庆余年》。

东北唯一新一线城市：被誉为“东方鲁尔”，经济却不如省内地级市

众所周知这几年东北的经济，确实没有以前增长得那么快了。原因相信大家也很清楚，简单点说就是南方更适合发展经济。因此中国的经济重心向南移动，所以在未来的几年甚至几十年里面，中国南方的经济都会比北方强。特别是广东省跟浙江省的经济水平，目前已经超越世界上大部分国家了。

人生有尺，做人有度

“救命钱”变“唐僧肉” 扶贫最后一公里处“蝇贪”频现！

家境殷实的90后海归女为何“沉迷”偷快递？

青春洋溢，不加过分修饰，真实的少女感，你喜欢吗？

4名网友预谋绑架一董事长，汇合后剧情突变……

江苏的第二个“苏州”，并非南京和无锡，而是这座低调的城市

说起苏州的大名，相信是无人不知，无人不晓的，作为我国名副其实的最强地级市，苏州近些年属实为人们带来了很大惊喜，甚至在经济发展上也已经远超省会南京，而今天小编要为大家带来的则是江苏境内的“第二个苏州”，发展潜力巨大，并非南京和无锡，而是这座十分低调的城市。

使用Apriori算法进行关联分析（1）

相關文章:

吴伟召：证据证明力与证据综合认证基础理论初探

#安全提示每日一图#

“疑与确诊邻居走同楼梯被传染”，北京通报首例境外输入关联病例

昨日新增报告境外输入病例31例，境外输入关联病例1例涉及的小区

系统的基本特征

EPLAN应用技巧(10)-成对的关联参考

费曼学习法实际使用过程中的体会

EPLAN应用技巧(9)-关联参考触点映像的显示

关联烟标这样玩

非同相接地故障分析

来点分析图

设备故障分析处理

成型不良与模具设计分析

SolidWorks工程图打开后图纸没有了空白了怎么办？还能找回来吗？

分析下细思极恐的小故事吧

风险的辨识、分析与管控

闪送年度分析报告

哪两句诗句毫无关联，连接起来却十分和谐？听网友的回答

「分析」初三看现在，初二看未来——评2019初三一模数学

全局之眼

被问及难以回答的问题时，可反问对方其他有关联的事

这三种避免逾期的方法，最有效！

002297 博云新材 财务分析

怎样去炒一个爆款呢？直通车测图，还有没有别的方法呢？

江苏鼎盛二手挖机市场提供挖掘机电路大全「值得收藏」

双关联：“琐事无绝对”，邀对下联

挖掘机电路问题你真的都了解吗

新初一：七年级第一次月考分析

道德修养及失德与健康分析表

创业公司如何快速推广微信小程序，从这五个渠道入手

同一个法人关联公司达196家 这家公司是要做什么？

教您一招辨别经营异常的公司 切莫和税务有问题的公司合作

小程序新手教程之注册小程序（2）

尺寸链计算及公差分析

七星产品培训会，火爆全场！

吴小康 于津平：产品关联密度与企业新产品出口稳定性

成交三大系统和流程（下）

规律图分析，今晚就看你的了20180805

哪两句诗句毫无关联，连接起来却十分和谐？网友们好有才！

哪两句诗句毫无关联，连接起来却十分和谐？

线索常见的形式

「即速应用」最新免费制作小程序教程，看完赶紧收藏！

辰东《圣墟》《遮天》《完美》关联

06.01 做精益改善，先要分析效率

树与风的奇妙关联

亚盘分析，百家欧赔！

Mybatis的关联映射

活动策划与活动执行有哪些不同？

沈巍先生杂谈（358）说好的快手不倒，陪伴到老呢？个个都是戏精

出海奋斗是有胆识后浪的更优选项

甲有5套房，不上班，收房租；乙有1套房，上班赚工资；丙租房子.

每逢佳节被相亲，单身青年看这里！

为珠峰“量身高”，为啥要人上去？

我省获国家局通报表扬

湖南名字最尴尬的城市，90%的人都会想歪，当地人：思想有问题！

超六成前浪点赞《后浪》，全球白手起家90后富豪人均财富190亿

再不来一场精致野餐，我就要被开除中产籍了

工程师我只服中国，曾经放生到三峡的1万条鱼，如今怎么样了？

后疫情时代的五个营销启示

丘北县双龙营镇人民政府普者黑村委会、矣则村委会太阳能路灯采购安装项目竞争性谈判公告

为什么重量相同的金子，银行卖得比金店还便宜？看完涨知识了

打雷的时候，到底要不要拔掉插头，关闭电路呢？看完涨知识了

乘坐火车时，把车票弄丢了怎么处理？看完可算知道了

肖战视频专访：眼里带着故事，请不要听说他，这一次，请他说

秦山核电应急行动水平优化项目招标公告

巴基斯坦SK水电站消防及火灾报警系统设备采购招标招标公告

中煤能源新疆鸿新煤业苇子沟煤矿瓦斯抽采机械设备采购招标公告

县域社区团购，在平台发展上有哪些优势？

和王为念离婚，与“假奶奶”常香玉对簿公堂，55岁小香玉生活如诗

眼力测试：由4字组成的白菜，1秒看出4个字的智商都很高

看图猜字：这个不简单，你能猜对几个？全猜对眼力非凡

眼力测试：火焰中藏了4个字，看出3个算达标，全看出眼力200

小米硬刚德国双立人，400年非洲灌木做家用砧板，不发霉砍不坏

眼力测试：美女图中藏了5个汉字，全部看出来的眼力超群

最萌Hodler，刚出生就收到比特币大学教育基金的宝宝

《瞭望大湾区》：全国中高风险区域今日“清零”

《晨会解读》：中山证券投资顾问杨立华：连续上涨过后注意把握好操作节奏

孙松峰：幸福生活唱出来

002297 博云新材财务分析

同一个法人关联公司达196家这家公司是要做什么？

教您一招辨别经营异常的公司切莫和税务有问题的公司合作

吴小康于津平：产品关联密度与企业新产品出口稳定性

衡水：守护一湖碧水打造生态之城

2020珠峰高程复测出发仪式今日举行小米10全程助力丈量世界新高度