1. 首页
  2. 编程语言
  3. 其他
  4. 论文研究基于Spark框架的FPGrowth大数据频繁项集挖掘算法.pdf

论文研究基于Spark框架的FPGrowth大数据频繁项集挖掘算法.pdf

上传者: 2019-09-26 12:33:47上传 PDF文件 1MB 热度 21次
针对大数据中的频繁项集挖掘问题,提出一种基于Spark框架的FP-Growth频繁项集并行挖掘算法。首先,根据垂直布局思想将数据按照事务标志符垂直排列,以此解决扫描整个数据集的缺陷;然后,通过FP-Growth算法构建频繁模式树,并生成频繁1-项集;接着,通过扫描垂直数据集来计算项集的支持度,从而识别出非频繁项,并将其从数据集中删除以降低数据尺寸;最后,通过迭代过程来生成频繁k-项集。在标准数据集上的实验结果表明,该算法能够有效挖掘出频繁项集,在执行时间方面具有很大的优越性。
下载地址
用户评论