首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到18条相似文献,搜索用时 109 毫秒
1.
发现最大频繁项目集是关联规则挖掘的重要步骤,针对关联规则挖掘中最小支持度发生变化的增量式更新问题,提出了高效发现最大频繁项目集的更新算法.该算法在FP树的基础上增加了记录各项目支持数的表,在头表中增加了域,从而减少了访问事务数据库和FP树的时间,提高了发现最大频繁项目集的效率.  相似文献   

2.
发现最大频繁项目集是关联规则挖掘的重要步骤,针对关联规则挖掘中最小支持度发生变化的增量式更新问题,提出了高效发现最大频繁项目集的更新算法.该算法在FP树的基础上增加了记录各项目支持数的表,在头表中增加了域,从而减少了访问事务数据库和FP树的时间,提高了发现最大频繁项目集的效率.  相似文献   

3.
在关联规划挖掘理论研究上,首次给出了项目序列集格空间,并且探讨了在这个空间上的基本操作算子、基于项目序列集格空间及其操作,建立了关联规则挖掘模型.在关联规则挖掘算法方面,设计了基于项目序列集操作理论的关联规则挖掘算法SIS,该算法执行时间整体上优于Apriori算法,而且随着数据量的增大,该算法执行时间的增长幅度也小于Apriori算法.  相似文献   

4.
高效关联规则数据挖掘算法研究   总被引:4,自引:0,他引:4  
关联规则挖掘是数据挖掘领域的一个重要问题,由于关联规则挖掘通常是基于超大型数据库或数据仓库,算法的效率在一定程度上决定挖掘的成败,针对关联规则挖掘中的主要任务--频集发现过程中存在的几个问题,提出了项目树的概念,引出了一种新的控制模式,并设计了相应的高效挖掘算法,大大提高了挖掘效率。  相似文献   

5.
为减少高昂的计算代价 ,用挖掘最大频繁模式集代替挖掘频繁模式集是近年来提出的一个重要研究策略。由最大频繁模式集可求出所有频繁模式 ,但数量上却可以小几个数量级 ,从而可大大减少计算代价。通过对最大频繁模式挖掘的问题描述 ,以及关键问题的分析 ,针对频繁模式树 (FP- tree)和最大频繁模式的特点 ,给出了基于频繁模式树的最大频繁模式挖掘算法 (MMFP) ,采取先挖掘候选最大频繁模式再判断子集的方法 ,经示例分析表明该算法是有效的。提出的单路径修剪和项目修剪等修剪方法大大减少了侯选最大频繁模式的个数 ,对算法的性能提高起到了关键作用。  相似文献   

6.
为减少高昂的计算代价,用挖掘最大频繁模式集代替挖掘频繁模式集是近年来提出的一个重要研究策略。由最大频繁模式集可求出所有频繁模式,但数量上却可以小几个数量级,从而可大大减少计算代价。通过对最大频繁模式挖掘的问题描述,以及关键问题的分析,针对频繁模式树(FP-tree)和最大频繁模式的特点,给出了基于频繁模式树的最大频繁模式挖掘算法(MMFP),采取先挖掘候选最大频繁模式再判断子集的方法,经示例分析表明该算法是有效的。提出的单路径修剪和项目修剪等修剪方法大大减少了侯选最大频繁模式的个数,对算法的性能提高起到了关键作用。  相似文献   

7.
数据流挖掘中的主要问题是概念流动和噪音污染。目前的数据流挖掘算法不能有效地处理数据流中的噪音,而一个理想的学习算法应该同时拥有对概念流动的敏感性和对噪音的健壮性。文中探讨了如何使用聚类方法在数据流中区分出噪音实例和难以学习的实例,并提出了相应的概念流动检测方法。在此基础上设计了基于推进技术的集合分类器算法RobustBoosting。通过在合成数据集和实际数据集上的实验,表明文中的算法即使在高达40%的类噪音时,与AdaptiveBoosting算法[1]相比,仍能保持更高的分类准确度,更快地收敛到新的目标概念。  相似文献   

8.
针对数据对象在数据流中的频繁度变化趋势的预测问题,提出基于最大最小频率时间窗模型的最大最小频繁趋势预测算法(MM-FTP).设计一种新的最大最小频繁模式树结构(MMFP-Tree),存储数据流概要信息;提出一种新的数据对象频繁度变化趋势衡量指标--频繁度变化率(FCR),定量地对数据对象的频繁度变化趋势进行描述.该算法同样能够对数据流分类置信度变化趋势及传统的指数变化趋势进行有效预测.结果表明,在真实的网络点击数据流上,该算法能够快速准确地预测数据对象的频繁度变化趋势.  相似文献   

9.
一种多重最小支持度关联规则挖掘算法   总被引:5,自引:0,他引:5  
针对单一最小支持度挖掘关联规则不能反应不同数据项出现频度与性质的问题,提出了一个基于频繁模式树的多重支持度关联规则挖掘算法MSDMFIA(Multiple minimum Supports for Discover Maximum Fre-quent Item sets Algorithm),根据不同数据项的特点定义多重支持度,通过挖掘数据库中的最大频繁项目集,计算最大频繁候选项目集在数据库中的支持度来发现关联规则.该算法可以解决关联规则挖掘中经常出现的稀少数据项问题,并解决了传统的关联规则挖掘算法中的生成频繁候选集和多次扫描数据库的性能瓶颈.实验结果表明,本文提出的算法在功能和性能方面均优于已有算法.  相似文献   

10.
为了提高关联规则挖掘的存储和挖掘效率,该文设计了一种基于逆序编码的Apriori改进算法BF-Apriori。该算法通过分析项目的概率分布并对其进行排序,经行向量逆序编码为二进制数后降低了项目读取的开销和存储开销,同时采用切片运算和剪枝技术降低了规则挖掘运算的时间复杂度。实验结果表明,BF-Apriori算法提高了数据挖掘算法中项目集的存储效率和运算速度。  相似文献   

11.
关联规则挖掘是数据挖掘及知识发现领域的重要研究内容之一,其核心任务是挖掘数据库中的频繁项集.Apriori算法是频繁项集挖掘的有效算法.在Apriori的算法中,采用哈希树存储平凡项集的候补项集以便快速计算其支持度.本文在分析算法所存在的效率瓶颈的基础上,提出了一个有效的改进算法,通过利用一维数组替代算法中复杂的哈希树...  相似文献   

12.
提出了一种基于最小支持度变化的挖掘最大频繁项集的增量式更新算法MFIU(Maximum Frequent Itemsets Updating).针对最大频繁项集更新时的特性,分别对最小支持度变大和变小提出了两种不同的处理方法,对于最小支持度变大的复杂情况,采取了分块的更新策略,并为减少不必要的候选项集,利用了如果X是一个最大频繁项集,则其所有子集都是频繁项集,但都不可能是最大频繁项集,而进行了独特的剪枝方法.最后通过实例分析了该算法.  相似文献   

13.
针对垂直分布下的隐私保护关联规则挖掘算法效率低、安全性不高的问题,提出一种隐私保护频繁闭合项集的挖掘算法。算法利用挖掘频繁闭合项集代替频繁项集,IT-Tree作为搜索空间,Diffsets作为压缩结构,采用基于RSA可交换加密算法的隐私保护集合差集协议。实验结果表明,算法具有较好的隐私性、准确性、高效性。  相似文献   

14.
由频繁项集产生的关联规则往往不能保证规则前、后件中的项是正相关的,因此可能产生无意义的关联规则;当这些关联规则用于分类时,会产生大量无用分类规则,增加了时间开销.因此,基于数学期望提出了正相关的频繁项集的分类算法.该算法在挖掘正相关频繁项集时,利用置信度进行规则选取,生成正相关关联规则组成的分类器对数据集进行分类.实验表明,这种分类算法可以大幅度减少所产生的频繁项集数量,分类准确率达到C4.5和CMAR的水平,且显著减少了算法的时间.  相似文献   

15.
一种Apriori的改进算法   总被引:3,自引:0,他引:3  
在对关联规则挖掘算法Apriori进行深入研究的基础上,提出了一种采用频繁项集Lk-1 与L1连接生成候选项集Ck的思想,并基于这种新的思想提出了一种优化的算法1-K_Apriori算法.在真实数据集和实验数据集上所做的实验及结果表明,1-K_Apriori算法是有效的.  相似文献   

16.
基于FP-tree的快速数据挖掘算法   总被引:1,自引:0,他引:1  
针对挖掘全局频繁项集的算法大多采用的类Apriori算法存在通信量大、同步次数和数据库扫描次数较多等问题,提出了一种基于频繁模式树的快速挖掘全局频繁项集算法(FAMGFI).该算法让各计算机结点采用FP—growth算法独立地计算局部频繁项集,然后与中心结点交互实现数据汇总,最终获得全局频繁项集.FAMGFI算法采用自顶向下和自底向上策略,能大大降低通信量.理论分析和实验结果表明FAMGFI算法是快速而有效的.  相似文献   

17.
大量的候选项集是挖掘路径遍历模式中的主要问题.针对这个问题,提出了基于DHP算法的路径遍历算法,通过使用哈希技术在产生侯选项集时删除不满足条件的项目,这种方法特别是在产生候选2-项目时效率非常高,这样很好的解决了整个处理过程的性能瓶颈.另外,使用了整枝技术使事务数据库的大小在每次扫描后迅速减小.实验结果表明,基于DHP的频繁遍历路径算法在挖掘频繁项目集时是有效的.  相似文献   

18.
关联规则挖掘是数据挖掘领域中的重要研究方向,该文在分析关联规则挖掘Apriori算法原理和性能的基础上,指出了该算法存在着两点不足:扫描事务数据库的次数和连接成高维候选项目集时的比较次数太多。并提出了一种效率更高的S-Apriofi算法,该算法通过采用新的数据结构和原理,克服了传统Apriori算法的缺点,从而大大提高了运算效率。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号