首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到17条相似文献,搜索用时 64 毫秒
1.
数据仓库中基于密度的批量增量聚类算法   总被引:2,自引:0,他引:2  
数据仓库为数据挖掘提供了很好的平台,当数据仓库中的数据发生变化时,原来挖掘出来的模式也要相应地进行更新。MartinEster等最先提出了增量聚类算法,但算法在增量聚类过程中,更新对象依次一个个地单独处理,而没有考虑更新对象之间的关系,效率较低。该文提出了基于DBSCAN算法的批量增量聚类算法,减少了对象的检索,提高了增量聚类的效率。  相似文献   

2.
聚类是数据挖掘领域中最活跃的研究分支之一,聚类技术在其他的科学领域也有广泛的应用。迄今为止已经提出了大量的聚类算法,其中基于密度的DBSCAN算法因其很多优点而备受关注,为了减少DBSCAN的区域查询次数,降低I/O开销而提出的改进算法有FDBSCAN、LSNCCP等。随着应用的发展,增量聚类显得越来越重要,而现有的增量聚类算法存在很大的局限性。基于LSNCCP,提出了一种有效的增量聚类算法,同时它也可以用于对LSNCCP进行性能优化。  相似文献   

3.
一种基于网格的增量聚类算法*   总被引:1,自引:0,他引:1  
分析了现有基于网格的聚类算法,该算法具有高效且可以处理高维数据的特点,但传统网格聚类算法的聚类质量受网格划分的粒度影响较大。为此,提出了一种基于网格的增量聚类算法IGrid。IGrid算法具有传统网格聚类算法的高效性,且通过维度半径对网格空间进行了动态增量划分以提高聚类的质量。在真实数据集与仿真数据集上的实验结果表明,IGrid算法在聚类准确度以及效率上要高于传统的网格聚类算法。  相似文献   

4.
动态增量聚类的设计与实现   总被引:2,自引:0,他引:2       下载免费PDF全文
传统聚类算法往往只适用于静态数据集的聚类。对于动态数据集,新增数据后,前期的聚类结果不再可靠,运用此类算法则需要重新聚类,这样会造成效率低下和计算资源浪费。在基于密度和自适应密度可达聚类算法的基础上,提出了一种新的增量聚类算法。理论分析和实验结果证明该算法能够有效地处理动态数据集,提高聚类效率和资源的利用率。  相似文献   

5.
一种基于密度的高性能增量聚类算法   总被引:4,自引:1,他引:4       下载免费PDF全文
刘建晔  李芳 《计算机工程》2006,32(21):76-78
提出并证明了一种基于密度的高性能增量聚类算法,算法的主要工作包括:(1)利用分区和抽样技术对数据进行抽取和清理。(2)利用密度和网格技术对数据进行聚类。(3)改变阈值后提出一种增量算法,只对受影响的点重新计算聚类。(4)在动态环境下,数据增删后的增量聚类算法。实验证明,该算法能很好地处理高维数据,有效过滤噪声数据,大大节省聚类时间。  相似文献   

6.
目前的动态文摘方法几乎都是基于文档批处理机制的,无法适应实际应用中文档数据是以不稳定的数据流形式到来,需要实时更新摘要的需求。针对上述问题,提出一种利用K近邻思想对句子进行建模,再增量聚类句子实现子主题划分的动态文本摘要方法。该方法根据K近邻基本思想形成两层句子图模型,用增量图聚类方法对句子进行处理,同时考虑结合时间因素提高句子新颖度来抽取动态文摘。该方法能基于文档数据流增量式地抽取动态文摘,实现文摘内容的实时更新。通过在TAC2008和TAC2009的Update Summarization数据集上的测试,证明本文方法在动态文摘抽取上的有效性。  相似文献   

7.
黄伟  郭鑫  周清平 《计算机工程》2011,37(24):25-27
现有的树聚类算法在树数据库实时更新后无法及时更新已有的聚类结果。为此,建立一种支持实时增量更新的闭子树聚类模型,以解决闭子树的增量聚类问题并提高聚类效率。针对树的半结构化特性,将结点语义和结点-边的结构特性结合在一起,提出一种准确率更高的树相似性度量方法,在此基础上,利用CTUM算法、TC算法和UTC算法,分别解决闭子树增量更新、聚类和增量聚类等问题。实验结果表明,该算法具有较高的运行效率和聚类准确率。  相似文献   

8.
针对分布式数据流聚类算法存在的聚类质量不高、通信代价大的问题,提出了密度和代表点聚类思想相结合的分布式数据流聚类算法。该算法的局部站点采用近邻传播聚类,引入了类簇代表点的概念来描述局部分布的概要信息,全局站点采用基于改进的密度聚类算法合并局部站点上传的概要数据结构进而获得全局模型。仿真实验结果表明,所提算法能明显提高分布式环境下数据流的聚类质量,同时算法使用类簇代表点能够发现不同形状的聚簇并显著降低数据传输量。  相似文献   

9.
针对传统增量聚类方法对混合属性数据聚类时存在不稳定、随机性大和准确性不够高的缺点,提出一种基于聚类融合的混合属性数据增量聚类算法.该算法以传统增量聚类为基础,采用多种聚类算法的结果进行融合来代替原有单一划分,并重新修正了阈值的取值范围.实验表明,所提出的算法利用原有数据的特征,提高了聚类的稳定性和精确性,具有很好的聚类效果.  相似文献   

10.
《传感器与微系统》2019,(2):136-139
大多数聚类算法都是在静态情况下运行,使其不允许添加任何增量数据。提出了一种基于K近邻(KNN)的增量聚类算法,算法包含两个创新点,利用K近邻的思想和样本紧密度两个条件处理增量数据;根据簇特征的变化分裂或合并簇。实验表明:提出的算法既可以发现新簇,又能有效规避噪声点,且能够处理非球形的数据集。  相似文献   

11.
基于簇特征的增量聚类算法设计与实现   总被引:2,自引:0,他引:2       下载免费PDF全文
对于大型数据库,如空间数据库和多媒体数据库,传统聚类算法的有效性和可扩展性受到限制。通过动态增量的方法,在基于密度和自适应密度可达聚类算法的基础上,根据BIRCH算法中聚类特征的概念,利用簇特征设计与实现了一种新的动态增量聚类算法,解决了大型数据库聚类的有效性以及空间和时间复杂度问题。理论分析和实验结果证明该算法能够有效地处理大型数据库,使聚类算法具有良好的可扩展性。  相似文献   

12.
数据挖掘领域中已提出了很多聚类算法及其改进形式,但对增量式聚类方法的研究较少。当数据集因为更新而发生了变化,那么数据挖掘结果也要进行必要的更新。由于数据量大,如果在新增数据后再对所有数据运用聚类算法进行聚类,效率显然不高,因此进一步研究增量式聚类算法是很有必要的。在一种改进的基于遗传算法的粗糙聚类方法(IRCBGA)的基础上,提出了一种增量式粗糙聚类方法。数值仿真表明该算法能很好地解决传统聚类算法的数据更新的聚类问题。  相似文献   

13.
介绍Web文档聚类的应用,针对现有文档聚类算法缺乏动态更新能力、经验参数过多以及缺乏对新词的把握等不足,提出动态调整的Web文档增量聚类(Dynamically Adjusted Incremental Web Document Clustering,DAIWDC)算法,并使用同义词词林优化结果.该算法在实验中达到了88%的正确率和75%的全面率,表明其具有较高的实用价值.  相似文献   

14.
针对FCM算法的缺点,提出了一种基于改进的FCM的增量式聚类方法。该算法首先对模糊C均值算法进行加权,并将权系数归一化,然后将改进的算法与增量式聚类算法结合。改进的方法既提高了FCM算法的性能,避免了FCM算法的缺陷,并能够实现增量式聚类,避免了大量的重复计算,并且不受孤立点的影响。实验表明该算法的有效性。  相似文献   

15.
以密度敏感距离作为相似性测度,结合近邻传播聚类算法和谱聚类算法,提出了一种密度敏感的层次化聚类算法。算法以密度敏感距离为相似度,多次应用近邻传播算法在数据集中选取一些“可能的类代表点”;用谱聚类算法将“可能的类代表点”再聚类得到“最终的类代表点”;每个数据点根据其类代表点的类标签信息找到自己的类标签。实验结果表明,该算法在处理时间、内存占用率和聚类错误率上都优于传统的近邻传播算法和谱聚类算法。  相似文献   

16.
为了提高进化数据流的聚类质量,提出基于半监督近邻传播的数据流聚类算法(SAPStream),该算法借鉴半监督聚类的思想对初始数据流构造相似度矩阵进行近邻传播聚类,建立在线聚类模型,随着数据流的进化,应用衰减窗口技术对聚类模型适时做出调整,对产生的类代表点和新到来的数据点再次聚类得到数据流的聚类结果。对数据流进行动态聚类的实验结果表明该算法是高质有效的。  相似文献   

17.
为解决密度聚类算法在处理高维和多密度数据集时聚类结果不精确的问题,提出一种基于共享近邻亲和度(SNNA)的聚类算法。该算法引入[k]近邻和共享近邻,定义共享近邻亲和度作为对象的局部密度度量。算法首先根据亲和度来提取核心点,然后利用广度优先搜索算法对核心点进行聚类,最后对非核心点进行指派即完成整个数据集的聚类。实验结果表明,该算法能够发现任意形状、大小、密度的聚类;与同类算法相比,SNNA算法在处理高维数据时具有较高的聚类准确率。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号