期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

1.

朱颢东周姝钟勇《计算机工程与设计》2010,31(3)

特征选择是文本分类的关键步骤之一,所选特征子集的优劣直接影响文本分类的结果.分析了词频法和文档频法并总结了其缺陷,给出了一个改进的文档频方法;引进粗糙集理论,提出了一个属性约简算法;最后提出了一个新的特征选择方法.该特征选择方法使用改进的文档频初选特征并用所提属性约简算法消除冗余.仿真结果表明该特征选择方法性能较好. 相似文献

2.

基于优化的文档频和Beam搜索的特征选择方法

朱颢东钟勇《计算机科学》2009,36(11):196-199

在文本分类中,特征空间的维数通常高达几万,甚至远远超出训练样本的个数,这是一种十分普遍现象.为了提高文本挖掘算法的运行速度,降低占用的内存空间,过滤掉不相关或相关程度低的特征,必须使用特征选择算法.首先给出了一个基于最小词频的文档频方法,然后把粗糙集引入进来并提出了一个基于Beam搜索的属性约简算法,最后把该属性约简算法同基于最小词频的文档频方法结合起来,提出了一个综合的特征选择算法.该算法首先利用基于最小词频的文档频方法进行特征选择,然后利用所提属性约简算法消除冗余,从而获得较具代表性的特征子集.实验结果表明该算法是有效的. 相似文献

3.

结合类内集中度和最小集合覆盖的特征选择

下载免费PDF全文

张文鹏李红婵王兴《计算机工程与应用》2011,47(28):124-127

特征选择是文本分类中的核心研究课题之一。简单分析了词频和文档频,在此基础上提出了类内集中度,把集合覆盖的思想引入粗糙集并提出了一个基于最小集合覆盖的属性约简算法,把该属性约简算法同类内集中度结合起来,提出了一个新的特征选择方法。该方法利用类内集中度进行特征初选以过滤掉一些词条来降低特征空间的稀疏性,利用所提约简算法消除冗余,从而获得较具代表性的特征子集。实验结果表明此种特征选择方法效果良好。相似文献

4.

基于特征辨别能力和元信息的特征选择

王兴张文鹏《计算机工程与应用》2012,48(7):128-131

特征选择是文本分类的关键步骤之一,所选特征子集的优劣直接影响文本分类的结果。在分析词频方法和文档频方法不足的基础上提出了特征辨别能力,把元信息引入粗糙集并提出了一个基于元信息的属性约简算法,给出了一个综合性特征选择方法。该方法利用特征辨别能力进行特征初选以过滤掉一些词条来降低特征空间的稀疏性,使用所提属性约简算法消除冗余,从而获得较具代表性的特征子集。实验结果表明：所提特征选择方法在一定程度上具有一定的优势。相似文献

5.

基于粗糙集和灰色关联度的综合性特征选择 总被引：2，自引：1，他引：1

下载免费PDF全文

朱颢东钟勇《计算机工程与应用》2009,45(35):6-9

在文本特征空间中,特征维数通常高达几万,这大大限制了分类算法的选择,降低了分类算法的性能,影响了分类器的设计,为此需要进行特征选择以避免“维数灾难”。提出了一个综合性的特征选择方法,该方法首先利用一个优化的文档频进行特征初选以过滤掉一些词条来降低特征空间的稀疏性,然后利用一个基于粗糙集和灰色关联度的属性约简算法来消除冗余,从而获得较具代表性的特征子集。实验结果表明该综合性方法效果良好。相似文献

6.

关系积理论在特征选择中的应用研究

刘阿力《微型机与应用》2009,28(22)

提出了一个适用于海量文本数据集的特征选择方法.该方法利用一个优化的文档频进行特征初选以滤除一些词条来降低特征空间的稀疏性,并利用一个基于关系积理论的属性约简算法消除冗余,从而获得较具代表性的特征子集.实验结果表明,此种特征选择方法效果良好. 相似文献

7.

使用特征分辨率和差别对象对集的特征选择

下载免费PDF全文

吴洪丽朱颢东周瑞琼《计算机工程与应用》2010,46(16):160-162

特征选择是文本分类的关键步骤之一,所选特征子集的优劣直接影响文本分类的结果。首先简单分析了几种经典的特征选择方法,总结了它们的不足,然后提出了特征分辨率的概念,并提出了一个基于差别对象对集的属性约简算法,最后把该属性约简算法同特征分辨率结合起来,提出了一个新的特征选择方法。该方法首先利用特征分辨率进行特征初选以过滤掉一些词条来降低特征空间的稀疏性,然后利用所提属性约简算法消除冗余,从而获得较具代表性的特征子集。实验结果表明此种特征选择方法效果良好。相似文献

8.

基于特征辨别能力和二进制可辨矩阵的特征选择

朱颢东周姝钟勇《计算机应用与软件》2010,27(10)

为了提高分类算法的运行速度,降低占用的内存空间,必须使用特征选择算法.首先分析了几种经典特征选择方法并总结了它们的不足,然后提出了特征辨别能力的概念,紧接着把粗糙集引进来并给出了一个基于二进制可辨矩阵的属性约简算法,最后把该属性约简算法同所提特征辨别能力结合起来,给出了一个综合的特征选择方法.该方法首先利用所提特征辨别能力进行特征初选以过滤掉一些词条,然后利用所提属性约简算法消除冗余.实验结果表明此种特征选择方法效果良好. 相似文献

9.

新的结合互信息和粗糙集的特征选择

下载免费PDF全文

史岳鹏张明慧朱颢东《计算机工程与应用》2011,47(16):135-137

特征选择是文本分类的一个重要步骤。分析了互信息,针对其不足引进了粗糙集给出了一个基于关系积的属性约简算法,并以此为基础提出了一个新的适用于海量文本数据集的特征选择方法。该方法使互信息进行特征初选,利用基于关系积的属性约简算法消除冗余词。实验结果表明此种特征选择方法的微平均F1和宏平均F1较高。相似文献

10.

基于粗糙集与泛系等价算子的特征选择

下载免费PDF全文

朱颢东钟勇《计算机工程》2010,36(19):39-41

传统特征选择方法选出的特征子集存在冗余,并且不具备较好的代表性。针对该问题,提出基于粗糙集与泛系等价算子的特征选择方法。利用基于最小词频的文档频提取初始特征,通过泛系等价算子对粗糙集进行扩展,并给出属性约简算法消除冗余,从而获得较具代表性的特征子集。实验结果表明,该方法具有较高的准确率和召回率。相似文献

11.

基于词条属性聚类的文本特征选择算法

张群王红军王伦文《计算机应用研究》2017,34(2)

文本挖掘之前首先要对文本集进行有效的特征选择,传统的特征选择算法在维数约减及文本表征方面效果有限,并且因需要用到文本的类别信息而不适用于无监督的文本聚类任务。针对这种情况,设计一种适用于文本聚类任务的特征选择算法,提出词条属性的概念,首先基于词频、文档频、词位置及词间关联性构建词条特征模型,重点研究了词位置属性及词间关联性属性的权值计算方法,改进了Apriori算法用于词间关联性属性权值计算,然后通过改进的k-means聚类算法对词条特征模型进行多次聚类完成文本特征选择。实验结果表明,与传统特征选择算法相比,该算法获得较好维数约减率的同时提高了所选特征词的文本表征能力,能有效适用于文本聚类任务。相似文献

12.

结合类别相关性和辨识集的特征选择方法

王加龙朱颢东《微型机与应用》2009,28(23)

介绍了基于辨识集的属性约简算法,把该属性约简算法同类别相关性结合起来,提出了一个综合的特征选择方法.该综合方法使用类别相关性进行特征初选,并用所提属性约简算法消除冗余.实验结果表明此种特征选择方法能够获得较具代表性的特征子集. 相似文献

13.

Text feature selection with a robust weight scheme and dynamic dimension reduction to text document clustering

《Expert systems with applications》2017

This paper proposes three feature selection algorithms with feature weight scheme and dynamic dimension reduction for the text document clustering problem. Text document clustering is a new trend in text mining; in this process, text documents are separated into several coherent clusters according to carefully selected informative features by using proper evaluation function, which usually depends on term frequency. Informative features in each document are selected using feature selection methods. Genetic algorithm (GA), harmony search (HS) algorithm, and particle swarm optimization (PSO) algorithm are the most successful feature selection methods established using a novel weighting scheme, namely, length feature weight (LFW), which depends on term frequency and appearance of features in other documents. A new dynamic dimension reduction (DDR) method is also provided to reduce the number of features used in clustering and thus improve the performance of the algorithms. Finally, k-mean, which is a popular clustering method, is used to cluster the set of text documents based on the terms (or features) obtained by dynamic reduction. Seven text mining benchmark text datasets of different sizes and complexities are evaluated. Analysis with k-mean shows that particle swarm optimization with length feature weight and dynamic reduction produces the optimal outcomes for almost all datasets tested. This paper provides new alternatives for text mining community to cluster text documents by using cohesive and informative features. 相似文献