首页 | 本学科首页   官方微博 | 高级检索  
     

中文文本分类中的特征词抽取方法
引用本文:李晓红. 中文文本分类中的特征词抽取方法[J]. 计算机工程与设计, 2009, 30(17)
作者姓名:李晓红
作者单位:西北师范大学,数学与信息科学学院,甘肃,兰州,710070
摘    要:针对目前各类主流的中文文本特征词抽取方法中只关心词频信息却不关注特征的位置这一现象,给出了位置权重的概念,对以往提出的无词典分词算法进行了适当的修改,并在此基础上提出将信息增益、卡方统计和互信息这3种常用的特征选择方法有机的结合起来,构成新的特征选择方法.这种新方法综合考虑了特征的各类信息,从而更加准确地选取文本中的有效特征词,并且试验结果也验证了这种改进算法的可行性和有效性.

关 键 词:特征抽取  无词典分词  位置权重  词条过滤  文本分类

Feature extraction methods for Chinese text classification
LI Xiao-hong. Feature extraction methods for Chinese text classification[J]. Computer Engineering and Design, 2009, 30(17)
Authors:LI Xiao-hong
Abstract:
Keywords:
本文献已被 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号