首页 | 本学科首页   官方微博 | 高级检索  
     

基于优势率的改进二元特征提取方法
引用本文:杜一平,刘燕君.基于优势率的改进二元特征提取方法[J].计算机系统应用,2010,19(2):106-109.
作者姓名:杜一平  刘燕君
作者单位:中国科学技术大学,计算机科学与技术学院,安徽,合肥,230027
摘    要:主题网络爬虫研究中一个重要问题是文本特征的提取,其好坏会直接影响主题特征的提取及网页的相关性计算。在研究了文本分类特征提取方法的基础上,分析优势率特征提取方法的优缺点,把频度、分散度作为判断要素加以考虑,提出一种改进的二元分类特征选择方法EOR,并使用得到的EOR值结合词频TF即TF—EOR来计算文档特征词的权重,应用于主题网络爬虫。仿真实验证明,EOR在中低维数下能提升文档分类准确率达5%,而TF—EOR权重计算方法好于TF-IDF方法,实验中提高了网络爬虫的抓取准确率和查全率达4%。

关 键 词:特征提取  优势率  主题网络爬虫  频度  分散度
收稿时间:2009/5/18 0:00:00

An Enhanced Odds Ratio Dualistic Feature Extraction Method
DU Yi-Ping and LIU Yan-Jun.An Enhanced Odds Ratio Dualistic Feature Extraction Method[J].Computer Systems& Applications,2010,19(2):106-109.
Authors:DU Yi-Ping and LIU Yan-Jun
Affiliation:DU Yi-Ping,LIU Yan-Jun(School of Computer Science , Technology,University of Science , Technology of China,Hefei 230027,China)
Abstract:
Keywords:feature extraction  odds ratio  topical crawler  word frequency  distribution rate
本文献已被 CNKI 维普 万方数据 等数据库收录!
点击此处可从《计算机系统应用》浏览原始摘要信息
点击此处可从《计算机系统应用》下载全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号