首页 | 本学科首页   官方微博 | 高级检索  
     

一个基于字特征的文本分类模型
引用本文:王梦云,王素格.一个基于字特征的文本分类模型[J].计算机工程与应用,2004,40(13):64-65,191.
作者姓名:王梦云  王素格
作者单位:山西大学计算机科学系,太原,030006;山西大学数学系,太原,030006
基金项目:山西省青年科技研究基金项目(编号:20031027)
摘    要:提出了一种基于字特征的中文文本分类方法。该方法的出发点是变常用的基于表层的匹配为基于概念的匹配,用汉字特征向量作为文本的表示方法。算法根据文本中汉字的特征建立文本表示矩阵和类别表示矩阵,并通过线性最小二乘算法形成分类矩阵。

关 键 词:  文本分类  分类矩阵  特征向量
文章编号:1002-8331-(2004)13-0064-02

A Model for Text Categorization Based on the Statistic Features of Chinese Characters
Wang Mengyun Wang Suge.A Model for Text Categorization Based on the Statistic Features of Chinese Characters[J].Computer Engineering and Applications,2004,40(13):64-65,191.
Authors:Wang Mengyun Wang Suge
Abstract:This paper introduces a method on automatic text categorization based on the statistic features of Chinese characters.The significant character of this method is to make a shift from the surface-based matching to conception-based matching.It takes Chinese features vector as text expression ways.Algorithm should build text expressing matrix and classification expressing matrix according to Chinese character features in text,and build classification matrix through using LLS(Linear Least Square)technique.
Keywords:Chinese character  text categorization  classification matrix  feature vector
本文献已被 CNKI 维普 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号