首页 | 本学科首页   官方微博 | 高级检索  
     

一种面向多文本集的部分比较性LDA模型
引用本文:谭文堂,王桢文,殷风景,葛斌,肖卫东.一种面向多文本集的部分比较性LDA模型[J].计算机研究与发展,2013,50(9).
作者姓名:谭文堂  王桢文  殷风景  葛斌  肖卫东
作者单位:国防科学技术大学信息系统工程重点实验室 长沙410073
基金项目:国家自然科学基金项目,湖南省自然科学基金项目,国防科学技术大学优秀研究生创新基金项目
摘    要:跨时空、跨文化文本挖掘等比较性文本挖掘(comparative text mining,CTM)旨在从多个可比的文本集中发现各文本集隐含语义结构的异同.针对当前主要的CTM模型只能分析公共话题的缺陷,提出一种部分比较性跨文本集LDA模型(partial comparative cross collections LDA model,PCCLDA)来实现跨文本集的话题分析,该模型通过层次狄利克雷过程(hierarchical Dirichlet processes,HDP)把话题划分为公共话题和文本集特有话题,使模型能更加精确地对文本进行建模.模型采用Gibbs抽样方法进行参数推导,一系列包括Held-Out数据对数似然和模型困惑度指标在内的定量与定性的实验表明,模型不仅能够发现公共话题在不同文本集中的差异,而且能分析各文本集特有的话题;在Held-Out对数似然测度和模型困惑度指标上,PCCLDA相对当前两个主要的CTM模型具有较大的优势.

关 键 词:比较性文本挖掘  部分比较性  部分比较性跨文本集LDA模型  话题模型  Gibbs抽样

A Partial Comparative Cross Collections LDA Model
Tan Wentang , Wang Zhenwen , Yin Fengjing , Ge Bin , Xiao Weidong.A Partial Comparative Cross Collections LDA Model[J].Journal of Computer Research and Development,2013,50(9).
Authors:Tan Wentang  Wang Zhenwen  Yin Fengjing  Ge Bin  Xiao Weidong
Abstract:
Keywords:comparative text mining  partial comparative  partial comparative cross collections LDA model (PCCLDA)  topic model  Gibbs sampling
本文献已被 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号