首页 | 本学科首页   官方微博 | 高级检索  
     

基于维基百科和模式聚类的实体关系抽取方法
引用本文:张苇如,孙乐,韩先培. 基于维基百科和模式聚类的实体关系抽取方法[J]. 中文信息学报, 2012, 26(2): 75-82
作者姓名:张苇如  孙乐  韩先培
作者单位:1. 中国科学院 软件研究所,北京 100190;2. 中国科学院 研究生院,北京 100049
基金项目:国家自然科学基金重大研究计划培育项目(90920010);国家863计划重点项目(2008AA01Z145)
摘    要:该文提出了一种基于维基百科和模式聚类的方法,旨在从开放文本中抽取高准确率的中文关系实体对。首次使用从人工标注知识体系知网到维基百科实体映射的方式获取关系实例,并且充分利用了维基百科的结构化特性,该方法很好地解决了实体识别的问题,生成了准确而显著的句子实例;进一步,提出了显著性假设和关键词假设,在此基础上构建基于关键词的分类及层次聚类算法,显著提升了模式的可信度。实验结果表明该方法有效提升了句子实例及模式的质量,获得了良好的抽取性能。

关 键 词:关系抽取  维基百科  模式聚类  

A Entity Relation Extraction Method Based on Wikipedia and Pattern Clustering
ZHANG Weiru , SUN Le , HAN Xianpei. A Entity Relation Extraction Method Based on Wikipedia and Pattern Clustering[J]. Journal of Chinese Information Processing, 2012, 26(2): 75-82
Authors:ZHANG Weiru    SUN Le    HAN Xianpei
Affiliation:1. Institute of Software, Chinese Academy of Science, Beijing 100190, China;
2. Graduate University of Chinese Academy of Science, Beijing 100049, China
Abstract:This paper proposes a method to extract Chinese entity relations of high accuracy from open text based on Wikipedia and pattern clustering.We get relation instances by a mapping from HowNet to Wikipedia and via the structural characteristics of Wikipedia.Based on these,the method solves the entity recognition and generates significant sentence instances.Furthermore,significance assumption and keyword assumption are proposed to support classification and hierarchy clustering algorithm for pattern reliability.The results show that the method achieves a good performance with high-quality seeds and patterns.
Keywords:relation extraction  Wikipedia  pattern clustering
本文献已被 CNKI 万方数据 等数据库收录!
点击此处可从《中文信息学报》浏览原始摘要信息
点击此处可从《中文信息学报》下载全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号