首页 | 本学科首页   官方微博 | 高级检索  
文章检索
  按 检索   检索词:      
出版年份:   被引次数:   他引次数: 提示:输入*表示无穷大
  免费   0篇
  国内免费   2篇
自动化技术   2篇
  2016年   1篇
  2015年   1篇
排序方式: 共有2条查询结果,搜索用时 0 毫秒
1
1.
准确有效地集成海量Web信息, 是Web信息动态聚合、市场情报分析、舆情分析、商业智能等分析型应用的重要基础. 针对数据集成过程中不同实体指代同一实体的问题, 利用搜索引擎返回的页面摘要信息, 设计并实现了一种基于搜索引擎的同义实体识别算法FSE, 并提出了一种基于同义实体识别的Web信息集成框架. 在医院信息集成测试数据集上的实验结果表明, FSE算法效果优于基于VarientDice、VarientCosine、VarientJaccard、VarientOverlap相似度计算的同义实体识别算法.  相似文献   
2.
精准地抽取新闻网页的内容,是提高Web新闻分析等应用系统工作质量的关键技术之一.由于缺少Web新闻出版的标准,存在大量不同的出版格式,并且Web本身是一种具有高度异构性的大数据载体,导致Web新闻内容抽取成为一个开放性问题.经大量实例分析发现,新闻网页内容与其上的标签路径存在潜在的关联性.因此,设计了标签路径特征系,以从不同视角区分网页内容和噪音.在特征相似性分析的基础上,提出了一种基于组合特征选择的特征融合策略,并设计了基于融合特征的Web新闻内容抽取方法CEPF.CEPF是一种快速的通用、无需训练的在线Web新闻内容抽取算法,可抽取多种来源、多种风格、多种语言的Web新闻网页.在CleanEval等测试数据集上的实验结果表明,CEPF方法优于CETR等抽取方法.  相似文献   
1
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号