期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

1.

朱峰顾敏郑好顾彦慧周俊生曲维光《计算机科学》2017,44(1):95-99, 127

传统的应用于未登录词语义研究的语料库包含许多限制,例如更新慢、语言相关等。为了解决此问题,提出了基于知识图谱的中文未登录词语义研究方法。知识图谱是一种包含实体、概念及语义关系的语义网络。它具有丰富的实体,并且实体及其关系的添加极为方便,使得弥补传统语料库更新慢的缺憾成为可能。在充分熟悉知识图谱的结构、数据获取方法及相关数据处理方法后,进行基于知识图谱的未登录词语义研究的探索工作,最后以百度百科(目前最大的中文知识图谱)为语料资源,在同一语义分析模型下分别进行基于知识图谱与传统语料的实验,对实验结果进行分析并提出改进方法。相似文献

2.

采用Java实现的汉语拼音查询模块

赵斌顾彦慧《计算机与现代化》2006,(12):52-53

中文信息检索是MIS的重要功能.本文利用Java语言设计并实现了一个汉字拼音查询模块，可以有效提高中文信息的检索速度，该模块具有识别汉字量大、编程接口丰富的特点。相似文献

3.

汉语V+V序列关系识别研究

下载免费PDF全文

李胜男曲维光魏庭新周俊生顾彦慧李斌《计算机工程与应用》2023,59(5):289-296

“V+V”是现代汉语中的常见结构,能够形成兼语、连动等多种完全不同的句法结构,给句法和语义解析造成困难。针对“V+V”形成的句法结构类型和序列关系识别问题,设计并制定了一套语料库标注规范,以解决语料库中存在的“V+V”结构的嵌套标注问题,并据此构建起一个包含5 381个兼语句子、7 987个连动句子,以及1 212个兼语连动嵌套句子的“V+V”语料库。提出一个基于BiLSTM-CRF和多头注意力机制的模型,能够同时识别结构中的多个动词和名词的句法、语义角色。相比于以往只研究单项识别兼语或者连动结构,该模型不仅可以同时识别兼语结构、连动结构,还可以解决兼语连动嵌套结构的识别问题。实验结果表明：该方法能够很好地解决“V+V”序列关系的识别问题,在测试集语料上达到92.12%的F1值。相似文献

4.

基于神经网络的连动句识别

孙超曲维光魏庭新顾彦慧李斌周俊生《中文信息学报》2022,36(2):12-21

连动句是具备连动结构的句子,是汉语中一种特殊的句法结构,在现代汉语中十分常见且使用频繁.连动句语法结构和语义关系都很复杂,在识别中存在许多问题,对此该文针对连动句的识别问题进行了研究,提出了一种基于神经网络的连动句识别方法.该方法分两步:第一步,运用简单的规则对语料进行预处理;第二步,利用文本分类的思想,使用BERT编... 相似文献

5.

基于拓扑结构的微博话题摘要生成算法

赵斌吉根林徐伟顾彦慧《数据采集与处理》2014,29(5):720-729

话题摘要是自然语言处理中对文本进行内容归纳和概要生成的技术.传统的话题摘要研究主要针对新闻、Web网页和博客这样的长文本,本文研究微博短文本的话题摘要问题.本文以微博转发消息为对象,提出具有拓扑结构的微博话题摘要生成算法(Microblog topic summarization,MTS).首先通过微博转发上下文确定代表性词项;然后识别微博转发中的话题区域,从广度和深度两个方向对话题进行归并操作;最后,基于转发关系生成具有拓扑结构的微博话题摘要.本文实验采用真实的微博事件数据集验证MTS算法的有效性和可行性,并采用可视化方式展现微博话题摘要的结果. 相似文献

6.

基于深度学习的中文零代词识别

下载免费PDF全文

王立凯曲维光魏庭新周俊生顾彦慧李斌《南京师范大学学报》2021,(4):019-26

针对中文零代词识别任务,提出了一种基于深度神经网络的中文零代词识别模型. 首先,通过注意力机制利用零代词的上下文来帮助表示缺省的语义信息. 然后,利用Tree-LSTM挖掘零代词上下文的句法结构信息. 最后,利用语义信息和句法结构信息的融合特征识别零代词. 实验结果表明,相对于以往的零代词识别方法,该方法能够有效提升识别效果,在中文OntoNotes5.0数据集上的F1值达到63.7%. 相似文献

7.

自然语言句子抽象语义表示AMR研究综述

曲维光周俊生吴晓东戴茹冰顾敏 顾彦慧 《数据采集与处理》2017,32(1):26-36

句子的语义处理是自然语言处理的重要难题与挑战。抽象语义表示(Abstract meaning representation, AMR)是近几年国际上新兴的句子级语义表示方法,突破了传统的句法树结构的限制,将一个句子语义抽象为一个单根有向无环图,很好地解决了论元共享问题,成为语言资源建设和句子语义解析的研究热点。本文从AMR概念与规范、解析算法和应用等方面对AMR相关研究进行系统的梳理,特别对AMR的各种解析算法进行了比较深入的分析和比较,指出了现有算法存在的问题和不足,同时介绍了中文AMR的开发进展,最后展望了AMR未来的研究方向。相似文献

8.

基于神经网络的片段级中文命名实体识别

王蕾谢云周俊生顾彦慧曲维光《中文信息学报》2018,32(3):84

命名实体识别是自然语言处理的一个重要基础任务。传统基于统计学习模型的命名实体识别方法严重依赖特征工程,特征设计需要大量人工参与和专家知识,而且已有的方法通常大多将中文命名实体识别任务看作一个字符序列标注问题,需要依赖局部字符标记区分实体边界。为了减弱系统对人工特征设计的依赖,避免字符序列化标注方法的不足,该文对基于神经网络的片段级中文命名实体识别方法进行探索研究。通过采用深度学习片段神经网络结构,实现特征的自动学习,并通过获取片段信息对片段整体分配标记,同时完成实体边界识别和分类。基于神经网络的片段级中文命名实体识别方法在MSRA数据集上对人名、地名和机构名识别的总体F1值达到了90.44%。相似文献

9.

基于转移神经网络的中文AMR解析

吴泰中顾敏周俊生曲维光李斌顾彦慧《中文信息学报》2019,33(4):1-11

抽象语义表示(abstract meaning representation, AMR)是一种领域无关的句子语义表示方法,它将一个句子的语义抽象为一个单根有向无环图,AMR解析旨在将句子解析为对应的AMR图。目前,中文AMR研究仍然处于起步阶段。该文结合中文AMR特性,采用基于转移神经网络的方法对中文AMR解析问题展开了试验性研究。首先,实现了一个基于转移解码方法的增量式中文AMR解析神经网络基线系统;然后,通过引入依存路径语义关系表示学习和上下文相关词语语义表示学习,丰富了特征的表示;最后,模型中应用序列化标注的模型实现AMR概念识别,优化了AMR概念识别效果。实验结果表明,该模型在中文AMR解析任务中达到了0.61的Smatch F1值,明显优于基线系统。相似文献

10.

汉字拼音查询模块的设计与实现

赵斌顾彦慧《计算机与信息技术》2006,(6)

中文信息检索是MIS的重要功能。本文利用java语言设计并实现了一个汉字拼音查询模块,可以有效提高中文信息的检索速度,该模块具有识别汉字量大,编程接口丰富的特点。相似文献