期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

1.

李国臣刘姝林杨陟卓李茹张虎钱揖丽《中文信息学报》2016,30(6):164-172

高考语文阅读理解问答相对普通阅读理解问答难度更大,问句抽象表述的理解需要更深层的语言分析技术,答案候选句抽取更注重与问句的关联分析,答案候选句排序更注重答案句之间的语义相关性。为此,该文提出借助框架语义匹配和框架语义关系抽取答案候选句,在排序时引入流形排序模型,通过答案句之间的框架语义相关度将排序分数进行传播,最终选取分数较高的Top-4作为答案句。在北京近12年高考语文阅读理解问答题上的准确率与召回率分别达到了53.65%与79.06%。相似文献

2.

应用二叉树剪枝识别韵律短语边界 总被引：2，自引：0，他引：2

荀恩东钱揖丽郭庆宋柔《中文信息学报》2006,20(3):3-5,28

句子的韵律短语识别是语音合成的重要研究内容。本文提出了应用统计语言模型生成的二叉树,结合最大熵方法识别待合成汉语句子的语音停顿点。文中给出了二叉树相关的模型训练和生成算法;二叉树与语音停顿点之间的关系;在最大熵方法中应用二叉树剪枝识别句子的韵律短语。实验结果表明,在搜索算法中,利用二叉树进行剪枝,可以很大程度上提高语音停顿预测的正确率和召回率,基于试验数据的f-Score提高了近35%。相似文献

3.

融合BERT语义表示的高考语文阅读理解问答研究

杨陟卓韩晖张虎钱揖丽李茹《中文信息学报》2022,36(5):59-66

高考语文阅读理解问答相对普通阅读理解问答难度更大,同时高考问答任务中的训练数据较少,目前的深度学习方法不能取得良好的答题效果。针对这些问题,该文提出融合BERT语义表示的高考阅读理解答案候选句抽取方法。首先,采用改进的MMR算法对段落进行筛选;其次,运用微调之后的BERT模型对句子进行语义表示;再次,通过SoftMax分类器对答案候选句进行抽取,最后利用PageRank排序算法对输出结果进行二次排序。该方法在北京近十年高考语文阅读理解问答题上的召回率和准确率分别达到了61.2%和50.1%,验证了该方法的有效性。相似文献

4.

中文文本词性自动校对系统的实现

钱揖丽郑家恒《电脑开发与应用》2004,17(1):25-27

提出了一种从正确标注的训练语料中自动获取兼类词词性较对规则的方法 ,并设计和实现了相应的词性自动校对系统。通过对中文文本进行自动校对 ,进一步提高其词性标注质量相似文献

5.

高考语文阅读理解自动答题系统

谭红叶郭少茹陈鑫王素格李茹张虎杨陟卓
陈千钱揖丽王元龙关勇吕国英《中文信息学报》2022,36(4):166-174

机器阅读理解任务需要机器理解篇章并回答相关问题,是许多应用系统中的一项核心任务。该文面向高考语文中的现代文阅读理解文本语义表示、候选句抽取、鉴赏分析等关键技术展开研究,针对选择题、问答题等构建了相应的答题引擎,并在高考真题及测试题上,对系统进行了实验验证与错误分析,实验结果表明,该文所构建的系统能够在一定程度上解答问题。未来将围绕语义表示、知识的统一表征与知识聚合、迁移学习等前沿技术,提升阅读理解系统的复杂综合推理能力、概括分析能力、语言鉴赏能力。相似文献

6.

采用无标注语料和词“粘连”剔除策略的韵律短语识别

钱揖丽蔡滢滢《计算机科学》2016,43(2):51-56

针对人工标注韵律结构获取大规模语料的困难和问题,利用标点符号能够表示停顿的性质,提出一种采用无标注语料和词“粘连”剔除策略的韵律短语识别方法。对标点符号划分等级,并在利用其模拟韵律边界时对其赋予不同的权重。基于无标注语料构建最大熵模型,并采取Top-K方法实现句子韵律短语边界的自动预测。通过计算相邻语法词词性间的互信息对句子进行“粘连”处理,生成“粘连”单元,并对出现在其内部的韵律边界进行剔除,实现韵律短语的自动识别。实验结果表明,获取无标注语料时对标点进行分级利用及采用“粘连”剔除策略能够明显提升模型性能,该方法能够获得较好的识别效果。相似文献

7.

基于CFN和篇章主题的概括型问答题的解答

杨陟卓李春转张虎钱揖丽李茹《中文信息学报》2021,34(12):73-81

相对于普通阅读理解,高考语文阅读理解难度更大,问句更加抽象,答案候选句的抽取除了注重与问句的相似性分析,还注重对材料内容以及作者的观点的概括归纳。因此该文提出了利用汉语框架网(Chinese FrameNet)抽取与问句语义相似的候选句的方法,通过识别篇章主题(段落主题句和作者观点句),生成与问句相关的内容要点以及作者的观点态度,最终选取top 6作为答案句。在近12年北京市高考真题上进行测试,召回率达到了68.69%,验证了该方法的有效性。相似文献

8.

基于数据增强的高考阅读理解自动答题研究

张虎张颖杨陟卓钱揖丽李茹《中文信息学报》2021,35(9):132-140

机器阅读理解是自然语言处理领域中的一项重要研究任务,高考阅读理解自动答题是近年来阅读理解任务中的又一挑战。目前高考语文阅读理解任务中真题和模拟题的数量相对较少,基于深度学习的方法受到实验数据规模较小的限制,所得的实验结果相比传统方法无明显优势。基于此,该文探索了面向高考语文阅读理解的数据增强方法,结合传统的EDA数据增强思路提出了适应于高考阅读理解的EDA策略,针对阅读材料普遍较长的特征提出了基于滑动窗口的材料动态裁剪方式,围绕材料中不同句子的重要性差异明显的问题,提出了基于相似度计算的材料句质量评价方法。实验结果表明,三种方法均能提升高考题阅读理解自动答题的效果,答题准确率最高可提升5个百分点以上。相似文献

9.

汉语语料词性标注自动校对方法的研究 总被引：6，自引：0，他引：6

钱揖丽郑家恒《中文信息学报》2004,18(2):31-36

兼类词的词类排歧是汉语语料词性标注中的难点问题,它严重影响语料的词性标注质量。针对这一难点问题,本文提出了一种兼类词词性标注的自动校对方法。它利用数据挖掘的方法从正确标注的训练语料中挖掘获取有效信息,自动生成兼类词词性校对规则,并应用获取的规则实现对机器初始标注语料的自动校对,从而提高语料中兼类词的词性标注质量。分别对50万汉语语料做封闭测试和开放测试,结果显示,校对后语料的兼类词词性标注正确率分别可提高11.32%和5.97%。相似文献

10.

基于SLM的二叉树在语音停顿预测中的应用 总被引：1，自引：0，他引：1

下载免费PDF全文

钱揖丽荀恩东宋柔《计算机工程》2006,32(19):23-25,28

讨论基于统计语言模型SLM（Statistic Language Model）的二叉树在语音停顿预测中的应用。基于大规模语料，利用三元模型Trigram，建立统计语言模型；基于SLM为待处理句子生成相应的二叉树；将生成的二叉树所包含的信息，从不同角度应用于语音停顿的预测。实验结果表明，基于SLM生成的二叉树能够较好地为语音停顿的预测做出贡献。相似文献