首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 125 毫秒
1.
维吾尔文字属于左向连写文字,字母之间的连笔与变形使得切分字母很困难,印刷体维吾尔文字母的准确切分是识别的关键.文中试验了一种基于像素积分投影的印刷体维吾尔文字母切分方法,包括使用行水平投影切出文字行与文字基线,通过垂直投影切出单词及单词中不粘连的字母,结合水平投影与垂直投影数据,外加相邻投影谷距、字母宽度与基线像素值等信息,设置了细化的连体段字母切分规则.实验结果表明,该方法能够较为准确的将印刷体维吾尔文字母切分开,为 OCR 系统的准确识别提供了基础  相似文献   

2.
从维吾尔文的特征和书写规则出发对维吾尔文联机手写单词识别技术进行了探索性研究,并提出一种新的思路:不是直接把单词切分成字母,而是先把单词分割成连体段,然后再分割成字母。这样,可以提高字母切分和字母识别的准确率。按照该思路,提出一种连体段分割算法:根据通过研究维吾尔文的特征和书写规则找出来的一些规则把一个个的笔画,组合成连体段。实验证明了该连体段分割思路和算法的可行性。  相似文献   

3.
皮桂林  赵晖 《计算机工程》2012,38(18):147-150
延迟笔画处理是维吾尔文联机手写体单词识别中的难点,样本数据格式为一串具有时序性的序列,造成字母主笔画和延迟笔画在序列位置上多半不连续,很大程度上增加了延迟笔画处理和单词识别的难度。为此,提出一种维吾尔文延迟笔画处理方法,其中包括延迟笔画查找与投影,实验结果证明该方法具有良好的效果,单词识别准确率达到93.71%。  相似文献   

4.
维吾尔文OpenType字库设计与实现   总被引:2,自引:0,他引:2  
维吾尔文字编辑方向与汉、英文编辑方向相反,字符变形、连笔复杂,OpenType字形技术的出现使维吾尔文字计算机处理看到了新的契机。本文在研究了OpenType字形技术的基础上,结合维吾尔文字结构特征及语法特征,提炼出维吾尔文字组合规律及变形显现替换规则,通过OpenType脚本描述维吾尔文文字属性,利用字模编辑软件与脚本编辑软件生成维吾尔文OpenType字库。  相似文献   

5.
维吾尔文字编辑方向与汉、英文编辑方向相反,字符变形、连笔复杂,OpenType字形技术的出现使维吾尔文字计算机处理看到了新的契机。本文在研究了OpenType字形技术的基础上,结合维吾尔文字结构特征及语法特征,提炼出维吾尔文字组合规律及变形显现替换规则,通过OpenType脚本描述维吾尔文文字属性,利用字模编辑软件与脚本编辑软件生成维吾尔文OpenType字库。  相似文献   

6.
维吾尔文字的连笔书写及字型变化的一些特征给识别带来一定的困难并会影响到识别的正确率.在分析了维吾尔文单词的组词规律及其字型结构特征基础上,采用一种基于区域分割模板匹配的识别方法,通过建立标准维吾尔文字母图像模板库,并与通过预处理所获得的待识别维吾尔文字母图像进行匹配.对一些相似度高且难区分的维吾尔文字母则采用提取这些相似字符的附属笔画部分的图像并对其按笔画的连通性、交叉性以及形态等特征进行附属笔画判定的方法来确定这些相似字符,从而较准确地实现了对维吾尔文印刷字符的识别.实验识别率达到94%  相似文献   

7.
印刷维吾尔文本切割   总被引:1,自引:0,他引:1  
我国新疆地区使用的维吾尔文借用阿拉伯文字母书写。因为阿拉伯文字母自身书写的特点,造成维文文本的切割和识别极其困难。本文在连通体分类的基础上,结合水平投影和连通体分析的方法实现维文文本的文字行切分和单词切分。然后定位单词基线位置,计算单词轮廓和基线的距离,寻找所有可能的切点实现维文单词过切割,最后利用规则合并过切分字符。实验结果表明,字符切割准确率达到99 %以上。  相似文献   

8.
维吾尔语的手语合成有助于改善维吾尔族聋哑人与听力正常人进行自然交流,也可以应用于计算机辅助维吾尔哑语教学、维文电视节目播放等方面。维文手语库是维吾尔语手语合成的基础。通过分析维吾尔手语的特点,采用关键帧插值技术来控制VRML虚拟人的手势动作,利用Visual C++和OpenGL环境实现了一个维吾尔文的手势编辑系统,通过手势运动数据驱动虚拟人来实时显示当前的手势状态。通过该系统,收集了常用的维吾尔语词汇及32个维吾尔字母的手势运动数据。  相似文献   

9.
通过对维吾尔文字特征的研究,设计了一个高效的维吾尔语智能输入法的词库模型,这种词库模型的构建方法不但解决了维吾尔单词词库中锯齿形数据的高效压缩存储,而且有利于维吾尔语智能输入法语言模型的建立,实现了维吾尔语智能词组联想功能,并在当前流行的智能操作系统android上移植成功,改变了以前由词根联想词缀的输入方式,提高了维吾尔语的输入效率,取得良好的运行效果,为进一步的维哈柯文语句级输入法词库提供一个词库模型结构的支持。  相似文献   

10.
基于规则的维吾尔人名汉文机器翻译算法研究   总被引:1,自引:0,他引:1  
人名机器翻译传统的方法是依赖于预先建立的对照词库.这种方法的缺点是,因为不断出现新的人名而建立丰富、全面的对照词库是不可能的. 研究了维吾尔人名汉文音译规则:读音规则,并在此基础上提出了一种新的基于规则的维吾尔人名汉文机器翻译方法.实验结果表明,该方法不需要建立两种语言的对照词库,完全不用考虑会出现的新的人名,算法实现简单,准确度高,完全克服了传统方法的缺点.  相似文献   

11.
现有的维文敏感信息检测与过滤研究只限于传统维文,而现在互联网上的维文使用呈现传统维文和拉丁维文共存的“一语双文”特点,因此,研究多形式维文的敏感信息过滤算法对新疆的网络安全及社会稳定和长治久安总目标的实现有重要的实际意义。研究拉丁维文和传统维文的Unicode编码特征,提出它们间的编码转换算法ULTC(Uyghur Latin Traditional Conversion),通过该算法在已有的语料库中添加拉丁维文敏感信息语料,从而构建多形式维文敏感信息语料库ULSC(Uyghur Latin Sensitive Corpus);在语料库的基础上构建传统维文和拉丁维文一体化的多形式维文敏感信息决策树LUDT(Latin Uyghur Decision Tree),在决策树的基础上提出多形式维文敏感信息过滤算法USF(Uyghur Sensitive Information Filter)。实验结果表明,USF算法具有较高的查全率。  相似文献   

12.
为实现维吾尔语网络内容的倾向性分析,进行维吾尔语情感词典的构建研究。首先对现有成果中的情感基准词进行汇总分析,筛选使用频率高、情感倾向强烈的词汇作为维文情感种子词,并利用维文同义词电子词典建立种子扩展词集;其次对HowNet、NTUSD以及大连理工大学开发的情感词典进行并运算,翻译为维吾尔语词汇构成候选词集合;最后利用语料库,计算候选词与种子词以及同义扩展词之间的点互信息值,判别候选词的极性并将其加入到相关的褒贬情感词库中。与汉语句子情感倾向评测实验结果比较,基于该词典的维吾尔语句子倾向性判断准确率和召回率基本相同。  相似文献   

13.
一种手写维吾尔文字母识别算法   总被引:4,自引:1,他引:3       下载免费PDF全文
针对手机手写维吾尔文字母输入需求,结合手机软硬件资源局限性,提出将维吾尔文字符分成主体笔画与附属笔画两部分。采用笔画数、主体笔画结构特征、附件结构特征等21个特征为特征集,建立维吾尔文字符识别数据样本库。按笔画数粗分类,分别抽取主笔画的特征与附件的特征并用二值化数据表示,与样本库中特征数据进行异或运算,取运算后1的个数最少的样本为识别样本并给出候选样本,平均一次正确识别率达到97%。  相似文献   

14.
维吾尔语是典型的黏着性语言,其派生能力很强,具有丰富的形态变化,同时遵循语音和谐规律,生成过程中会出现弱化、增音、脱落等音变现象.这些特性决定了维吾尔语词法分析的难点,包括词干提取、发生音变字母的还原以及标注.将维吾尔语词的层次结构引入到词法分析研究中,提出了维吾尔语词法分析的有向图模型,该模型将维吾尔语词法分析描述为有向图结构,图中节点表示词干、词缀及其相应标注,其边表示节点之间的转移或生成概率并将此概率作为候选择优的依据.针对维吾尔语在形态变化过程中发生的音变现象,又提出基于词内字母对齐算法的自动还原模型,该模型将音变现象泛化到每个字母上的假设之下,将还原问题转变成类似于词性标注问题,再利用统计方法进行还原.在对新疆多语种信息技术重点实验室手工标注的《维吾尔语百万词词法分析语料库》上进行的实验中,取得了词干提取正确率为94.7%,词干与各词缀切分并标注的F值达到92.6%的好成绩.  相似文献   

15.
通过心理语言学的词汇判断实验范式来研究维吾尔语屈折词和派生词在大脑心理词典中的表征及存储形式。实验一是维吾尔语屈折词的表征及加工研究,实验二是维吾尔语派生词的表征及加工研究。实验一的行为实验结果揭示人脑加工维吾尔语屈折词时需要对它进行形态分析。实验二的行为数据却显示派生词和单语素词的加工过程是相同的。本文实验结果显示维吾尔语派生词、屈折词的加工形式是彼此独立和不同的过程,维吾尔语屈折词是分解加工,而派生词进行整体加工。  相似文献   

16.
以维吾尔语小学语文教材语料为验证对象,利用从语法语义相结合角度制定的《现代维吾尔语词干词类标注标记集》,对维吾尔语小学语文教材词干进行了词性标注,验证该标记集规范的可行性、适应性和可靠性。首先介绍小学语文教材电子语料库;其次讨论《信息处理用现代维吾尔语词干词类标注标记集》的基本情况和多策略现代维吾尔语词干标注系统模型设计与算法;最后分析现代维吾尔语词性标注标记集验证结果,并验证《信息处理用现代维吾尔语词干词类标注标记集》的科学性,补充和改正部分词类的语义分类及标注代码,提出了规范的扩充建议。  相似文献   

17.
维吾尔语是形态变化复杂的黏着性语言,维吾尔语词干词缀切分对维吾尔语信息处理具有非常重要的意义,但到目前为止,维吾尔语词干提取的性能仍存在较大的改进空间。该文以N-gram模型为基本框架,根据维吾尔语的构词约束条件,提出了融合词性特征和上下文词干信息的维吾尔语词干提取模型。实验结果表明,词性特征和上下文词干信息可以显著提高维吾尔语词干提取的准确率,与基准系统比较,融入了词性特征和上下文词干信息的实验准确率分别达到了95.19%和96.60%。
  相似文献   

18.
维吾尔语是一种派生类语言,其词是由词干和词缀连接而成的。其中,词干是有实际意义的词汇单元,词缀提供语法功能。该文提出了基于词干单元和长短期记忆(LSTM)网络的维吾尔语短文本分类技术。用基于词-词素平行训练语料的稳健词素切分和词干提取方法,从互联网下载的文本中提取其词干,以此构建词干序列文本语料库,并通过Word2Vec算法映射到实数向量空间。然后用LSTM网络作为特征选择和文本分类算法进行维吾尔语短文本分类实验,并得到95.48%的分类准确率。从实验结果看,对于维吾尔语等派生类语言而言,特别是对于带噪声的文本,基于词干的分类方法有更多优异的性能。  相似文献   

19.
本文研究了构建现代维吾尔语语料库的关键技术与方法,特别是现代维吾尔语语料库的构建,并对现代维吾尔语语料预处理技术,现代维吾尔语语料统计技术,现代维吾尔语词干提取技术,现代维吾尔语数据分析技术进行了研究;研制了现代维吾尔语常用词候选表, 从词语的使用频度和词语的分布两方面对词语进行了基本考察,将维吾尔语词语的“词种数、频次、频率、文本数、词长”作为常用词候选表的依据。  相似文献   

20.
针对维吾尔语文本的分类问题,提出一种基于TextRank算法和互信息相似度的维吾尔文关键词提取及文本分类方法。首先,对输入文本进行预处理,滤除非维吾尔语的字符和停用词;然后,利用词语语义相似度、词语位置和词频重要性加权的TextRank算法提取文本关键词集合;最后,根据互信息相似度度量,计算输入文本关键词集和各类关键词集的相似度,最终实现文本的分类。实验结果表明,该方案能够 提取出具有较高识别度的关键词,当关键词集大小为1250时,平均分类率达到了91.2%。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号