多语种文本图像中的文字语种辨识方法的研究
本文针对汉字、朝鲜文字和英文单词混合的文本图像提出了基于主成分分析技术以文字为单位进行文种辨识的方法.首先,通过主成分分析方法构造特征空间,并且把分割的文字映射到此空间得到重构图像;其次,计算原图像和重构图像的水平和垂直方向直方图的相对熵;最后,根据原图像和重构图像之间的欧式距离和相对熵来判别文字语种.实验表明,本文提出的方法在没有分割错误的情况下,能获得99.78%的识别准确率,有效地解决了在汉、朝、英三种文字混合构成的文档图像中文种辨识问题.
文种辨识、主成分分析、相对熵、欧式距离、文字分割
31
TP(自动化技术、计算机技术)
吉林省科技发展计划项目20140101186JC;国家语委2015年度科研立项项目教语信司函[2015]21号
2017-06-20(万方平台首次上网日期,不代表论文的发表时间)
共6页
220-225