10.3969/j.issn.1006-6675.2014.01.008
Hadoop平台下的并行文字识别技术研究
在信息技术及计算机日益普及的今天,利用OCR(光学字符识别)技术将图片类型的文字材料方便、快捷地输入到计算机中并转化为文字已经广泛应用于各行各业,但随着文件数量的急剧增长,在面对海量图片数据时,逐个逐页文件的单机识别模式已逐渐不能满足使用者的需求,分布式系统是解决海量信息存储及处理的有效方式.通过分析HDFS的特点,使用MapReduce这一机制,提出利用Tesseract-OCR引擎对文字图像进行并行识别处理的方法,为今后使用OCR技术进行海量图片识别处理提供了借鉴参考.
HDFS、MapReduce、OCR、并行、识别
TP391(计算技术、计算机技术)
2014-04-09(万方平台首次上网日期,不代表论文的发表时间)
共7页
22-28