DOI：10.3969/j.issn.1006-6675.2014.01.008

Hadoop平台下的并行文字识别技术研究

引用

摘要：

在信息技术及计算机日益普及的今天,利用OCR(光学字符识别)技术将图片类型的文字材料方便、快捷地输入到计算机中并转化为文字已经广泛应用于各行各业,但随着文件数量的急剧增长,在面对海量图片数据时,逐个逐页文件的单机识别模式已逐渐不能满足使用者的需求,分布式系统是解决海量信息存储及处理的有效方式.通过分析HDFS的特点,使用MapReduce这一机制,提出利用Tesseract-OCR引擎对文字图像进行并行识别处理的方法,为今后使用OCR技术进行海量图片识别处理提供了借鉴参考.

关键词：HDFS、MapReduce、OCR、并行、识别

分类号：TP391(计算技术、计算机技术)

在线出版日期：2014-04-09（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：22-28

英文信息展示

期刊专题