10.3778/j.issn.1002-8331.2010.12.002
综合文字和非文字区域特征的文档图像检索
提出一种改进的自适应文字区域提取算法,将文档图像分割成文字区域和非文字区域.对文字区域提取连通字符间空白、连通字符高度和宽度等局部特征,以及书写样式、段落特征等全局特征;对非文字区域,提取关键块特征.然后利用检索算法将文字区域特征和非文字区域特征结合起来,提高检索的准确性.同时,在检索算法中引入多维数据检索结构,有效地提高检索速度.通过对大规模文档数据库(包含12024个文档)的检索,表明该算法具有较高的效率,优于现有的一般文档图像检索算法.
文档图像检索、文字区域提取、段落特征、多维数据检索结构
46
TP391(计算技术、计算机技术)
国家自然科学基金重点项目the Grand National Natural Science Foundation of China under Grant 60832008
2010-06-23(万方平台首次上网日期,不代表论文的发表时间)
共4页
5-8