融合注意力和动态语义指导的图像描述模型

引用

摘要：

针对当前图像语义描述生成模型对图像内目标细节部分描述不充分问题,提出了一种结合图像动态语义指导和自适应注意力机制的图像语义描述模型.该模型根据上一时刻信息预测下一时刻单词,采用自适应注意力机制选择下一时刻模型需要处理的图像区域.此外,该模型构建了图像的密集属性信息作为额外的监督信息,使得模型可以联合图像语义信息和注意力信息进行图像内容描述.在Flickr8K和Flickr30K图像集中进行了训练和测试,并且使用了不同的评估方法对所提模型进行了验证,实验结果表明所提模型性能有较大的提高,尤其与Guiding-Long Short-Term Memory模型相比,得分提高了4.1、1.8、2.4、0.8、3.1,提升幅度达到6.3%、4.0%、7.9%、3.9%、17.3%;与Soft-Attention相比,得分分别提高了1.9、2.4、3.3、1.5、2.74,提升幅度达到2.8%、5.5%、11.1%、7.5%、14.8%.

关键词：图像标注生成、图像内容描述、深度神经网络、视觉注意力、语义信息

所属期刊栏目：11

分类号：TP319(计算技术、计算机技术)

资助基金：The Fundamental Research Funds for the Central Universities of China under Grant No. JUSRP51510

在线出版日期：2017-12-26（万方平台首次上网日期，不代表论文的发表时间）

页数：共8页

页码：2033-2040

英文信息展示

期刊专题