DOI：10.11772/j.issn.1001-9081.2022071109

基于场景图感知的跨模态图像描述模型

引用

摘要：

针对图像描述方法中对图像文本信息的遗忘及利用不充分问题,提出了基于场景图感知的跨模态交互网络(SGC-Net).首先,使用场景图作为图像的视觉特征并使用图卷积网络(GCN)进行特征融合,从而使图像的视觉特征和文本特征位于同一特征空间;其次,保存模型生成的文本序列,并添加对应的位置信息作为图像的文本特征,以解决单层长短期记忆(LSTM)网络导致的文本特征丢失的问题;最后,使用自注意力机制提取出重要的图像信息和文本信息后并对它们进行融合,以解决对图像信息过分依赖以及对文本信息利用不足的问题.在Flickr30K和MS-COCO(MicroSoft Common Objects in COntext)数据集上进行实验的结果表明,与Sub-GC相比,SGC-Net在BLEU1(BiLingual Evaluation Understudy with 1-gram)、BLEU4(BiLingual Evaluation Understudy with 4-grams)、METEOR(Metric for Evaluation of Translation with Explicit ORdering)、ROUGE(Recall-Oriented Understudy for Gisting Evaluation)和SPICE(Semantic Propositional Image Caption Evaluation)指标上分别提升了1.1、0.9、0.3、0.7、0.4和0.3、0.1、0.3、0.5、0.6.可见,SGC-Net所使用的方法能够有效提升模型的图像描述性能及生成描述的流畅度.

关键词：图像描述、场景图、注意力机制、长短期记忆网络、特征融合

所属期刊栏目：44

分类号：TP391.1;TP18(计算技术、计算机技术)

在线出版日期：2024-01-31（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：58-64

英文信息展示

期刊专题