融合注意力和动态语义指导的图像描述模型

TP319; 针对当前图像语义描述生成模型对图像内目标细节部分描述不充分问题,提出了一种结合图像动态语义指导和自适应注意力机制的图像语义描述模型.该模型根据上一时刻信息预测下一时刻单词,采用自适应注意力机制选择下一时刻模型需要处理的图像区域.此外,该模型构建了图像的密集属性信息作为额外的监督信息,使得模型可以联合图像语义信息和注意力信息进行图像内容描述.在Flickr8K和Flickr30K图像集中进行了训练和测试,并且使用了不同的评估方法对所提模型进行了验证,实验结果表明所提模型性能有较大的提高,尤其与Guiding-Long Short-Term Memory模型相比,得分提高了4.1、1...

Full description

Saved in:

Bibliographic Details
Published in	计算机科学与探索 Vol. 11; no. 12; pp. 2033 - 2040
Main Authors	张威, 周治平
Format	Journal Article
Language	Chinese
Published	江南大学物联网技术应用教育部工程研究中心,江苏无锡,214122 2017
Subjects	视觉注意力图像标注生成语义信息图像内容描述 image description 深度神经网络 image caption generation seman-tic information visual attention mechanism deep neural networks
Online Access	Get full text
ISSN	1673-9418
DOI	10.3778/j.issn.1673-9418.1704047

Cover

More Information
Summary:	TP319; 针对当前图像语义描述生成模型对图像内目标细节部分描述不充分问题,提出了一种结合图像动态语义指导和自适应注意力机制的图像语义描述模型.该模型根据上一时刻信息预测下一时刻单词,采用自适应注意力机制选择下一时刻模型需要处理的图像区域.此外,该模型构建了图像的密集属性信息作为额外的监督信息,使得模型可以联合图像语义信息和注意力信息进行图像内容描述.在Flickr8K和Flickr30K图像集中进行了训练和测试,并且使用了不同的评估方法对所提模型进行了验证,实验结果表明所提模型性能有较大的提高,尤其与Guiding-Long Short-Term Memory模型相比,得分提高了4.1、1.8、2.4、0.8、3.1,提升幅度达到6.3%、4.0%、7.9%、3.9%、17.3%;与Soft-Attention相比,得分分别提高了1.9、2.4、3.3、1.5、2.74,提升幅度达到2.8%、5.5%、11.1%、7.5%、14.8%.
ISSN:	1673-9418
DOI:	10.3778/j.issn.1673-9418.1704047