利用全局与局部帧级特征进行基于共享注意力的视频问答 Multi-Shared Attention with Global and Local Pathways for Video Question Answering期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

利用全局与局部帧级特征进行基于共享注意力的视频问答

引用本文：	王雷全,候文艳,袁韶祖,赵欣,林瑶,吴春雷.利用全局与局部帧级特征进行基于共享注意力的视频问答[J].计算机科学,2021,48(8):145-149.

作者姓名：	王雷全候文艳袁韶祖赵欣林瑶吴春雷

作者单位：	中国石油大学(华东)计算机科学与技术学院山东青岛266555;中国石油大学(华东)海洋与空间信息学院山东青岛266555

摘要：	视频问答是视觉理解领域中非常重要且具有挑战性的任务.目前的视觉问答(VQA)方法主要关注单个静态图片的问答,而现实生活中的数据是立体动态的视频.此外,由于问题的复杂性,视频问答任务必须根据问答问题恰当地处理多种视觉特征才能获得高质量的答案.文中提出了一个通过利用局部和全局帧级别的视觉信息来进行视频问答的多共享注意力网络.具体来说,以不同帧率提取视频帧,并以此提取帧级的全局与局部视觉特征,这两种特征包含了多个帧级别特征,用于对视频时间动态建模,再以共享注意力的形式建模全局与局部视觉特征的相关性,然后结合文本问题来推断答案.在天池视频问答数据集上进行了大量的实验,验证了所提方法的有效性.
关键词：	视频问答共享注意力机制全局和局部帧级特征
Multi-Shared Attention with Global and Local Pathways for Video Question Answering

WANG Lei-quan,HOU Wen-yan,YUAN Shao-zu,ZHAO Xin,LIN Yao,WU Chun-lei.Multi-Shared Attention with Global and Local Pathways for Video Question Answering[J].Computer Science,2021,48(8):145-149.

Authors:	WANG Lei-quan HOU Wen-yan YUAN Shao-zu ZHAO Xin LIN Yao WU Chun-lei

Abstract:

Keywords:
本文献已被万方数据等数据库收录！

设为首页 | 免责声明 | 关于勤云 | 加入收藏