首页 | 本学科首页   官方微博 | 高级检索  
     

利用全局与局部帧级特征进行基于共享注意力的视频问答
引用本文:王雷全,候文艳,袁韶祖,赵欣,林瑶,吴春雷.利用全局与局部帧级特征进行基于共享注意力的视频问答[J].计算机科学,2021,48(8):145-149.
作者姓名:王雷全  候文艳  袁韶祖  赵欣  林瑶  吴春雷
作者单位:中国石油大学(华东)计算机科学与技术学院 山东 青岛266555;中国石油大学(华东)海洋与空间信息学院 山东 青岛266555
摘    要:视频问答是视觉理解领域中非常重要且具有挑战性的任务.目前的视觉问答(VQA)方法主要关注单个静态图片的问答,而现实生活中的数据是立体动态的视频.此外,由于问题的复杂性,视频问答任务必须根据问答问题恰当地处理多种视觉特征才能获得高质量的答案.文中提出了一个通过利用局部和全局帧级别的视觉信息来进行视频问答的多共享注意力网络.具体来说,以不同帧率提取视频帧,并以此提取帧级的全局与局部视觉特征,这两种特征包含了多个帧级别特征,用于对视频时间动态建模,再以共享注意力的形式建模全局与局部视觉特征的相关性,然后结合文本问题来推断答案.在天池视频问答数据集上进行了大量的实验,验证了所提方法的有效性.

关 键 词:视频问答  共享注意力机制  全局和局部帧级特征

Multi-Shared Attention with Global and Local Pathways for Video Question Answering
WANG Lei-quan,HOU Wen-yan,YUAN Shao-zu,ZHAO Xin,LIN Yao,WU Chun-lei.Multi-Shared Attention with Global and Local Pathways for Video Question Answering[J].Computer Science,2021,48(8):145-149.
Authors:WANG Lei-quan  HOU Wen-yan  YUAN Shao-zu  ZHAO Xin  LIN Yao  WU Chun-lei
Abstract:
Keywords:
本文献已被 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号