基于多分辨率特征和时频注意力的环境声音分类期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

基于多分辨率特征和时频注意力的环境声音分类

作者姓名：	刘慧李小霞何宏森

作者单位：	西南科技大学信息工程学院,四川绵阳621010;西南科技大学信息工程学院,四川绵阳621010;西南科技大学特殊环境机器人技术四川省重点实验室,四川绵阳621010

基金项目：	国家自然科学基金资助项目(62071399)

摘要：	针对环境声音分类(ESC),提出了一种基于多分辨率特征和时频注意力的卷积神经网络环境声音分类方法.首先,相较单一分辨率的谱图,多通道多分辨率特征可以丰富特征信息,实现不同特征分辨率之间信息互补,增强特征的表达能力;其次,针对声信号提出了一种时频注意力模块,该模块先利用不同大小的一维卷积分别关注时域和频域有效信息,再用二维卷积将两者进行融合,从而抑制环境声中背景噪声并消除由多通道多分辨率带来的冗余信息干扰.实验结果表明,在ESC-10和ESC-50两个基准数据集上的分类准确率达到了98.50％和88.46％,与现有的最新方法相比分别提高了2.70％和0.76％.
关键词：	环境声音分类卷积神经网络时频注意力多通道特征多分辨率特征
收稿时间：	2021-05-12
修稿时间：	2021-11-18
本文献已被万方数据等数据库收录！
	点击此处可从《计算机应用研究》浏览原始摘要信息
	点击此处可从《计算机应用研究》下载全文