10.16798/j.issn.1003-0530.2023.04.014
基于频谱图转换器的音频场景分类
音频场景分类是场景理解重要的一环,学习音频场景特征并精准分类能加强机器与环境的交互能力,在大数据时代其重要性不言而喻.鉴于分类任务表现依赖数据集规模,但实际任务中又面临数据集严重不足的情况,本文提出了数据增强和网络模型预训练策略,将频谱图转换器模型和音频场景分类任务相结合.首先,提取音频信号对数梅尔能量频谱图输入模型,然后通过模型动态交互能力,加强音频序列空间关系,最后由标记向量完成分类.将本文方法在DCASE2019task1和DCASE2020task1公开数据集上进行测试,分类准确率分别达到了96.489%和93.227%,与已有算法相比有明显的提升,说明本方法适用高精度音频场景分类任务,为高精度智能设备感知环境内容、检测环境动态打下了基础.
音频场景分类、转换器、预训练、数据增强
39
TP391;TPL83(计算技术、计算机技术)
国家自然科学基金;内蒙古科技计划项目;内蒙古自然科学基金项目;内蒙古自治区高等学校青年科技英才支持计划
2023-05-17(万方平台首次上网日期,不代表论文的发表时间)
共7页
730-736