DOI：10.16798/j.issn.1003-0530.2023.04.014

基于频谱图转换器的音频场景分类

引用

摘要：

音频场景分类是场景理解重要的一环,学习音频场景特征并精准分类能加强机器与环境的交互能力,在大数据时代其重要性不言而喻.鉴于分类任务表现依赖数据集规模,但实际任务中又面临数据集严重不足的情况,本文提出了数据增强和网络模型预训练策略,将频谱图转换器模型和音频场景分类任务相结合.首先,提取音频信号对数梅尔能量频谱图输入模型,然后通过模型动态交互能力,加强音频序列空间关系,最后由标记向量完成分类.将本文方法在DCASE2019task1和DCASE2020task1公开数据集上进行测试,分类准确率分别达到了96.489％和93.227％,与已有算法相比有明显的提升,说明本方法适用高精度音频场景分类任务,为高精度智能设备感知环境内容、检测环境动态打下了基础.

关键词：音频场景分类、转换器、预训练、数据增强

所属期刊栏目：39

分类号：TP391;TPL83(计算技术、计算机技术)

资助基金：国家自然科学基金;内蒙古科技计划项目;内蒙古自然科学基金项目;内蒙古自治区高等学校青年科技英才支持计划

在线出版日期：2023-05-17（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：730-736

英文信息展示

期刊专题