基于自监督与知识蒸馏的轻量化声学场景分类
汪慧娟
李宏滨
太原师范学 山西晋中 030619
摘要:针对声学场景分类(ASC)任务中标注数据稀缺与边缘设备部署受限的双重挑战,文章提出了一种融合自监督学习(SSL)与知识蒸馏(KD)的创新框架.通过引入HuBERT自监督预训练模型,从大规模未标注的TAU Urban Acoustic Scene 2024数据中提取通用声学表征,并结合频谱混合风格(FMS)与自动设备脉冲响应(ADIR)增强策略,有效缓解设备域偏移问题.为实现边缘部署,设计双阶段轻量化架构:通过HuBERT教师模型生成软标签指导训练,采用MobileNetV2作为学生模型,在DCASE数据集上达到81.3%的准确率.结合量化感知训练(QAT)将模型压缩至115.6 kB,同时,通过残差归一化层与深度可分离卷积的混合结构,在TAU Urban数据集上实现设备无关性分类,显著提升实际场景鲁棒性.
关键词:声学场景分类深度学习轻量化模型自监督学习知识蒸馏量化感知训练
论文发表日期:2025-09-25
在线出版日期:2026-05-22(本平台首次上网日期,不代表文献的发表时间)
页数:5( 39-43 )
信息技术与信息化

信息技术与信息化

ISSN:1672-9528
年,卷(期):2025,(9)
所属栏目:计算机应用