SETEAB:用于语音情感识别的具有挤压激励时间增强感知块的多尺度方法
SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition
浏览论文内容
中文总结 AI 辅助
本文提出一种轻量级多尺度语音情感识别架构SETEAB,通过深度卷积子采样、挤压激励和时间增强感知块,在降低计算复杂度的同时提升识别准确率和跨语料库泛化能力。
中文摘要 AI 辅助
本文提出了一种用于语音情感识别(SER)的新型轻量级多尺度架构,具有三项关键创新。首先,引入基于深度可分离卷积的子采样模块,以减小模型规模和计算量,同时保留显著的情感线索。其次,集成挤压激励(Squeeze-and-Excitation)块,以增强通道级重新校准并提高表示鲁棒性。第三,设计了一个新的时间增强感知块(Temporal Enhanced Aware Block),以加强时间依赖性建模并产生更具判别性的情感感知特征。所提出的模型被明确设计为同时提高紧凑性、识别性能和泛化能力。在基准SER数据集上的实验表明,与最近大多数先进的SER网络相比,我们的方法以更低的计算复杂度实现了更高的准确率,同时还提供了更强的跨语料库性能。
英文摘要
This paper proposes a novel lightweight multiscale architecture for speech emotion recognition (SER) with three key innovations. First, a depthwise convolution-based subsampling module is introduced to reduce model size and computation while preserving salient emotional cues. Second, a Squeeze-and-Excitation block is integrated to enhance channel-wise recalibration and improve representation robustness. Third, a new Temporal Enhanced Aware Block is designed to strengthen temporal dependency modeling and produce more discriminative emotion-aware features. The proposed model is explicitly designed to jointly improve compactness, recognition performance, and generalizability. Experiments on benchmark SER datasets show that our method achieves higher accuracy with reduced computational complexity, while also delivering stronger cross-corpus performance than most recent advanced networks for SER.
发表机构
- Faculty of Information Technology, University of Science, Ho Chi Minh City(胡志明市理工大学信息技术学院)
- Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)
- UNEY
机构由 AI 辅助整理,请以论文原文为准。