(1)
Su, T.; Hu, C. ESVA: Enhancing Multimodal Emotion Recognition via Multi-Scale Audio Feature Extraction and Cross-Modal Temporal Alignment. Informatica 2025, 49 (31). https://doi.org/10.31449/inf.v46i31.12043.