Publications

A structured record of research publications, with links to papers, code, and project pages.

2026

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

Ouyang, Zhicheng, Leem, Seong-Gyun, Do, Bach Viet, Wu, Haibin, Rastrow, Ariya, Liu, Yuzong, Metze, Florian

arXiv preprint arXiv:2604.08709, 2026

Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning

Kim, Minseok, Chen, Jingxiang, Leem, Seong-Gyun, Huang, Yin, Rungta, Rashi, Ouyang, Zhicheng, Wu, Haibin, Appini, Surya Teja, Bansal, Ankur, Bai, Yang, others

Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 5: Industry Track), 2026

2025

The msp-podcast corpus

Busso, Carlos, Lotfian, Reza, Sridhar, Kusha, Salman, Ali N, Lin, Wei-Cheng, Goncalves, Lucas, Parthasarathy, Srinivas, Naini, Abinay Reddy, Leem, Seong-Gyun, Martinez-Lucas, Luz, others

arXiv preprint arXiv:2509.09791, 2025

Affective priming in emotional annotations and its effect on speech emotion recognition

Martinez-Lucas, Luz, Salman, Ali, Leem, Seong-Gyun, Chien, Woan-Shiuan, Upadhyay, Shreya G, Lee, Chi-Chun, Busso, Carlos

IEEE Transactions on Affective Computing, 2025

Noise-robust speech emotion recognition using shared self-supervised representations with integrated speech enhancement

Tzeng, Jing-Tong, Leem, Seong-Gyun, Salman, Ali N, Lee, Chi-Chun, Busso, Carlos

ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2025

Minority views matter: Evaluating speech emotion classifiers with human subjective annotations by an all-inclusive aggregation rule

Chou, Huang-Cheng, Goncalves, Lucas, Leem, Seong-Gyun, Salman, Ali N, Lee, Chi-Chun, Busso, Carlos

IEEE Transactions on Affective Computing, 2025

2024

DESCRIBE WHERE YOU ARE: IMPROVING NOISE-ROBUSTNESS FOR SPEECH EMOTION RECOGNITION WITH TEXT DESCRIPTION

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

arXiv preprint arXiv:2407.17716, 2024

Speech Emotion Recognition in the Presence of Background Noise

Leem, Seong-Gyun

, 2024

Embracing ambiguity and subjectivity using the all-inclusive aggregation rule for evaluating multi-label speech emotion recognition systems

Chou, Huang-Cheng, Wu, Haibin, Goncalves, Lucas, Leem, Seong-Gyun, Salman, Ali, Busso, Carlos, Lee, Hung-yi, Lee, Chi-Chun

2024 IEEE Spoken Language Technology Workshop (SLT), 2024

Keep, Delete, or Substitute: Frame Selection Strategy for Noise-Robust Speech Emotion Recognition

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

, 2024

Describe where you are: Improving noise-robustness for speech emotion recognition with text description of the environment

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

arXiv preprint arXiv:2407.17716, 2024

Versatile audio-visual learning for emotion recognition

Goncalves, Lucas, Leem, Seong-Gyun, Lin, Wei-Cheng, Sisman, Berrak, Busso, Carlos

IEEE Transactions on Affective Computing, 2024

2023

Combining relative and absolute learning formulations to predict emotional attributes from speech

Naini, Abinay Reddy, Subramanium, Shruthi, Leem, Seong-Gyun, Busso, Carlos

2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), 2023

Selective acoustic feature enhancement for speech emotion recognition with noisy speech

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

IEEE/ACM transactions on audio, speech, and language processing, 2023

Analyzing the effect of affective priming on emotional annotations

Martinez-Lucas, Luz, Salman, Ali, Leem, Seong-Gyun, Upadhyay, Shreya G, Lee, Chi-Chun, Busso, Carlos

2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII), 2023

Computation and memory efficient noise adaptation of Wav2Vec2. 0 for noisy speech emotion recognition with skip connection adapters

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

Proc. Interspeech, 2023

The Importance of Calibration: Rethinking Confidence and Performance of Speech Multi-label Emotion Classifiers

Chou, Huang-Cheng, Goncalves, Lucas, Leem, Seong-Gyun, Lee, Chi-Chun, Busso, Carlos

, 2023

Adapting a self-supervised speech representation for noisy speech emotion recognition by using contrastive teacher-student learning

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2023

2022

Not all features are equal: Selection of robust features for speech emotion recognition in noisy environments

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2022

2021

Separation of Emotional and Reconstruction Embeddings on Ladder Network to Improve Speech Emotion Recognition Robustness in Noisy Conditions

Leem, Seong-Gyun, Fulford, Daniel, Onnela, Jukka-Pekka, Gard, David, Busso, Carlos

Proc. Interspeech, 2021

Quantifying emotional similarity in speech

Harvill, John, Leem, Seong-Gyun, AbdelWahab, Mohammed, Lotfian, Reza, Busso, Carlos

IEEE Transactions on Affective Computing, 2021

2020

Speaker anonymization for personal information protection using voice conversion techniques

Yoo, In-Chul, Lee, Keonnyeong, Leem, Seonggyun, Oh, Hyunwoo, Ko, Bonggu, Yook, Dongsuk

IEEE Access, 2020

Many-to-Many Voice Conversion Using Cycle-Consistent Variational Autoencoder with Multiple Decoders.

Yook, Dongsuk, Leem, Seong-Gyun, Lee, Keonnyeong, Yoo, In-Chul

Odyssey, 2020

2019

Multitask learning of deep neural network-based keyword spotting for IoT devices

Leem, Seong-Gyun, Yoo, In-Chul, Yook, Dongsuk

IEEE Transactions on Consumer Electronics, 2019