MMMOS: Multi-domain Multi-axis Audio Quality Assessment

ASRU

Yi-Cheng Lin*, Jia-Hung Chen*, Hung-yi Lee

2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) , 1–4 , 2025

Abstract

Accurate audio quality estimation is essential for developing and evaluating audio generation, retrieval, and enhancement systems. Existing non-intrusive assessment models predict a single Mean Opinion Score (MOS) for speech, merging diverse perceptual factors and failing to generalize beyond speech. We propose MMMOS, a no-reference, multi-domain audio quality assessment system that estimates four orthogonal axes: Production Quality, Production Complexity, Content Enjoyment, and Content Usefulness across speech, music, and environmental sounds. MMMOS fuses frame-level embeddings from three pretrained encoders (WavLM, MuQ, and M2D) and evaluates three aggregation strategies with four loss functions. By ensembling the top eight models, MMMOS shows a 20-30% reduction in mean squared error and a 4-5% increase in Kendall’s τ versus baseline, gains first place in six of eight Production Complexity metrics, and ranks among the top three on 17 of 32 challenge metrics.

BibTeX

@inproceedings{lin2025mmmos,
  title = {MMMOS: Multi-domain Multi-axis Audio Quality Assessment},
  author = {Lin, Yi-Cheng and Chen, Jia-Hung and Lee, Hung-yi},
  booktitle = {2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)},
  year = {2025},
  pages = {1--4},
  doi = {10.1109/ASRU65441.2025.11433844},
}

← All publications