OpenSTBench : Au-delà de l’évaluation sémantique pour la traduction de la parole
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
May 29, 2026
Auteurs: Yanjie An, Yuxiang Zhao, Yichi Zhang, Qixi Zheng, Yujie Tu, Keqi Deng, Kai Yu, Xie Chen
cs.AI
Résumé
Les systèmes de traduction vocale couvrent de plus en plus la traduction parole-texte (S2TT), la traduction parole-parole (S2ST), la traduction hors ligne et la génération en flux, produisant des sorties qui diffèrent en termes de modalité, de réalisation vocale et de comportement temporel. Les pratiques d'évaluation existantes évaluent des aspects importants tels que la qualité de la traduction, la qualité vocale et la qualité temporelle, mais ces aspects sont souvent évalués selon des protocoles distincts, ce qui rend difficile une comparaison complète des systèmes hétérogènes. Pour combler cette lacune, nous présentons OpenSTBench, un cadre d'évaluation multidimensionnel unifié qui organise les sorties hétérogènes de traduction vocale dans un format d'évaluation partagé. OpenSTBench prend en charge les systèmes S2TT et S2ST en modes hors ligne et en flux, et évalue conjointement la qualité de la traduction, la qualité vocale, la préservation du locuteur, la fidélité émotionnelle et paralinguistique, la cohérence temporelle et la latence. Grâce à des expériences sur des systèmes représentatifs de traduction vocale, nous montrons que des systèmes ayant une forte qualité de traduction peuvent néanmoins différer considérablement en termes de qualité vocale et de qualité temporelle. OpenSTBench fournit un protocole reproductible pour analyser ces différences inter-dimensionnelles et faciliter la comparaison orientée application des systèmes de traduction vocale. Le code et les ensembles de données sont disponibles à l'adresse https://github.com/sjtuayj/OpenSTBench.
English
Speech translation systems increasingly span speech-to-text translation (S2TT), speech-to-speech translation (S2ST), offline translation, and streaming generation, producing outputs that differ in modality, speech realization, and timing behavior. Existing evaluation practices assess important aspects such as translation quality, speech quality, and temporal quality, but these aspects are often evaluated under separate protocols, making it difficult to compare heterogeneous systems comprehensively. To address this gap, we present OpenSTBench, a unified multidimensional evaluation framework that organizes heterogeneous speech translation outputs into a shared evaluation format. OpenSTBench supports both S2TT and S2ST systems in offline and streaming settings, and jointly evaluates translation quality, speech quality, speaker preservation, emotion and paralinguistic fidelity, temporal consistency, and latency. Through experiments on representative speech translation systems, we show that systems with strong translation quality can still differ substantially in speech quality, as well as in temporal quality. OpenSTBench provides a reproducible protocol for analyzing these cross-dimensional differences and supporting application-oriented comparison of speech translation systems. The code and datasets are available at https://github.com/sjtuayj/OpenSTBench.