Qwen3.8-LiveTranslate sépare les voix pendant la traduction

Qwen3.8-LiveTranslate traduit 60 langues, sépare les interlocuteurs en temps réel et réduit son décalage moyen à 2,3 secondes, avec restitution vocale dans 29 langues.

Une réunion bilingue ne devient pas plus lisible lorsque toutes les interventions semblent provenir de la même personne. Avec Qwen3.8-LiveTranslate, Qwen cherche désormais à traduire la conversation tout en séparant les interlocuteurs, en conservant leur timbre et en affichant simultanément les propos d’origine.

Qwen3.8-LiveTranslate succède à la version 3.5 avec une architecture conçue pour traiter dans un même flux l’audio entendu, le texte reconnu, la traduction et la parole générée. L’équipe affirme que cette organisation améliore la fidélité, la fluidité et la concision tout en réduisant le retard accumulé pendant l’interprétation.

Le décalage moyen mesuré par Qwen passe de 2,8 à 2,3 secondes. Cette valeur correspond au LAAL, une mesure destinée à évaluer le retard d’un système de traduction simultanée par rapport au discours source. Elle ne doit pas être confondue avec le délai exact observé par chaque utilisateur.

La qualité du réseau, la distance avec le centre de données, la capture du microphone, la mise en mémoire tampon et la durée nécessaire à la restitution vocale peuvent ajouter leur propre latence. Les 2,3 secondes décrivent donc le résultat publié par Qwen dans son protocole, pas une garantie constante pour chaque conversation.

La principale évolution concerne l’organisation du traitement. Qwen parle d’une architecture « Interleave » dans laquelle l’audio, les textes source et traduit ainsi que la parole produite sont entrelacés selon leur ordre temporel.

Le système n’attend pas nécessairement la fin d’une intervention pour commencer sa traduction. Il traite le flux au fur et à mesure, réutilise ce qu’il a déjà entendu et tient compte des fragments de traduction précédemment générés.

Cette continuité doit éviter qu’une phrase soit traitée comme une succession d’éléments indépendants. Dans une traduction entre deux langues dont l’ordre des mots diffère, le système doit parfois attendre une information tardive avant de formuler correctement le début de la phrase. Il peut aussi anticiper une unité de sens, puis la corriger lorsque le contexte devient plus précis.

Qwen3.8-LiveTranslate repose sur une structure Hybrid-MoE divisée entre deux modules baptisés Thinker et Talker. Le premier reçoit les informations nécessaires à la compréhension et à la traduction. Le second transforme le texte traduit en parole.

Thinker place l’audio, les éventuelles images, la transcription source et la traduction dans une même séquence ordonnée dans le temps. La compréhension du discours et la production textuelle ne sont donc pas décrites comme deux services entièrement séparés reliés après coup.

Talker reçoit ensuite la traduction et des informations provenant de l’audio original. Il produit la voix correspondante en essayant de conserver le timbre de la personne qui parle.

Cette conservation ne revient pas à reproduire chaque caractéristique vocale à l’identique. La prosodie, l’accent, les émotions et le rythme peuvent évoluer au passage d’une langue à une autre. Certaines constructions nécessitent également une phrase plus longue ou plus courte que l’original.

La séparation des interlocuteurs intervient pendant la conversation. Lorsque plusieurs personnes prennent la parole successivement, le système attribue leurs interventions à des identifiants distincts et maintient cette distinction dans le texte comme dans la restitution vocale.

La formule utilisée par Qwen, « Names the speaker », peut prêter à confusion. Le modèle sépare et étiquette les voix, mais il ne déduit pas automatiquement l’identité civile d’une personne. Un identifiant comme « Speaker 1 » doit encore être associé à un nom par l’application ou par l’utilisateur si cette information est nécessaire.

Cette diarisation en temps réel doit faciliter le suivi d’une réunion, d’une interview ou d’un échange comportant plusieurs intervenants. Elle peut également empêcher qu’une voix clonée change de timbre à chaque prise de parole.

La démonstration concerne principalement des personnes qui parlent à tour de rôle. Qwen ne publie pas de mesure détaillée sur les conversations où plusieurs voix se chevauchent, sur les environnements très bruyants ou sur la séparation de personnes possédant des timbres proches.

Le système produit parallèlement la transcription source et sa traduction. Une interface peut donc afficher les deux versions de manière synchronisée, afin que l’utilisateur vérifie rapidement un terme, un nom ou une formulation sans revenir vers un service de transcription distinct.

Cette sortie bilingue ne se limite pas à l’affichage. Elle fournit une base pour générer des sous-titres, organiser une réunion, indexer son contenu ou rechercher ultérieurement un passage précis.

La mémoire du contexte intervient aussi dans la résolution des ambiguïtés. Un nom propre mal reconnu au début d’une conversation peut devenir plus identifiable lorsqu’il est répété, relié à une entreprise ou accompagné d’une information visuelle.

Le modèle s’appuie sur les tours précédents pour maintenir une terminologie plus cohérente. Une abréviation, une référence ou un mot possédant plusieurs sens peut être traduit en fonction de ce qui a déjà été dit plutôt que de la seule phrase en cours.

Des termes prioritaires peuvent également être enregistrés dans un corpus de session. L’API accepte jusqu’à 1 000 correspondances destinées à favoriser la bonne traduction des noms de marque, expressions professionnelles ou termes spécialisés.

Le contexte visuel complète l’audio. Une application peut transmettre une image ou des captures provenant d’un flux vidéo afin d’aider le modèle à interpréter un geste, un texte affiché, un objet ou une situation.

Cette fonction ne signifie pas que Qwen3.8-LiveTranslate produit ou modifie une vidéo. L’audio reste obligatoire et l’image constitue une entrée facultative utilisée pour réduire certaines ambiguïtés.

La couverture linguistique atteint 60 langues pour l’entrée audio et la traduction textuelle. Elle comprend notamment le français, l’anglais,