86 balises expressives et seize langues pour le modèle vocal d'Alibaba
Le modèle Qwen-Audio-3.0-TTS d'Alibaba intègre des balises de jeu pour dicter les rires et les soupirs. Une avancée pour le doublage en seize langues.
Deux variantes composent Qwen-Audio-3.0-TTS, le modèle de synthèse vocale de Tongyi Lab, le laboratoire d'Alibaba. La première, Flash, vise l'interaction temps réel avec une latence de premier paquet annoncée autour de 300 ms. La seconde, Plus, privilégie la qualité de génération, naturel de la prosodie et fidélité du timbre.
La couverture linguistique atteint seize langues, dont l'arabe, l'indonésien, le portugais, le thaï, le vietnamien, le malais et le tagalog, auxquelles s'ajoutent vingt aires dialectales chinoises. Sur ses propres mesures, Tongyi Lab revendique les meilleurs taux d'erreur sur dix des seize langues et une similarité de locuteur en tête sur l'ensemble. Le laboratoire indique par ailleurs occuper la première place du classement text-to-speech d'Artificial Analysis, évaluateur tiers.
Le pilotage passe par deux voies. Une consigne rédigée en langage courant décrit le rendu attendu, rôle, émotion, style, débit, timbre ou accent, sans réglage acoustique manuel. En parallèle, quatre-vingt-six balises insérées dans le texte agissent au niveau de la phrase ou du mot : les unes fixent une tonalité qui court jusqu'à la balise suivante, comme [angry] ou [whispers], les autres déclenchent un événement non verbal à un point précis, rire, soupir, toux ou reprise de souffle.
Le clonage de voix accepte des références dégradées. L'entraînement a intégré une simulation acoustique de manière à loger le débruitage dans le trajet de clonage, l'objectif étant d'atténuer réverbération et bruit de fond sans altérer le timbre. Côté architecture, un tokenizer de parole à 12,5 Hz réduit le coût du décodage autorégressif. Le modèle synthétise jusqu'à trois minutes en une passe, s'accompagne d'une bibliothèque de voix préréglées dans les seize langues, et se consomme en streaming WebSocket aux formats PCM, WAV, MP3 et Opus. Une sortie à 48 kHz est annoncée.