ZONOS2, le TTS temps réel à clonage de voix de Zyphra, en open weights

Zyphra lance ZONOS2, un modèle TTS open weights de 8 milliards de paramètres sous Apache 2.0, optimisé pour le clonage de voix haute-fidélité en temps réel.

Sous licence Apache 2.0, ZONOS2 est le nouveau modèle de synthèse vocale temps réel de Zyphra, centré sur le clonage de voix haute-fidélité. Sa particularité tient à l'architecture : c'est, selon l'éditeur, le premier TTS en open weights bâti sur un Mixture of Experts (MoE) sparse, avec 900 millions de paramètres actifs pour 8 milliards au total.

Ce choix vise à desserrer le compromis habituel entre qualité et vitesse, l'abandon du Classifier Free Guidance permettant, d'après Zyphra, de quadrupler le débit temps réel par rapport à la version précédente. Côté texte, le modèle lit directement des octets UTF-8 plutôt que de passer par un phonemizer, ce qui élargit la couverture linguistique, renforce le chinois, le coréen et le japonais, et autorise le code-switching en cours de phrase. Il prédit des tokens Descript Audio Codec pour un rendu 44,1 kHz et se décline en deux modes : l'un « stable », qui lisse la sortie, l'autre « expressive », qui privilégie la fidélité au clone jusqu'aux imperfections de la source. Entraîné sur plus de six millions d'heures d'audio, ZONOS2 s'accompagne de ZTTS1-Eval, un nouveau benchmark couvrant jusqu'à dix-sept langues et conçu en critique des jeux d'évaluation existants.

Le modèle est disponible sur Hugging Face, avec son code d'inférence sur GitHub et un hébergement gratuit pour un temps sur Zyphra Cloud.