Pocket TTS génère désormais chaque fragment de voix en une seule passe avec Drifting

Kyutai adapte l’objectif génératif Drifting à Pocket TTS, son modèle de synthèse vocale de 100 millions de paramètres. Cette nouvelle méthode conserve une génération en une seule passe, atteint 0,96 % de WER et évite les calculs de Jacobienne utilisés par son précédent entraînement LSD.

Une nouvelle méthode d’entraînement pour Pocket TTS

Toutes les 80 ms, Pocket TTS doit produire le prochain fragment latent qui composera la voix. Plutôt que de multiplier les étapes de génération comme dans un processus de diffusion classique, son sampler head transforme directement du bruit en prochain latent en une seule passe.

Kyutai utilisait jusqu’ici Lagrangian self-distillation, ou LSD, pour entraîner cette partie du modèle. Le laboratoire expérimente désormais Drifting, un objectif génératif récent qui déplace l’itération vers la phase d’entraînement plutôt que vers l’inférence.

Selon Kyutai, il s’agit de la première application connue de Drifting à un modèle de parole et à un modèle autorégressif. Attirer les générations vers les données

Le principe diffère d’un flow matching classique. Pendant l’entraînement, plusieurs candidats sont générés pour le prochain fragment audio. Drifting les rapproche des données réelles tout en les éloignant les uns des autres lorsqu’ils deviennent trop similaires.

Une fois la distribution générée alignée sur celle des données, ces deux forces s’équilibrent.

Cette construction évite les Jacobian-vector products nécessaires avec LSD. Kyutai les décrit comme coûteux et délicats numériquement pendant l’entraînement. Aucun solveur itératif ou second réseau n’est ajouté à la génération.

Pocket TTS conserve donc son fonctionnement en une seule passe pour chaque fragment audio. Une température apprise plutôt que fixée

L’adaptation n’a pourtant pas fonctionné directement avec la recette originale de Drifting. Le principal changement concerne la kernel temperature, qui détermine la distance à laquelle les échantillons interagissent pendant l’entraînement.

La fixer dès le départ à sa valeur finale provoquait un effondrement des candidats et maintenait le WER entre 15 et 20 %. Kyutai a donc rendu cette température apprenable. Dans ses différents essais réussis, elle converge vers une valeur comprise entre 0,055 et 0,057.

Deux autres paramètres complètent la recette : une normalisation des distances pour chaque frame et des batches suffisamment importants. Avec 64 lignes par étape, le modèle n’atteignait pas le niveau de qualité recherché dans la fenêtre testée. Le laboratoire retient 128 lignes et 32 à 64 candidats négatifs. 0,96 % de WER face à 0,91 % pour LSD

Sur 1 127 éléments de LibriSpeech test-clean, avec la même architecture de backbone et le même codec, la version Drifting obtient 0,96 % de WER, un score UTMOS de 4,32 et une similarité speaker de 0,926.

La baseline LSD atteint respectivement 0,91 %, 4,31 et 0,927. Kyutai considère ces différences comme comprises dans le bruit de l’évaluation. Les deux variantes conservent également le même coût d’inférence.

Une autre évaluation du modèle `englishdrifting26-09`, avec des paramètres différents, mesure 0,90 % de WER et 4,37 UTMOS, contre 0,90 % et 4,36 pour le modèle anglais par défaut. Le coût se déplace vers l’entraînement

Drifting simplifie certains calculs, mais ne réduit pas encore le coût global d’apprentissage. Sur quatre GPU H100, la meilleure recette Drifting atteint le seuil UTMOS de 4,0 après environ 10 à 12 heures, contre 4,9 à 5,6 heures avec LSD.

À qualité comparable, Kyutai estime donc aujourd’hui le coût d’entraînement à environ deux fois celui de LSD.

Le modèle reste en revanche destiné à une exécution locale sur CPU. Pocket TTS compte 100 millions de paramètres, fonctionne plus rapidement que le temps réel sans GPU et prend en charge le clonage vocal à partir d’un extrait audio. La variante expérimentale est disponible sous le nom `englishdrifting26-09`, avec son code et sa recette d’entraînement publiés dans le repository.