Gemini 3.8 transforme le text-to-speech en studio de direction vocale

Gemini 3.8 Flash TTS et Flash-Lite TTS étendent la génération vocale de Google avec la création de voix par prompt, une bibliothèque de plus de 2 000 profils et un contrôle ligne par ligne de l’interprétation. Flash privilégie la direction créative, tandis que Flash-Lite cible les volumes importants.

Une voix décrite plutôt que sélectionnée

Choisir un preset n’est plus le seul point de départ. Avec Gemini 3.8 Flash TTS, une identité vocale peut être construite en langage naturel en précisant son rôle, son accent et différentes caractéristiques d’interprétation.

Google annonce une couverture de plus de 100 langues et dialectes pour cette génération, accompagnée d’une bibliothèque de plus de 2 000 voix prêtes à l’emploi. Des variantes régionales comme le français québécois, l’espagnol mexicain ou l’anglais écossais sont intégrées.

Flash-Lite TTS reprend une partie de ces contrôles mais avec une orientation différente. Google le destine aux volumes importants de doublage, à la production audio et aux agents vocaux, avec un positionnement davantage centré sur le coût et le passage à l’échelle. Trente secondes pour reproduire un profil vocal

Gemini 3.8 Flash TTS ajoute également la réplication vocale à partir d’un échantillon de 30 secondes. L’utilisateur doit fournir sa propre voix ou disposer des droits nécessaires sur celle utilisée comme référence.

Google impose une vérification du consentement : une seconde captation verbale du propriétaire doit correspondre à la personne présente dans l’échantillon avant la création de la voix. Les contenus audio générés par les modèles Gemini Audio intègrent également SynthID et Google mentionne l’utilisation de métadonnées C2PA pour la réplication vocale.

Cette fonction n’est cependant pas accessible partout. Dans Google AI Studio, la réplication vocale est exclue de l’Espace économique européen, du Royaume-Uni, de la Suisse, de l’Inde ainsi que de l’Illinois et du Texas aux États-Unis. Diriger chaque réplique

Les deux modèles interprètent des indications intégrées directement au script. Ton, rythme, accent, chuchotement ou intentions de jeu peuvent ainsi évoluer d’une ligne à l’autre sans générer séparément chaque variation.

Le système accepte également des indications non verbales comme les rires, soupirs ou halètements, ainsi que des réactions courtes utilisées pendant une conversation. Une scène à deux personnages peut être générée depuis un seul script tout en conservant deux identités vocales distinctes et l’alternance entre les interlocuteurs.

Google indique aussi avoir travaillé sur les productions longues afin de limiter la dérive du timbre et du personnage au fil de plusieurs heures, un point destiné notamment aux podcasts et livres audio. Des benchmarks externes pour la personnalisation

Sur le Voice Design Benchmark de Hume AI, Gemini 3.8 Flash TTS obtient un score de 71,4 dans les résultats rapportés par Google, avec 60,8 sur la modélisation des accents. Flash et Flash-Lite occupent également les deux premières positions de l’Overall Quality Index de ce benchmark.

Google rapporte aussi des résultats issus d’évaluations humaines à l’aveugle de Voice Arena, avec des positions élevées dans plusieurs langues, dont le japonais, le portugais brésilien, l’arabe standard moderne, l’espagnol mexicain et l’hindi. Ces résultats restent dépendants des protocoles et modèles présents dans ces classements au moment de leur mesure. Un playground dédié dans AI Studio

Google AI Studio regroupe ces fonctions dans un espace consacré à la création vocale. Une voix peut y être décrite, enregistrée puis utilisée dans un éditeur de scènes à deux interlocuteurs pour travailler chaque réplique.

Les deux modèles sont également accessibles aux développeurs via la Gemini API. Gemini 3.8 Flash TTS rejoint Gemini Notebook, tandis que Flash-Lite TTS est intégré à Google Vids. L’accès via Gemini Enterprise est prévu ultérieurement.