Eleven v4 travaille désormais la voix comme une interprétation
ElevenLabs fait évoluer sa synthèse vocale avec Eleven v4, une nouvelle architecture capable de suivre des indications de jeu, de conserver une voix entre plusieurs régénérations et de maintenir la continuité sur des contenus longs. Une variante Turbo cible les agents vocaux avec environ 100 ms de latence médiane d’inférence.
Une direction vocale directement dans le script
Un rire, un murmure ou le claquement d’une porte peuvent désormais faire partie des instructions transmises au modèle. Avec Eleven v4, ElevenLabs introduit une nouvelle architecture conçue pour interpréter le contexte d’un script, identifier les différents interlocuteurs et adapter la manière dont chaque réplique est prononcée.
Les indications sont écrites directement dans le texte avec des Audio Tags comme `[laughs]`, `[whispers]`, `[excited]` ou `[door slams]`. ElevenLabs indique avoir amélioré leur suivi par rapport à v3, y compris lorsque plusieurs instructions et effets sonores se succèdent.
Le modèle prend en charge plus de 90 langues, plusieurs interlocuteurs au sein d’une même génération et des effets sonores intégrés à la scène. Régénérer une réplique sans changer de personnage
La stabilité vocale fait partie des principaux changements par rapport à Eleven v3. Une même ligne peut être régénérée plusieurs fois tout en conservant l’identité du locuteur, aussi bien dans un dialogue que dans une narration.
Les Professional Voice Clones, absents de v3, reviennent également avec Eleven v4. Ils bénéficient des capacités expressives et multilingues du nouveau modèle. ElevenLabs précise que chaque clonage vocal nécessite le consentement vérifié du propriétaire de la voix.
Pour les contenus longs, un système de context stitching conserve le contexte entre plusieurs générations afin de limiter les ruptures de rythme et d’interprétation. Une génération individuelle reste limitée à 10 000 caractères, mais plusieurs segments peuvent ainsi être assemblés pour produire des formats comme un livre audio. Une version Turbo pour les conversations en temps réel
Eleven v4 Turbo reprend les capacités expressives de v4 avec une architecture destinée aux agents vocaux et aux interactions en direct.
ElevenLabs rapporte environ 100 ms de latence médiane d’inférence et 150 ms avant le début de la parole. Dans la comparaison publiée par l’entreprise, Cartesia Sonic 3.6 atteint 262 ms de time to first speech et GPT-4o mini TTS 814 ms.
La variante Turbo accepte le streaming bidirectionnel. Le texte peut être envoyé progressivement pendant sa génération par un LLM, tandis que la synthèse audio commence avant même que la phrase complète soit disponible.
Les Professional Voice Clones fonctionnent avec v4 et v4 Turbo, ce qui permet de conserver la même identité vocale entre un contenu produit hors ligne et une conversation en temps réel. Cloner, décrire ou corriger une voix
Eleven v4 conserve plusieurs méthodes de création et de contrôle vocal. Une voix peut être clonée à partir d’un échantillon audio, tandis que Voice Design génère une voix depuis une description textuelle.
Les dictionnaires de prononciation restent disponibles pour préciser la phonétique des noms, acronymes ou termes techniques. Les pauses et intentions passent désormais par les Audio Tags en langage naturel, les balises SSML comme `` étant désactivées avec v4.
La bibliothèque de ElevenLabs compte plus de 17 500 voix compatibles avec le modèle. Les anciens Instant Voice Clones et Professional Voice Clones créés avant v4 doivent toutefois être réentraînés pour fonctionner correctement avec cette architecture. La même architecture pour la production et les agents
Eleven v4 cible prioritairement les contenus produits où la qualité vocale est privilégiée, tandis que v4 Turbo est destiné aux applications interactives et à ElevenAgents.
Les deux modèles sont également accessibles via l’API, avec endpoints streaming et non-streaming ainsi que des SDK TypeScript et Python. Les formats de sortie restent identiques aux autres modèles ElevenLabs, dont MP3, WAV, PCM et µ-law pour la téléphonie.