ElevenLabs ouvre Speech Engine, une couche vocale à greffer sur un agent textuel existant

ElevenLabs lance Speech Engine, une brique vocale intégrant transcription et synthèse dans plus de 70 langues pour transformer tout LLM textuel en agent audio.

Speech Engine permet de transformer un agent conversationnel écrit en agent vocal sans toucher à son architecture. Le LLM, le système de récupération documentaire et la logique métier restent intacts : la brique vocale vient se poser par-dessus la pile existante. L'installation passe par une commande unique, via un skill qui configure l'ensemble du nécessaire pour basculer du texte à la voix en un seul prompt.

Le pipeline réunit dans un même ensemble la transcription, la synthèse vocale et l'orchestration audio, conçues pour fonctionner de concert. La reconnaissance vocale couvre plus de 90 langues, la synthèse plus de 70, avec accès à une bibliothèque de plus de 11 000 voix et au clonage vocal. Des modèles dédiés gèrent la détection de fin de tour de parole et les interruptions en cours de phrase, sans logique supplémentaire à coder.

Côté intégration, un SDK serveur reçoit les transcriptions, les transmet au modèle de langage et renvoie la réponse, tandis qu'un SDK client lance une session depuis un navigateur ou une application mobile. Ce dernier est identique à celui d'ElevenAgents, ce qui rend une migration ultérieure transparente. La plateforme prend en charge les conformités SOC 2, HIPAA et GDPR, avec résidence des données en Europe et mode sans rétention disponibles.