Le MCP d’ElevenLabs relie les assistants à plus de 50 modèles créatifs
Depuis ChatGPT, Claude, Cursor, Grok Bot ou Hermes, le MCP d’ElevenLabs peut désormais générer des voix, transcriptions, doublages, musiques, effets sonores, images et vidéos au sein d’une même conversation.
Créer une image, l’animer, lui ajouter une voix, une musique et quelques effets sonores sans quitter la conversation engagée avec son assistant. Le MCP d’ElevenLabs réunit désormais ces opérations derrière une seule connexion.
Le nouveau périmètre du connecteur couvre la synthèse vocale, la transcription, le doublage, la musique, les effets sonores, la génération et la retouche d’images, la vidéo et la synchronisation labiale. Les résultats apparaissent directement dans ChatGPT, Claude, Cursor, Grok Bot ou Hermes, puis sont enregistrés dans le workspace ElevenCreative associé au compte.
La première version diffusée quelques semaines plus tôt se concentrait sur ElevenAgents. Elle permettait d’examiner les performances des agents vocaux et textuels, d’en créer de nouveaux, de modifier leurs configurations ou d’estimer le coût de leur modèle de langage. Le même connecteur donne maintenant accès aux fonctions créatives, sans nouvelle installation lorsque l’intégration était déjà active.
MCP, pour Model Context Protocol, fournit une interface commune entre un assistant et des services externes. Les modèles d’ElevenLabs ne sont pas directement intégrés à ChatGPT ou Claude. L’assistant traduit la demande en appel d’outil, le serveur hébergé exécute l’opération sur l’infrastructure concernée, puis renvoie le fichier dans la conversation.
La connexion utilise OAuth. L’utilisateur sélectionne ElevenLabs dans le répertoire de connecteurs ou de plugins de son assistant, se connecte à son compte et autorise l’accès au workspace. Aucune clé API ne doit être copiée dans la conversation et aucun serveur local n’est nécessaire.
Les procédures diffèrent légèrement selon le client. ChatGPT, Claude, Cursor et Grok Bot disposent d’une installation depuis leur répertoire respectif. Claude Code et Hermes demandent l’ajout de l’adresse du serveur depuis le terminal avant l’authentification. La page officielle du MCP fournit les commandes et liens correspondant à chaque environnement.
Pour la synthèse vocale, une demande peut sélectionner une voix accessible dans la bibliothèque, préciser le texte et indiquer la manière de l’interpréter. Le fichier sonore revient dans la discussion et reste disponible dans ElevenCreative. Les voix privées ou partagées restent soumises aux autorisations du workspace.
Scribe traite le parcours inverse. Un enregistrement transmis à l’assistant peut être converti en texte avec identification des intervenants et repères temporels. ElevenLabs revendique une couverture de 99 langues dans la présentation du MCP. La transcription peut ensuite servir de base à des sous-titres, un script ou un doublage.
Le doublage passe par la même connexion. L’utilisateur fournit un contenu et demande une autre langue. Le service cherche à conserver la voix, le ton et l’interprétation du locuteur d’origine, puis renvoie la piste terminée dans la conversation.
La musique et les effets sonores complètent cette chaîne audio. Une instruction peut demander un morceau avec ou sans paroles, définir un style, une ambiance ou une durée, puis générer plusieurs effets destinés à une scène. Chaque opération reste séparée, même si l’assistant peut les enchaîner à partir d’un brief commun.
La partie visuelle provient d’ElevenCreative Flows. La documentation Image & Video recense notamment GPT Image 2, Nano Banana 2, Krea 2, Seedream, Sora 2, Veo 3.1, Kling et plusieurs modèles de Runway. Le catalogue couvre la création et la retouche d’images, le text-to-video, l’animation d’une image, la transformation d’une vidéo existante et la synchronisation labiale.
Les fonctions disponibles varient selon le modèle et la région. Plusieurs services de ByteDance ou de Kling ne sont pas accessibles aux États-Unis. Certaines fonctions exigent également des références visuelles particulières, imposent une durée fixe ou limitent les formats de sortie. La mention de plus de 50 modèles ne signifie donc pas que chaque compte dispose du même catalogue.
Une demande peut combiner plusieurs étapes : écrire un script, générer la voix, composer un accompagnement, préparer les effets, créer les visuels puis produire la vidéo. La communication officielle présente ce parcours comme le passage d’un brief à une pièce terminée.
Le résultat doit plutôt être considéré comme une première version. Le billet lui-même renvoie l’utilisateur vers ElevenCreative Studio pour reprendre la timeline, ajuster la narration, modifier les pistes sonores et préparer l’export. La réunion des outils réduit les déplacements entre services, mais ne supprime pas le montage ni la validation éditoriale.
Chaque création rejoint le workspace ElevenCreative. Elle peut ensuite être ouverte dans Studio ou replacée dans un Flow plus détaillé. La conversation sert alors d’interface de commande, tandis que la plateforme conserve les fichiers et les outils nécessaires aux corrections.
Toutes les étapes disponibles dans Flows doivent être accessibles depuis le MCP. Cet espace permet de construire des chaînes multimodales sur un canvas, puis de relancer seulement la partie à modifier. Une nouvelle voix peut, par exemple, remplacer la précédente sans recommencer la création des images qui ne dépendent pas de cette piste.
ElevenCreative Flows reste cependant en Alpha, tandis que la génération d’images et de vidéos est indiquée en bêta. Les fonctions, les modèles et leurs conditions d’accès peuvent encore évoluer. L’exécution de Flows par API pour une production automatisée à grande échelle est par ailleurs annoncée pour une version ultérieure.
Le connecteur conserve parallèlement ses fonctions de gestion des agents. Depuis le même assistant, un utilisateur autorisé peut consulter des conversations, comparer des configurations, modifier un prompt, remplacer une voix, créer un agent ou en supprimer un. L’accès créatif ne remplace donc pas le premier MCP, il élargit sa surface d’action.
Cette extension rend les permissions plus importantes. Les administrateurs choisissent les outils que la connexion peut