Music v2.5 ouvre l’usage commercial à son offre gratuite
ElevenLabs améliore les instruments, les voix et les arrangements de Music v2.5, tout en autorisant l’exploitation commerciale des morceaux originaux créés gratuitement avec attribution.
Créer gratuitement une chanson pour accompagner une publicité, une vidéo ou un contenu de marque devient possible chez ElevenLabs. Avec Music v2.5, l’entreprise ne se contente pas d’annoncer une amélioration sonore : elle modifie aussi les droits accordés aux utilisateurs de sa plateforme ElevenMusic.
Disponible depuis le 11 septembre 2026, Music v2.5 devient le modèle utilisé par défaut pour les créations à partir d’une instruction et d’un morceau de référence. Music v2 reste proposé aux utilisateurs qui préfèrent son rendu ou souhaitent conserver une continuité avec leurs anciens projets.
Cette nouvelle version produit, selon ElevenLabs, des mélodies plus riches, des instruments plus naturels et des arrangements possédant davantage de profondeur. L’objectif n’est pas seulement d’ajouter des éléments dans le morceau, mais de mieux les faire évoluer ensemble sur toute sa durée.
La société insiste notamment sur les productions dominées par la voix et les instruments acoustiques. Elle affirme observer ses progrès les plus nets sur le R&B, la soul, le hip-hop, le rock, le metal, ainsi que sur les compositions orchestrales et cinématographiques.
Le terme « naturel » ne signifie pas que de véritables musiciens ont interprété les pistes produites. ElevenLabs cherche à rapprocher leur timbre, leurs variations et leur dynamique de ce que l’on pourrait entendre dans une prise enregistrée, avec moins de sons figés ou de couches donnant l’impression d’avoir été assemblées séparément.
L’entreprise a comparé Music v2 et v2.5 lors d’un test à l’aveugle portant sur 47 885 paires. La même instruction était utilisée pour produire une version avec chacun des deux modèles, puis les participants devaient indiquer celle qu’ils préféraient. Music v2.5 aurait remporté la majorité des comparaisons.
Ce résultat donne un premier indice, mais reste incomplet. ElevenLabs ne communique ni le pourcentage exact de préférence, ni le nombre de personnes interrogées, ni leur profil, ni les instructions retenues. Aucun jeu de test ou protocole détaillé ne permet donc de reproduire cette évaluation de manière indépendante.
L’amélioration revendiquée repose en grande partie sur les fonctions introduites avec Music v2 en mai 2026. Le modèle peut construire un morceau section par section, maintenir une composition longue, changer de genre en cours de lecture et interpréter des paroles rapides ou très denses, notamment pour le rap.
La génération peut commencer à partir d’une ambiance, d’un style, d’un tempo, d’une instrumentation ou de paroles. L’utilisateur peut demander un morceau vocal ou instrumental, définir sa structure et indiquer comment les différentes parties doivent évoluer. Les créations durent entre trois secondes et cinq minutes selon la documentation de Music.
Les transitions de genre permettent, par exemple, de commencer avec une introduction orchestrale, de poursuivre avec une section rock puis de rejoindre une production électronique. Le modèle ne juxtapose pas obligatoirement trois extraits indépendants : il tente de préserver la continuité musicale pendant les changements.
Cette capacité reste dépendante de la précision de la demande et de la complexité du morceau. Une transition convaincante nécessite de faire évoluer simultanément le rythme, les timbres, la tonalité, les voix et la structure. ElevenLabs ne publie pas encore de mesure spécifique comparant la fiabilité de ces transformations entre v2 et v2.5.
Le traitement des paroles et des voix multilingues fait également partie des points mis en avant. Le modèle doit produire des voix donnant l’impression d’appartenir à la langue demandée, avec une prononciation et un phrasé plus cohérents. L’annonce ne fournit toutefois pas la liste complète des langues évaluées ni de résultat détaillé pour chacune d’elles.
La formule employée par ElevenLabs, des voix qui paraissent « natives » dans la langue de l’utilisateur, doit donc être comprise comme une promesse de rendu. Elle ne garantit pas l’absence d’accent involontaire, d’erreur de prononciation ou de syllabe déformée, particulièrement avec des paroles rapides, des noms propres ou des langues moins représentées.
Music v2.5 conserve également l’inpainting. Cette fonction permet de sélectionner une partie d’un morceau déjà produit et de la régénérer sans recommencer l’ensemble. Un utilisateur peut ainsi modifier un couplet, remplacer un pont ou reprendre une transition tout en conservant le reste de la composition.
La continuité obtenue autour de la zone remplacée reste un enjeu important. Le nouveau passage doit reprendre le tempo, la tonalité, l’acoustique et les caractéristiques de la voix déjà entendue. ElevenLabs affirme que v2.5 améliore la qualité générale et le respect des instructions, mais ne publie pas d’évaluation consacrée aux raccords produits par cette fonction.
Un autre mode utilise un extrait sonore comme référence. Il accepte environ trente secondes d’audio pour orienter la production, l’instrumentation, le tempo, l’ambiance et le caractère général d’une nouvelle chanson. Cette fonction est disponible avec v2 et v2.5 sur les formules payantes.
Le morceau envoyé ne doit pas être considéré comme une matière directement intégrée à la nouvelle piste. D’après la documentation, Audio Reference guide la création sans copier ni remixer l’enregistrement. Chaque fichier est soumis à une vérification destinée à repérer les contenus protégés.
Cette distinction réduit l’intérêt du système pour une transformation radicale. Envoyer une chanson de jazz puis demander une version rap ne correspond pas au fonctionnement prévu et peut produire un résultat moins fiable. La référence sert principalement à indiquer une direction sonore proche de l’extrait fourni.
La communication publiée sur X emploie une formulation plus large en proposant de partir d’une idée, d’un son ou d’une boucle pour obtenir une chanson terminée. Dans la pratique, le résultat dépendra de l’origine du fichier. Un extrait créé par l’utilisateur ou dont il