Voice Design accélère le casting des agents et personnages virtuels
Gradium lance Voice Design, un outil qui génère en quelques secondes des voix synthétiques à partir d’une description, avec cinq langues et des accents régionaux.
Une réceptionniste britannique au débit posé, un narrateur américain âgé ou un conseiller québécois à la voix chaleureuse. Avec Voice Design, Gradium propose de décrire l’interprète recherché avant même que cette voix existe.
L’outil reçoit une instruction écrite précisant notamment l’accent, l’âge apparent, le genre, le rythme, la hauteur, l’énergie ou le registre souhaité. Il produit ensuite jusqu’à cinq propositions vocales en quelques secondes. L’utilisateur peut les écouter, relancer la génération ou conserver celle qui correspond le mieux à son projet.
Contrairement à un catalogue traditionnel, la recherche ne consiste donc plus à parcourir une liste de voix préenregistrées. Le point de départ devient un cahier des charges rédigé en langage naturel. Gradium donne par exemple comme descriptions une voix de pirate originaire de Bristol, un agent de service client irlandais ou une narratrice américaine plus âgée.
Chaque requête génère de nouveaux résultats, même lorsque la description reste identique. Voice Design ne recherche pas une voix existante dans une bibliothèque : le modèle échantillonne une nouvelle proposition. La reproductibilité n’intervient qu’après la sélection. Lorsqu’une voix est enregistrée, son identifiant `voiceid` reste stable pendant toute sa durée de conservation.
Cette distinction est importante pour une production appelée à évoluer. Une équipe peut explorer plusieurs interprétations au début du projet, puis verrouiller une voix afin que les épisodes, dialogues ou messages ultérieurs conservent la même identité sonore. Sans cette sauvegarde, une nouvelle génération à partir du même texte ne retrouvera pas exactement le résultat précédent.
Gradium oppose directement cette méthode au clonage vocal. Le clonage part d’un enregistrement et cherche à reproduire la voix d’une personne précise. Voice Design part uniquement d’une description et fabrique une voix synthétique qui n’appartient, en principe, à aucun interprète enregistré.
Les deux fonctions répondent ainsi à des besoins différents. Le clonage sert lorsqu’un projet doit retrouver une personne déjà choisie, avec son accord et les droits nécessaires. Voice Design intervient lorsque le rôle, l’accent ou le tempérament sont définis, mais que le locuteur ne l’est pas encore.
L’absence d’enregistrement initial allège une partie de la gestion contractuelle. Gradium affirme qu’une voix conçue avec son outil ne nécessite ni licence de comédien, ni renouvellement de consentement, ni redevance propre à cette voix. Le client conserve les droits sur les fichiers sonores qu’il génère, dans la mesure où ces productions peuvent être protégées par le droit applicable.
Une voix entièrement synthétique ne donne toutefois pas le droit d’imiter librement une personne réelle. Les conditions d’utilisation de Gradium interdisent les usages portant atteinte aux droits à l’image, à la personnalité ou à la vie privée, ainsi que l’usurpation d’identité d’une personne ou d’une entreprise sans autorisation explicite.
Une description demandant simplement une voix grave, lente et québécoise ne soulève donc pas les mêmes questions qu’une instruction visant à reproduire une personnalité identifiable. La responsabilité du texte transmis et de l’utilisation finale demeure celle du client.
La propriété d’un fichier généré ne garantit pas non plus l’exclusivité absolue de la voix. Gradium précise que les sorties de ses services peuvent ne pas être uniques et que d’autres clients peuvent recevoir des résultats identiques ou similaires. Le `voiceid` stabilise une voix dans le service, mais ne lui confère pas automatiquement le statut d’identité sonore réservée.
Voice Design prend actuellement en charge l’anglais, le français, l’allemand, l’espagnol et le portugais. À l’intérieur de ces langues, les instructions peuvent mentionner des accents régionaux. Gradium recommande d’indiquer une région précise, par exemple « colombien » plutôt que « latino-américain », ou « québécois » plutôt que « canadien-français ».
Cette précision réduit l’ambiguïté de la demande, sans garantir que chaque auditeur identifiera l’accent de la même manière. Un accent comprend des variations géographiques, sociales et générationnelles difficiles à condenser en quelques mots. Le résultat doit donc être écouté et validé par des personnes connaissant la région concernée, particulièrement lorsqu’il doit représenter une communauté ou une marque locale.
Les voix conservées rejoignent ensuite le fonctionnement habituel de Gradium. Leur identifiant peut être envoyé au même service de synthèse vocale en streaming que les voix du catalogue ou les clones. Elles bénéficient des mêmes formats de sortie et n’exigent pas un circuit de production séparé.
Cette continuité vise notamment les agents vocaux, les jeux, les livres audio, les personnages virtuels, les standards automatisés et les services clients. Une entreprise peut préparer plusieurs identités adaptées à des marchés différents, tandis qu’un studio peut créer des personnages secondaires sans organiser immédiatement une séance d’enregistrement.
La conception par description facilite aussi les premiers essais. Une équipe peut comparer une interprétation calme à une version plus énergique, modifier l’âge apparent ou resserrer l’accent avant d’intégrer la voix dans son application. L’écoute reste toutefois indispensable : une instruction linguistiquement correcte ne suffit pas à vérifier la prononciation d’un nom, la stabilité émotionnelle ou la qualité d’un long dialogue.
Gradium annonce Voice Design comme une fonction gratuite dans son API et son Studio. Cette formulation concerne l’accès à l’outil, mais ne signifie pas que tous les fichiers produits peuvent être exploités commercialement sans abonnement.
La grille tarifaire réserve l’usage commercial aux formules payantes. Le forfait gratuit autorise cinq voix personnalisées et comprend 45 000 crédits, soit environ une heure de synthèse selon l’estimation de l’entreprise, mais il reste destiné