Miso One, le text-to-speech expressif de Miso Labs

Miso One de Miso Labs est un modèle de text-to-speech de 8 milliards de paramètres qui génère des voix expressives avec seulement 110 ms de latence.

Cent dix millisecondes de latence pour une voix qui rit, hésite ou s'attriste : Miso One, premier modèle public de la startup Miso Labs passée par Y Combinator, aborde la synthèse vocale par l'émotion.

Fort de 8 milliards de paramètres, le modèle génère une parole au timing conversationnel réaliste et réagit au contexte audio en s'alignant sur le ton de son interlocuteur, du murmure au cri, un profil pensé pour les voice agents en temps réel comme pour la narration ou le podcast. Quelques secondes d'audio accompagnées de leur transcription suffisent à cloner une voix ou à la prolonger dans le même style, démonstration à l'appui avec une version synthétique de Sal Khan expliquant des mathématiques.

Sous le capot, l'architecture combine Sesame CSM et une Residual Vector Quantization à 32 codebooks, un backbone de 7,7 milliards de paramètres inspiré de Llama 3.2 étant couplé à un décodeur de 300 millions. Les poids sont publiés sur Hugging Face et le code d'inférence sur GitHub, de quoi exécuter le modèle en local sur un GPU suffisamment doté, une démo en ligne sur misolabs.ai et une API payante complétant l'offre à venir. Les fondateurs Aoden Teo et Cassidy Dalva visent, selon leurs mots, les foundation models vocaux les plus émotifs au monde.