Resemble AI publie DramaBox, un modèle TTS open source pour performances vocales dirigées

Resemble AI lance DramaBox, un modèle TTS open source de 48 kHz piloté par didascalies, basé sur LTX-2.3 de Lightricks et Gemma 3 12B pour le clonage de voix.

Resemble AI met à disposition en open source DramaBox, un modèle de synthèse vocale conçu pour la production narrative et cinématographique. Le système se pilote comme un script de film : les dialogues s'écrivent entre guillemets, et les didascalies placées hors guillemets (soupirs, pauses, rires, chuchotements, variations d'intonation) sont interprétées par le modèle sans être prononcées. La sortie est en 48 kHz stéréo, qualité studio, et permet aussi bien un casting zero-shot par description (âge, accent, humeur) qu'un clonage de voix à partir d'une dizaine de secondes d'audio de référence. Chaque fichier intègre par défaut le watermark inaudible PerTh de Resemble, résistant à la compression et aux retouches, mais désactivable selon l'usage.

Sous le capot, DramaBox est un fine-tune IC-LoRA du modèle audio LTX-2.3 de Lightricks (3,3 milliards de paramètres), conditionné par Gemma 3 12B. L'inférence est annoncée à environ 2,5 secondes sur un H100, avec un pic à 24 Go de VRAM. Le modèle est accessible sur Hugging Face et GitHub, accompagné d'une interface Gradio, d'un serveur d'inférence et de la possibilité de fine-tuner ses propres LoRA pour ajouter des voix ou styles personnalisés.