Violin, un pipeline open-source de traduction vidéo de bout en bout
Violin est un pipeline open-source de traduction vidéo développé avec Together AI, Whisper V3 large, Deepseek V4 Pro et Cartesia Sonic 3 sous licence MIT.
Violin est un outil de traduction vidéo entièrement open-source, développé par Shang Zhu, Kevin Qinghong Lin (Oxford) et James Zou, propulsé par l'API de Together AI. Le constat à l'origine du projet : selon une étude reprise par les auteurs, 66 % des vidéos issues des 250 chaînes YouTube les plus suivies sont en anglais, contre 15 % en espagnol, ce qui maintient hors d'atteinte une large partie des audiences mondiales pour les contenus à forte valeur informative.
Le pipeline s'articule en trois étapes. La reconnaissance vocale repose sur Whisper V3 large hébergé par Together, qui produit une transcription multilingue horodatée. La traduction est ensuite confiée à Deepseek V4 Pro par défaut, avec la possibilité d'injecter une liste de règles personnalisées pour préserver fidélité et précision. La synthèse vocale s'appuie sur Cartesia Sonic 3, qui couvre une large palette de voix natives, du coréen au chinois en passant par le néerlandais et l'italien, et accepte une description en langage naturel pour ajuster le timbre. Le clonage vocal est exclu : la voix générée reste distincte de l'orateur d'origine et se superpose à faible volume sur la piste originale.
Un module de discussion vidéo complète l'ensemble, propulsé par le modèle vision-langage Qwen3.5-397B-A17B, qui répond à des questions ancrées dans l'audio et les images de la vidéo. Violin se décline en trois formats : application web sans code, interface en ligne de commande pour le traitement par lots, et compétence agent intégrable dans les principaux frameworks. L'ensemble du code est publié sous licence MIT sur GitHub, et la démo en ligne supprime les vidéos chargées après vingt-quatre heures.