Tesseract donne aux agents IA un moteur de montage plutôt qu’une interface à cliquer
Mirage ouvre Tesseract, un environnement vidéo conçu pour être manipulé directement par des agents comme ChatGPT. Montage, keyframes, compositions, motion design et audio restent structurés dans un projet éditable, avec prévisualisation et rendu effectués localement sur Mac ou Windows.
Le logiciel disparaît derrière l’agent
Demander à un agent de modifier précisément une vidéo implique généralement de lui faire manipuler une interface pensée pour un humain, ou de reconstruire le résultat avec du code. Tesseract prend une autre direction : l’agent accède directement au moteur créatif et intervient sur la structure du projet sans avoir à naviguer dans Premiere ou After Effects.
Le montage conserve pourtant les concepts habituels de la production vidéo. Keyframes, compositions, adjustment layers, timing, effets, typographie et son restent des éléments natifs et modifiables. Plusieurs clips peuvent par exemple conserver indépendamment leur cadrage, leurs effets et leur temporalité au sein d’une même composition.
La différence tient donc surtout à l’interface de contrôle. Une instruction en langage naturel peut demander de raccourcir un plan, déplacer un titre, modifier un keyframe ou rééquilibrer l’audio sans reconstruire les autres éléments du projet. ChatGPT comme interface de montage
Avec le plugin Tesseract pour ChatGPT, l’utilisateur fournit ses vidéos, images, enregistrements d’écran et fichiers audio avec un brief. L’agent construit ensuite le projet, génère une prévisualisation, reçoit les corrections puis effectue le rendu final.
Cette logique autorise des corrections localisées. Un titre peut être modifié sans toucher au montage, un paramètre d’effet peut évoluer indépendamment du reste de la scène et plusieurs pistes audio peuvent rester séparées. Tesseract conserve donc un état éditable entre deux instructions, plutôt que de produire uniquement une vidéo aplatie à chaque demande.
Mirage distingue également cette architecture des outils vidéo construits autour de HTML ou React. L’agent manipule directement des concepts de montage et de motion design au lieu de représenter la vidéo comme une page ou une application web. Un moteur local derrière Captions
Le moteur tourne localement sur les Mac Apple Silicon et Intel ainsi que sur Windows 10 64 bits ou une version ultérieure. Linux, WSL et l’exécution cloud ne sont pas pris en charge. Une simple conversation ChatGPT dans le navigateur ne suffit donc pas : l’agent doit disposer d’un environnement local capable d’accéder aux fichiers et d’exécuter Tesseract.
Le moteur local est gratuit et ne nécessite pas de compte Mirage, mais l’abonnement ou la consommation du modèle utilisé par l’agent reste séparé. Tesseract peut également être installé sous forme de skills dans d’autres environnements locaux compatibles.
Ce moteur n’arrive pas entièrement de zéro. Mirage indique qu’il constitue également la base technique de Captions, son application de création vidéo. Tesseract expose désormais cette infrastructure directement aux agents et aux développeurs. Pas de génération de footage
Tesseract ne génère ni footage ni avatar. Il travaille à partir de vidéos, images et fichiers audio existants, qu’ils aient été enregistrés ou produits auparavant avec d’autres modèles. Son périmètre couvre le montage, le compositing, le motion design et le traitement sonore.
Le moteur peut aussi servir de base à une interface personnalisée. Un agent peut construire des contrôles manuels pour le timing, la typographie, la couleur ou le cadrage, puis reprendre le travail sur le même projet après une modification effectuée par l’utilisateur.
Le changement proposé par Tesseract tient finalement moins à l’automatisation d’un clic dans un logiciel existant qu’à la suppression de cette étape : l’agent et l’utilisateur travaillent sur le même projet vidéo structuré, mais l’un passe par des instructions et l’autre peut conserver des contrôles manuels.