Les références d’image et de voix arrivent dans Grok Imagine Video 1.5

Grok Imagine Video 1.5 combine sept images de référence et une empreinte vocale pour stabiliser les personnages. Un atout pour la cohérence des plans.

La nouvelle version d’Imagine Video 1.5 ajoute la génération à partir d’une simple consigne textuelle et prend désormais en charge le 1080p natif en text-to-video comme en image-to-video. Ces deux fonctions sont accessibles sur le web ainsi que dans les applications iOS et Android.

Le modèle peut aussi recevoir jusqu’à sept images de référence dans une même génération. Chaque source peut servir à maintenir un personnage, un produit ou un décor, puis à modifier les autres éléments de la scène ou l’action demandée.

Une référence vocale peut être associée à l’image d’un personnage afin de conserver son apparence et sa voix entre plusieurs séquences. Cette fonction commence par les abonnements SuperGrok Heavy et SuperGrok Plus aux États-Unis, avant une ouverture progressive aux autres formules.

L’API `grok-imagine-video-1.5` prend déjà en charge le text-to-video, les références d’images et le rendu en 1080p. L’accès aux références vocales dans l’API reste soumis à une demande auprès de xAI.

Imagine Video 1.5 conserve également la génération audio intégrée à la vidéo, avec les mouvements, les dialogues et les ambiances produits dans le même processus.