Odyssey publie Starchild-1, world model audio-vidéo en temps réel

Odyssey publie Starchild-1, un world model autorégressif générant en temps réel et en continu de l'audio et de la vidéo synchronisés via l'interaction.

Odyssey publie Starchild-1, un world model autoregressif qui génère simultanément du son et de l'image en temps réel. Là où les world models classiques se limitent à la synthèse visuelle, et où des systèmes audio-vidéo comme Veo de DeepMind produisent des clips de durée fixe en mode hors-ligne, Starchild-1 prédit en continu l'état audio et vidéo suivant, à partir des observations passées et des entrées de l'utilisateur.

Concrètement, le système accepte du texte, de la voix ou des actions injectés au fil de la génération, ce qui modifie simultanément les images affichées et les sons restitués. Environnements, conversations, ambiances sonores et dynamique d'une scène évoluent au gré de l'interaction plutôt que de suivre une trajectoire figée.

Le rapport technique détaille plusieurs briques nouvelles. Une procédure de distillation causale convertit un modèle audio-vidéo bidirectionnel en système autoregressif compatible temps réel, tout en préservant la synchronisation des deux modalités. Une architecture de cache KV asynchrone et une stratégie d'adaptation du rollout absorbent les écarts de fréquence et de densité d'information entre son et image, points sensibles pour stabiliser une génération longue.

Le laboratoire inscrit ces travaux dans la perspective d'une intelligence générale du monde et évoque des applications en robotique, éducation, jeu, santé ou défense. Starchild-1 est mis à disposition sous forme de préversion, accompagnée d'un rapport technique.