Physion Labs publie Galileo-0, un modèle critique de cohérence physique pour la vidéo générée
Physion Labs lance Galileo-0, un modèle d'IA qui détecte les incohérences physiques des vidéos de Sora 2 ou Kling, surpassant GPT-5.4 avec un F1 de 63,26 %.
Physion Labs dévoile Galileo-0, un système conçu pour détecter et diagnostiquer les incohérences physiques dans les vidéos générées par IA. Là où les outils d'évaluation existants produisent un score global, Galileo-0 identifie précisément ce qui a échoué, à quel moment, à quel endroit dans l'image, et pourquoi le comportement observé viole les règles physiques de la scène. Le modèle repose sur un pipeline en deux étapes : une phase de perception spatiotemporelle qui propose des candidats d'anomalies, suivie d'une phase de raisonnement qui détermine si chaque candidat constitue une véritable violation physique. Il couvre quatre catégories de glitches : discontinuité d'existence d'objet, dérive d'identité ou d'attribut, incohérence structurelle, et incohérence textuelle. Les vidéos d'évaluation sont issues des principaux modèles de génération actuels, dont Veo 3, Kling, Sora 2, WAN 2.6 et Seedance. Sur le benchmark interne, Galileo-0 atteint un F1 de 63,26 % toutes catégories confondues, contre 38,89 % pour GPT-5.4 et 36,48 % pour Gemini 3.1 Pro. L'écart est particulièrement marqué sur les incohérences textuelles, où il atteint 84,10 %. Physion Labs précise avoir développé le modèle, ses jeux de données et son pipeline d'évaluation en trois mois pour un budget inférieur à 200 000 dollars. Google… Pablo Nastar 10 months ago L'IA s'emballe: Midjourney V7, Llama 4 et Nova Sonic… Pablo Nastar 1 year ago