Le benchmark vidéo d’Artificial Analysis passe au 1080p et sépare les modèles par usage

Artificial Analysis revoit son benchmark text-to-video avec AA-Video-T2V v2.0 et sa déclinaison sans audio. Les modèles sont évalués en 1080p par préférences humaines, puis comparés selon dix usages, dix capacités et huit styles visuels.

Un classement général ne suffit plus

Un modèle efficace pour générer une scène de film n’est pas nécessairement celui qui maîtrise le mieux une interface animée, du texte à l’écran ou une séquence en anime.

La nouvelle méthodologie d’Artificial Analysis cherche précisément à rendre ces écarts visibles. AA-Video-T2V v2.0 évalue les modèles text-to-video capables de produire simultanément image et audio, tandis que AA-Video-T2V-Silent v2.0 mesure séparément la génération sans audio. Les deux disposent de leurs propres scores Elo et leurs résultats ne sont pas mélangés.

Chaque vidéo est comparée à une autre génération issue du même prompt. Les évaluateurs ignorent l’identité des modèles et choisissent la sortie qu’ils préfèrent. Pour cette version, les votes proviennent du panel recruté par Artificial Analysis et les anciens votes du benchmark text-to-video ont été retirés du calcul. 1 000 prompts répartis entre dix usages et dix capacités

AA-Video-T2V v2.0 utilise 1 000 prompts, contre 500 pour sa version Silent. Le corpus est régulièrement renouvelé afin de retirer les requêtes qui ne différencient plus suffisamment les modèles.

Chaque prompt appartient simultanément à un usage et à une capacité. Les dix usages couvrent entre autres le film live-action, la publicité, l’e-commerce, l’animation et le jeu vidéo, l’architecture, les réseaux sociaux ou le motion design.

Les capacités examinées vont de l’anatomie humaine au contrôle caméra, en passant par la physique, le rendu du texte, la cohérence spatio-temporelle, la synchronisation audio et le lip sync. Huit styles visuels complètent cette grille, dont le photoréalisme, la 3D, l’anime, l’illustration et le stop-motion.

Le classement général échantillonne équitablement les couples usage-capacité. Il mesure donc davantage la polyvalence d’un modèle qu’une spécialisation unique. Toutes les vidéos passent par le même cadre d’évaluation

La définition cible est fixée à 1080p, à 24 images par seconde, pendant dix secondes et au format 16:9. Lorsqu’un modèle ne supporte pas exactement ces paramètres, Artificial Analysis utilise la valeur disponible la plus proche.

Les vidéos ne sont pas artificiellement agrandies pour l’évaluation. Un modèle limité à une définition inférieure reste présenté à sa définition maximale, tandis qu’une sortie supérieure au 1080p est réduite. Pour le benchmark avec audio, le volume est normalisé vers -18 LUFS sans compression ni remastering.

Artificial Analysis indique avoir démarré AA-Video-T2V v2.0 avec plus de 68 000 votes de préférence humaine répartis sur ses 1 000 prompts. La déclinaison Silent en comptait plus de 47 000 sur 500 prompts. Wan 3.0 devant, mais avec des spécialisations très différentes

Le leaderboard actuel place Wan 3.0 en tête avec 1157 Elo, devant Utopai X, basé sur MiniMax H3, à 1150. Dreamina Seedance 2.5 suit à 1144, MiniMax H3 à 1139 et MiniMax H3 Max à 1134. Les intervalles de confiance se chevauchent toutefois entre plusieurs de ces modèles, ce qui limite la portée d’un ordre strict entre certaines positions.

L’analyse publiée au lancement du benchmark montrait surtout des spécialisations marquées. Wan 3.0 dominait dix des vingt catégories consacrées aux usages et capacités. Seedance 2.5 se distinguait sur l’anatomie humaine et le dialogue avec lip sync, tandis que Gemini Omni Flash 1.1 arrivait en tête sur la synchronisation audio et le UI/UX & Motion Design.

Le rendu du texte produisait l’un des écarts les plus importants entre modèles, alors que le contrôle précis de caméra les regroupait davantage. Wan 3.0 conservait néanmoins une avance de 45 Elo sur cette dernière capacité dans l’analyse initiale d’Artificial Analysis. De 4,80 à 34,12 dollars la minute parmi les modèles de tête

Le prix change fortement à niveau de préférence humaine proche. MiniMax H3, premier modèle open weights du benchmark, affiche actuellement 1139 Elo pour 4,80 dollars la minute de vidéo 1080p. Dreamina Seedance 2.5 atteint 1144 Elo pour 34,12 dollars la minute.

Artificial Analysis calcule ce tarif à partir du prix publié par le fournisseur pour générer une minute de vidéo avec les paramètres par défaut retenus par le benchmark.

Wan 3.0 coûte 12 dollars la minute et occupe actuellement la première place. À l’autre extrémité du top 10, Agnes-Video-2.5 est facturé 2,40 dollars la minute. Le nouveau benchmark permet ainsi de lire séparément préférence humaine, spécialisation et coût, plutôt que de réduire la comparaison des modèles vidéo à un unique classement Elo.