Le Human Creativity Benchmark de Contra Labs distingue convergence et divergence dans l'évaluation des IA Gen
Le Human Creativity Benchmark de Contra Labs évalue les IA génératives selon leur convergence et divergence, de Claude Opus 4.6 à Gemini 3.1 Pro Preview.
Premier rapport publié par Contra Labs Research le 30 avril 2026, le Human Creativity Benchmark (HCB) propose un cadre d'évaluation des modèles d'IA générative fondé sur les critères réellement appliqués par les créatifs professionnels. L'étude s'appuie sur le réseau Contra, qui rassemble plus de 1,5 million d'indépendants ayant facturé plus de 250 millions de dollars via la plateforme.
Le protocole sépare deux signaux que les benchmarks classiques confondent. La convergence désigne les dimensions où les évaluateurs s'accordent (lisibilité typographique, placement d'un call to action, hiérarchie visuelle, cohérence d'un layout) et relève des bonnes pratiques enseignables. La divergence désigne celles où ils sont légitimement en désaccord (direction artistique, ambiance, risque conceptuel) et touche au goût, donc à la pilotabilité du modèle plutôt qu'à sa correction.
Cinq domaines ont été évalués (landing pages, applications desktop, ad images, assets de marque, vidéos produit) sur trois phases du workflow créatif (idéation, mockup, raffinement). Près de 15 000 jugements individuels ont été collectés via comparaisons par paires agrégées par un modèle Bradley-Terry pour produire des scores ELO, notations Likert sur l'adhérence au prompt, l'utilisabilité et l'attrait visuel, et retours qualitatifs.
Aucun modèle ne domine les trois phases dans aucun domaine. Claude Opus 4.6 mène l'idéation, Gemini 3.1 Pro Preview prend la main au stade mockup lorsque les contraintes de design system entrent en jeu, GPT 5.3 Codex et Grok Imagine Video remontent en raffinement. Veo 3.1, fort en idéation, décline sur chaque dimension à mesure que la tâche se précise.
Sur les ad images, les visuels notés 5 sur 5 en utilisabilité finissent dans le top 2 des comparaisons par paires dans 84 % des cas, contre 10 % pour ceux notés 1, faisant de l'utilisabilité le prédicteur le plus fiable du succès compétitif. La conclusion adressée aux développeurs de modèles : conformité aux bonnes pratiques et pilotabilité créative sont des axes orthogonaux qui appellent des choix d'optimisation distincts.