Griffin écoute, regarde et parle en même temps pendant un appel vidéo
Tavus réunit perception audiovisuelle, gestion continue de la conversation et génération vidéo dans Griffin, son premier Human Interaction Model. Griffin-Lite génère une scène complète en 720p et fonctionne en full-duplex, avec des décisions conversationnelles prises à intervalles inférieurs à la seconde.
Une conversation qui ne fonctionne plus par tours
Une pause, un regard ou une interruption peuvent modifier la réponse alors qu'elle est déjà en cours. Avec Griffin, Tavus cherche à sortir du fonctionnement séquentiel habituel des agents vidéo, où reconnaissance vocale, raisonnement et synthèse interviennent les uns après les autres.
Griffin-Lite est présenté comme le premier Human Interaction Model, ou HIM, de l'entreprise. Le système reçoit continuellement l'audio et la vidéo de son interlocuteur tout en produisant sa propre voix, ses expressions et ses mouvements.
Il peut ainsi acquiescer pendant qu'une personne parle, interrompre ou accepter d'être interrompu, attendre pendant un silence ou réagir à un élément montré devant la caméra. Dans les démonstrations publiées par Tavus, Griffin suit par exemple la manipulation d'un Rubik's Cube, réagit à l'apparition d'un objet pendant une histoire ou guide une personne utilisant un fer à souder. Des décisions prises en continu
L'architecture sépare deux grandes fonctions. Un moteur de Continuous Conversational Modeling analyse l'audio et la vidéo à intervalles inférieurs à la seconde, puis décide quoi dire, quand intervenir et comment se comporter.
Ces décisions alimentent ensuite un moteur Audio-Visual Generation chargé de produire la parole et la vidéo en streaming. Les contrôles transmis couvrent aussi le ton émotionnel, le regard, l'expression du visage et les gestes.
La perception reste active pendant que Griffin parle. Un changement observé au milieu d'une phrase peut donc modifier la suite de la réponse sans attendre un nouveau tour de conversation. Toute la scène est générée
Contrairement à un avatar animé autour du visage, Griffin génère l'intégralité de l'image à partir d'une seule référence. Le corps, les mains, les objets proches, les ombres et l'arrière-plan peuvent évoluer pendant l'échange.
Le générateur vidéo produit du 720p par segments de 320 ms. Une compression temporelle 8× ramène huit frames à un latent, tandis que la génération autoregressive utilise trois étapes de diffusion par latent. Tavus indique avoir combiné Distribution Matching Distillation, teacher forcing puis Self-Forcing afin de maintenir la stabilité pendant les conversations longues.
Côté audio, Griffin-Lite utilise Tavec, un autoencodeur convolutionnel travaillant en 48 kHz. La représentation conserve 40 valeurs par frame à raison de 100 frames par seconde, avec un décodeur causal destiné au streaming. NVIDIA place Griffin-Lite en tête de VideoFDB
Les résultats du benchmark VideoFDB de NVIDIA apportent une évaluation extérieure aux propres tests de Tavus.
Sur le volet perception, Griffin-Lite obtient un score global de 3,73 sur 5, contre 3,44 pour MiniCPM-o 4.5 dans sa configuration audio-only et 3,17 pour Gemini 2.5 Flash Native en audio-vidéo. La référence humaine atteint 4,20. NVIDIA mesure également un alignement du timing conversationnel de 73,8 % pour Griffin-Lite.
Tavus rapporte aussi un score de 3,83 sur le volet génération de VideoFDB, contre 3,92 pour la référence humaine et 2,80 pour Gemini 2.5 associé à Anam. 26 personnes sur 54 pensaient parler à un humain
Le chiffre de 48 % avancé par Tavus provient d'une expérience distincte réalisée par l'entreprise. 54 participants ont été recrutés via une plateforme de recherche indépendante et placés dans un appel vidéo d'une minute avec Griffin-Lite sans savoir que leur interlocuteur était généré par une IA.
À l'issue de l'expérience, 26 participants sur 54, soit 48 %, ont déclaré penser avoir parlé à une véritable personne. Avec le système précédent de Tavus, combinant Phoenix-4.5, Sparrow-2 et Raven-1, le même protocole avait obtenu 1 réponse positive sur 41 participants, soit 2,4 %.
Tavus qualifie ce résultat de premier passage d'un « video Turing test ». Il ne s'agit toutefois pas d'un protocole standardisé ou d'un benchmark indépendant comparable à VideoFDB, mais d'une étude conçue et publiée par l'entreprise elle-même. Une diffusion encore limitée
Les capacités de Griffin posent aussi directement la question de l'identification de son interlocuteur. Tavus reconnaît qu'un système suffisamment réaliste pour être confondu avec une personne peut également servir à tromper l'utilisateur.
Griffin-Lite reste pour cette raison limité à une sélection de testeurs dans le cadre d'une research preview. L'entreprise travaille sur des mécanismes de divulgation et indique vouloir traiter ces questions de sécurité avant d'ouvrir Griffin plus largement.