Gemini 3.8 Live voit, parle et agit dans une même session

Google lance Gemini 3.8 Live et Live Extended Thinking, deux modèles vocaux capables d’analyser une caméra, de changer de langue et d’utiliser des outils sans suspendre la conversation.

Une personne pointe son téléphone vers un tuyau qui fuit. Gemini observe la zone filmée, propose une première vérification puis adapte ses instructions aux réponses et aux gestes de l’utilisateur. La conversation peut continuer pendant que le modèle consulte un service externe ou prépare l’étape suivante.

Google veut faire de cette continuité la principale différence de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, présentés le 15 septembre 2026. Le premier privilégie la rapidité, le volume et le coût. Le second consacre davantage de calcul aux opérations complexes, tout en maintenant un échange vocal pendant leur exécution.

Ces deux modèles ne sont pas de simples systèmes de transcription suivis d’une lecture à voix haute. Ils reçoivent des flux audio, du texte, des images ou de la vidéo et produisent directement de l’audio. Ils reposent sur Gemini 3 Pro, avec une fenêtre de contexte pouvant atteindre 128 000 tokens et une sortie maximale annoncée à 64 000 tokens.

Gemini 3.8 Live constitue l’option recommandée par Google pour la majorité des agents vocaux nécessitant une faible latence. Il peut être interrompu au milieu d’une phrase, détecter la reprise de parole de l’utilisateur et abandonner la réponse qu’il était en train de produire. Cette fonction évite d’attendre la fin d’un monologue pour corriger une mauvaise interprétation ou préciser une demande.

Le modèle peut également changer de langue au cours d’une même conversation. La documentation de la Live API en répertorie 97 et indique que la sélection est automatique. Un utilisateur peut donc commencer une phrase en français, poursuivre en anglais puis demander une réponse dans une troisième langue sans ouvrir une nouvelle session.

Cette prise en charge ne garantit pas une qualité identique dans les 97 langues. Google ne publie pas, au lancement, de résultats détaillés comparant la compréhension, les accents, les interruptions ou la fidélité des réponses pour chacune d’elles. La liste décrit une compatibilité technique, pas un niveau de performance uniforme.

La vidéo sert à compléter la conversation avec ce qui se trouve devant la caméra. Google montre notamment Search Live guidant une réparation de chaîne de vélo ou la recherche de l’origine d’une fuite. D’autres démonstrations font jouer Gemini aux échecs à partir d’un plateau filmé ou lui demandent d’accompagner un salarié dans une interface qu’il découvre.

Le terme « vidéo en temps réel » demande toutefois une précision. Dans l’API destinée aux développeurs, le flux visuel est transmis sous la forme d’images successives, avec un maximum documenté d’une image par seconde. Le modèle peut donc suivre une situation qui évolue, mais ne reçoit pas chaque image captée par la caméra comme le ferait un système vidéo conventionnel.

Cette fréquence peut suffire pour lire un écran, identifier une pièce mécanique ou constater qu’un objet a changé de position. Elle est moins adaptée aux gestes très rapides, aux mouvements brefs ou aux situations dans lesquelles l’ordre exact de plusieurs actions compte. Une instruction vocale assurée ne constitue pas davantage une preuve que le modèle a correctement interprété ce qu’il voit.

Gemini 3.8 Live peut appeler des fonctions sans bloquer la conversation. Une application peut lui donner accès à un calendrier, une base documentaire, un système de réservation ou un outil métier. Le modèle accuse réception de la demande, poursuit l’échange, puis utilise le résultat lorsque le service externe répond.

Cette exécution asynchrone modifie la conception d’un agent vocal. Jusqu’à présent, un appel d’outil produisait souvent un silence ou un message d’attente. Avec le mode non bloquant, plusieurs opérations peuvent se dérouler pendant que le modèle pose une question complémentaire ou explique l’étape en cours.

La continuité dépend néanmoins de toute l’infrastructure. Le délai du modèle ne suffit pas à déterminer l’expérience finale. La connexion de l’utilisateur, le transport du flux, la détection de parole, le service appelé et le logiciel chargé de restituer le son peuvent chacun ajouter une attente ou provoquer une erreur.

Gemini 3.8 Live Extended Thinking reprend ces fonctions, mais s’adresse aux tâches nécessitant davantage de raisonnement en arrière-plan. Son niveau d’effort peut être configuré sur `low`, `medium` ou `high`. Le réglage minimal n’est pas disponible, alors que Gemini 3.8 Live ne permet pas de sélectionner manuellement un niveau.

Google présente cette version comme capable de raisonner et de parler en parallèle. Elle peut commencer par une formule courte telle que « Je vérifie cela », puis indiquer l’avancement pendant qu’elle décompose le problème, appelle des fonctions et assemble le résultat final.

Ces indications ne doivent pas être confondues avec un accès complet au raisonnement interne du modèle. L’API peut fournir des résumés de réflexion et le modèle peut verbaliser sa progression, mais il s’agit de contenus générés pour l’utilisateur. Ils ne constituent pas une transcription exhaustive et vérifiable de tous les calculs ayant mené à la réponse.

Les exemples choisis par Google portent sur la transformation d’un croquis en interface React, l’organisation d’une réservation en plusieurs étapes et la création d’un plan d’entreprise accompagné de supports marketing. Dans le premier cas, l’utilisateur commente oralement le résultat pendant que le modèle modifie le composant. Dans le deuxième, la conversation se poursuit pendant que plusieurs disponibilités sont vérifiées.

Cette possibilité répond à une limite habituelle des interfaces vocales. Une tâche complexe oblige souvent l’utilisateur à interrompre la conversation, à regarder un indicateur de chargement puis à relancer l’échange lorsque le traitement est terminé. Extended Thinking tente de maintenir une seule session dans laquelle les demandes, les précisions et les résultats intermédiaires peuvent s’enchaîner.

La documentation impose cependant une gestion particulière de cet état. Avec