Gemini 3.8 Flash pousse les agents à travailler plus longtemps
Google lance Gemini 3.8 Flash pour la programmation, les agents autonomes et les tâches complexes. Une version Cyber plus permissive est réservée aux organisations approuvées.
Un modèle Flash capable de poursuivre une tâche, de vérifier son travail et de multiplier les appels d’outils au lieu de s’arrêter à la première réponse plausible. C’est la proposition de Gemini 3.8 Flash, lancé par Google trois semaines seulement après Gemini 3.7 Flash.
Cette nouvelle version ne cherche pas uniquement à fournir une réponse plus rapidement. Sur les demandes complexes, elle peut décomposer davantage son raisonnement, essayer plusieurs opérations et contrôler leurs résultats avant de conclure. Google résume ce changement en indiquant que le modèle « travaille davantage ».
Ce comportement vise principalement la programmation sur de longues séquences, les agents autonomes et les processus professionnels composés de plusieurs étapes. Gemini 3.8 Flash peut, par exemple, examiner plusieurs fichiers, modifier un projet, lancer des outils, repérer une erreur puis reprendre son travail sans attendre une nouvelle instruction.
La contrepartie apparaît dans la consommation. Deux requêtes facturées au même tarif unitaire ne coûtent pas forcément la même chose si la seconde produit davantage de tokens, effectue plusieurs appels et maintient une boucle plus longue. Le prix affiché ne suffit donc pas à évaluer le coût réel d’une tâche menée jusqu’à son terme.
Google permet de choisir entre trois niveaux de raisonnement : low, medium et high. Le niveau intermédiaire est activé par défaut. Low réduit la latence et la consommation pour les tâches courantes, tandis que high accorde davantage de ressources au raisonnement, aux vérifications et à l’utilisation d’outils. Le niveau minimal proposé sur certains autres modèles Gemini n’est pas accepté par 3.8 Flash.
Les équipes privilégiant la rapidité ou des dépenses prévisibles peuvent continuer à utiliser Gemini 3.7 Flash, qui reste disponible. Cette coexistence montre que la version 3.8 ne remplace pas systématiquement sa devancière : son intérêt dépend de la valeur produite par les étapes supplémentaires.
Les premières mesures publiées par Artificial Analysis illustrent ce compromis. Selon les observations relayées par The Verge, Gemini 3.8 Flash aurait utilisé environ 30 % de tokens de sortie supplémentaires par tâche et coûté près de 40 % de plus que 3.7 Flash dans leurs évaluations, malgré un tarif unitaire identique. Ces données restent préliminaires et varient selon le type de requête comme selon le niveau de raisonnement.
Le tarif standard de lancement est fixé à 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie, tokens de raisonnement compris. Cette grille reste valable jusqu’au 31 décembre 2026. Dès le 1er janvier 2027, les prix passeront à 1,50 dollar en entrée et 7,50 dollars en sortie.
Les traitements différés en modes Batch et Flex coûtent deux fois moins cher : 0,375 dollar par million de tokens en entrée et 1,875 dollar en sortie pendant la période de lancement. Le mode Priority, destiné aux demandes nécessitant une capacité plus prévisible, revient à 1,35 dollar en entrée et 6,75 dollars en sortie.
La mise en cache du contexte est facturée 0,075 dollar par million de tokens, auxquels s’ajoutent 0,50 dollar par million et par heure de stockage. Ces montants doubleront également en janvier 2027. La recherche Google et la recherche dans Maps disposent chacune d’un quota mensuel, puis peuvent ajouter des frais pour les requêtes supplémentaires.
Une formule gratuite est disponible dans la Gemini API. La grille officielle précise cependant que les contenus transmis dans ce cadre peuvent servir à améliorer les produits de Google. Ils ne sont pas utilisés à cette fin dans le niveau payant.
Gemini 3.8 Flash accepte le texte, les images, les vidéos, les documents PDF et les fichiers audio. Ses réponses restent textuelles : il ne produit directement ni image ni son. Sa fenêtre d’entrée atteint 1 048 576 tokens et la sortie peut aller jusqu’à 65 536 tokens.
Le modèle prend en charge les appels de fonctions, les réponses structurées, l’exécution de code, la recherche dans des fichiers, la mise en cache, l’analyse d’adresses web ainsi que l’ancrage dans Google Search et Maps. Le contrôle d’un ordinateur est proposé en aperçu. La Live API, la génération d’images et la génération audio ne sont pas prises en charge.
L’accès est ouvert aux développeurs dans Google AI Studio et la Gemini API, sous l’identifiant `gemini-3.8-flash`. Le modèle est également proposé dans Gemini Enterprise et devient le moteur par défaut de l’agent Antigravity. Pour le grand public, il rejoint l’application Gemini, AI Mode dans Google Search et Gemini dans Google Sheets, avec un accès annoncé pour les abonnements Google AI Pro et Ultra.
Les démonstrations montrent la création d’un jeu en trois dimensions à partir d’une instruction récurrente, une version de Google Maps inspirée de l’interface DOS ou encore un outil interactif permettant de démonter virtuellement des appareils. Ces exemples témoignent surtout de la capacité à maintenir une construction technique pendant plusieurs étapes. Ils ne constituent pas une mesure indépendante de la fiabilité du code produit.
Google accompagne le lancement d’une série de résultats. Sur DeepSWE v1.1, consacré à la résolution autonome de problèmes logiciels de longue durée, Gemini 3.8 Flash obtient 73,7 %. Il se place juste derrière Claude Opus 5 à 74 %, mais devant GPT-5.6 Sol à 72,7 %, GPT-5.6 Terra à 69,6 % et Gemini 3.7 Flash à 65,3 %.
Le faible écart avec Opus 5 empêche de parler d’une domination nette. Il montre plutôt qu’un modèle présenté comme rapide et moins cher peut approcher un système facturé beaucoup plus cher sur ce protocole précis. Le prix de sortie affiché pour Opus 5 atteint 25 dollars par million de tokens dans le tableau de Google, contre 3,75 dollars pour Gemini 3.8 Flash pendant sa période de lancement.
Sur Terminal-Bench 2.1, 3.8 Flash atteint 89,4 %, légèrement devant Opus 5 à 89,1 % et GPT-5.6 Sol à 88,8 %. La situation change complètement avec Terminal-Bench 4.0, une version plus récente et plus