Du code à la cybersécurité, Gemini 4 Argon s’attaque aux tâches longues

Gemini 4 Argon cible les tâches longues en développement, finance, droit et cybersécurité avec une limite portée à un million de tokens en sortie. Google réserve d’abord son nouveau modèle frontier à des testeurs sélectionnés avant une ouverture plus large.

Un million de tokens pour une seule trajectoire

Un modèle capable de produire plusieurs centaines de milliers de tokens au cours d’une même tâche. C’est l’une des particularités de Gemini 4 Argon, le nouveau modèle frontier de Google DeepMind, dont la limite de sortie passe de 64 000 à un million de tokens.

Cette capacité vise les problèmes qui nécessitent de conserver un raisonnement et une suite d’actions sur une durée importante. Google positionne Argon sur le développement logiciel, le travail professionnel en finance et en droit, mais aussi la cybersécurité défensive.

L’accès reste pour l’instant contrôlé. Une première cohorte de cyberdéfenseurs et de testeurs utilise le modèle dans le cadre du Fairwind Program, avant une ouverture prévue aux développeurs, entreprises et particuliers. Des migrations de code déjà menées chez Google

Argon intervient déjà dans certains workflows internes du groupe. Des agents participent notamment à la migration de code C/C++ vers Rust, depuis des bibliothèques comptant plusieurs dizaines de milliers de lignes jusqu’aux plus de 800 000 lignes du kernel Zircon de Fuchsia.

Sur libgav1, le décodeur vidéo open source de Google, des agents Argon ont repris un portage Rust existant et remplacé 32 000 lignes de code SIMD. Après plusieurs cycles d’expérimentation guidés par le profiling, Google rapporte un décodeur memory-safe 2,7x plus rapide que le précédent portage Rust, avec une sortie vidéo identique.

Une autre expérimentation interne a utilisé plusieurs agents pour analyser la télémétrie des data centers et identifier des optimisations mémoire. Google indique que les changements déjà appliqués ont libéré plus de 300 TiB, avec une estimation comprise entre 500 TiB et 1 PiB si l’ensemble des optimisations identifiées est adopté. 77,9 % sur DeepSWE v1.1

Les résultats publiés par Google placent Argon à 77,9 % sur DeepSWE v1.1, consacré aux tâches longues de software engineering. Le modèle atteint également 51,3 % sur AutomationBench pour l’exécution de workflows professionnels et 91,7 % sur LVBench pour la compréhension de vidéos longues.

Google le positionne également en tête du Vals Index, qui agrège des évaluations en finance, développement, droit et fiscalité selon leur poids dans le PIB américain. Des résultats sont aussi communiqués sur Vals Finance Agent v2 et le Legal Agent Benchmark de Harvey.

Ces mesures proviennent de l’évaluation publiée avec le modèle. Elles reposent sur des protocoles différents et ne constituent pas une mesure unique de ses performances dans des usages réels. La cybersécurité derrière l’accès anticipé

La sortie progressive tient en partie aux capacités cyber d’Argon. Le modèle est entraîné pour identifier, valider et corriger des vulnérabilités, avec un accès spécifique sans certaines protections cyber pour des défenseurs approuvés et les équipes internes de Google.

Sur CWE-bench v1, Google rapporte un score de 68 %, à égalité avec le meilleur résultat de son comparatif. Wiz teste également Argon dans son programme Scan for Good consacré à la protection d'infrastructures critiques.

Google indique qu’une première expérimentation avec Wiz a identifié une vulnérabilité critique dans un logiciel de santé utilisé par des hôpitaux, après que d’autres modèles frontier ne l’avaient pas détectée. L’entreprise ne fournit pas dans son billet suffisamment de détails techniques pour évaluer indépendamment ce cas.

Le Fairwind Program encadre cet accès en priorité pour les gouvernements, infrastructures critiques, plateformes technologiques et équipes de cybersécurité sélectionnées. Une sortie progressive avant l’API

Google travaille encore sur les protections contre les usages cyber et CBRN malveillants, les prompt injections indirectes et certains comportements d’agents qui s’écarteraient de l’intention de l’utilisateur.

Argon utilise notamment des mécanismes capables de surveiller son raisonnement et ses actions pour interrompre une exécution lorsque certaines conditions sont détectées. Les environnements utilisés pour les entraînements et évaluations à risque élevé sont également isolés et renforcés.

Lors de son ouverture commerciale, Gemini 4 Argon doit être proposé à un tarif introductif de 2 dollars par million de tokens en entrée et 10 dollars par million en sortie, avec une réduction de 95 % sur les tokens d’entrée mis en cache.

Les clients API payants et les abonnés Google AI Ultra doivent faire partie des premiers utilisateurs servis lors de l’élargissement de l’accès. Google ne communique pas encore de date précise pour cette étape.