Mercury 2.5 écrit par blocs à plus de mille tokens par seconde

Inception lance Mercury 2.5, un modèle de langage par diffusion annoncé à 1 107 tokens par seconde, avec 260 000 tokens de contexte et des appels d’outils en parallèle.

À 1 107 tokens par seconde, une réponse de mille tokens pourrait théoriquement être produite en moins d’une seconde. Ce calcul résume aussi le piège du chiffre : il mesure un débit de génération, pas nécessairement le temps total entre l’envoi d’une question et l’affichage de la réponse.

Mercury 2.5 est le nouveau modèle de production d’Inception. Il conserve la génération par diffusion de Mercury 2, mais progresse sur plusieurs évaluations de raisonnement, d’utilisation d’outils et de respect des instructions. La fenêtre de contexte passe de 128 000 à 260 000 tokens.

La plupart des grands modèles de langage génèrent leur réponse de gauche à droite. Ils choisissent un token, ajoutent ce résultat au contexte, puis calculent le suivant. Cette dépendance séquentielle limite le nombre de morceaux de texte pouvant être produits au même instant.

Un modèle de langage par diffusion suit une autre logique. Il commence par une zone de réponse encore masquée ou imparfaite, puis révise plusieurs positions au cours de passages successifs. Une partie des mots se précise pendant que d’autres restent provisoires. Le calcul couvre donc plusieurs tokens en même temps.

La méthode rappelle la génération d’images par diffusion, mais le matériau traité n’est pas continu. Le modèle travaille avec des unités de texte discrètes. Il doit déterminer leur contenu, leur place et leurs relations grammaticales sans perdre la cohérence de l’ensemble.

Inception utilise toujours une architecture Transformer. La différence se situe surtout dans la manière dont le texte est appris puis produit. Le premier rapport consacré à Mercury, publié en 2025, décrivait déjà des modèles entraînés pour prédire plusieurs tokens en parallèle. Il portait sur Mercury Coder Mini et Small, pas sur Mercury 2.5.

La société présente sa nouvelle version comme le modèle de langage par diffusion le plus performant disponible et comme le plus grand jamais entraîné dans cette catégorie. Elle ne communique pourtant ni son nombre de paramètres, ni la composition de ses données, ni la quantité de calcul mobilisée. La seconde affirmation ne peut donc pas être vérifiée depuis les informations publiées.

Mercury 2.5 reste un modèle fermé. Les poids ne sont pas téléchargeables et aucun dépôt ne donne accès à son entraînement. L’utilisation passe par l’API d’Inception ou par des intermédiaires comme Baseten et OpenRouter.

La vitesse constitue son principal argument. Le graphique d’Inception place Mercury 2.5 à 1 107 tokens par seconde, contre 321 pour Gemini 3.5 Flash-Lite, 127 pour Claude Haiku 4.5 et 99 pour GPT-5.6 Luna avec un faible niveau de raisonnement.

La page de lancement parle de cartes graphiques NVIDIA largement disponibles, sans préciser le modèle exact, le nombre d’accélérateurs, la longueur des réponses, le niveau de raisonnement ou la taille des lots. Or chacun de ces paramètres influence fortement le débit. Le chiffre de 1 107 tokens par seconde doit être lu comme une mesure obtenue dans la configuration d’Inception, pas comme une vitesse garantie pour toutes les requêtes.

Les premières mesures visibles chez OpenRouter donnent un autre ordre de grandeur. Au moment de la consultation, la plateforme indiquait un débit médian de 346 tokens par seconde et une latence médiane de 1,18 seconde. Ces données ont été recueillies au début de la disponibilité du modèle et peuvent encore évoluer, mais elles montrent la différence entre une pointe publiée par le fournisseur et un service partagé dans des conditions réelles.

Le débit ne doit pas non plus être confondu avec le time-to-first-token. Un service peut produire très rapidement la suite d’une réponse après avoir consacré du temps à son analyse initiale. Pour un agent vocal, ce premier délai compte souvent davantage que la vitesse atteinte une fois le texte lancé.

La documentation de Mercury propose deux affichages. Le streaming classique envoie des blocs de texte déjà stabilisés. Un mode `diffusing` montre les états intermédiaires en remplaçant progressivement la réponse entière jusqu’à sa version finale. Cette seconde option sert surtout à visualiser le processus de révision.

L’utilisateur peut régler l’effort de raisonnement sur quatre niveaux : `instant`, `low`, `medium` et `high`. `Medium` est appliqué par défaut. Le premier réglage vise les agents vocaux et les automatismes très sensibles au délai, tandis que `high` accorde davantage de calcul aux tâches complexes.

Ce réglage crée un compromis direct. Un raisonnement plus long peut améliorer une réponse difficile, mais augmente l’attente et le nombre de tokens facturés. La FAQ de l’API précise que les tokens de raisonnement sont inclus dans les tokens de sortie et payés au même tarif.

Inception annonce une hausse de 40 % de « l’intelligence » par rapport à Mercury 2. Ce pourcentage ne correspond pas à une mesure universelle. Il résume une sélection d’évaluations choisies par l’entreprise, dont les progrès varient fortement selon la tâche.

Le graphique publié attribue à Mercury 2.5 un score de 96 % sur Tau3Bench Telecom, contre 65 % pour Mercury 2. Le résultat passe de 41 % à 68 % sur AA-LCR, de 25 % à 37 % sur TerminalBench et de 15 % à 34 % sur DSQA avec dix appels d’outils.

Les écarts sont plus faibles ailleurs. GPQA Diamond progresse de 74 % à 79 %, IFBench de 69 % à 77 % et SciCode de 37 % à 38 %. L’évaluation Omniscience Accuracy recule même de 24 % à 22 %, alors qu’un indicateur distinct portant sur la non-hallucination passe de 18 % à 33 %.

La formule des 40 % masque donc des résultats contrastés. Mercury 2.5 s’améliore nettement sur certaines interactions agentiques, évolue peu en code scientifique et perd deux points sur une mesure d’exactitude. Le détail des consignes, des budgets de raisonnement et du nombre d’essais n’apparaît pas sur le graphique de lancement.

Inception compare aussi la qualité générale du modèle à GPT-5.6 Luna en mode Low, Gemini 3.5 Flash-Lite et Claude Haiku 4.5. Cette comparaison vise des modèles optimisés pour le coût et la