Mercury Voice fait passer le raisonnement sous les 320 ms pour les agents vocaux
Inception ouvre Mercury Voice aux entreprises, un diffusion LLM conçu pour les agents vocaux. Le modèle affiche 320 ms de latence médiane avant le premier token de réponse sur les tests de l’entreprise, avec trois niveaux de raisonnement, un contexte de 128K tokens et une API compatible OpenAI.
320 ms avant le début de la réponse
Une conversation vocale tolère mal le silence. Inception estime qu’un agent dispose d’environ 500 ms après la fin d’une intervention pour commencer à répondre sans créer de pause perceptible.
Mercury Voice cible directement cette fenêtre. Sur un ensemble de prompts issus d’applications vocales en production, Inception mesure 320 ms de médiane avant le premier token de réponse, après la phase de raisonnement. Le p95 atteint 750 ms.
La métrique utilisée, Time to First Answer Token ou TTFAT, ne mesure donc pas simplement le démarrage de la génération. Elle attend le premier token effectivement destiné à être prononcé après le raisonnement du modèle.
Inception affirme obtenir une latence médiane 5,9 fois inférieure à GPT-6 Luna sans raisonnement sur ce protocole. Les résultats restent ceux publiés par l’entreprise. Un diffusion LLM conçu pour dialoguer
Mercury Voice appartient à la famille de diffusion LLMs développée par Inception. Contrairement à une génération autorégressive strictement séquentielle, l’architecture Mercury travaille sur plusieurs tokens en parallèle afin de réduire le temps d’inférence.
Le modèle conserve des fonctions attendues dans un agent : raisonnement, appels d’outils et suivi de longs prompts système. Trois niveaux d’effort sont proposés, Low, Medium et High.
Le contexte atteint 128K tokens, avec jusqu’à 50K tokens en sortie.
Deux semaines plus tôt, Mercury 2.5 avait donné un premier aperçu de cette déclinaison vocale. Inception indiquait alors travailler spécifiquement sur les charges où quelques centaines de millisecondes modifient directement l’expérience d’une conversation. La qualité mesurée avec des tâches d’agents
La comparaison ne porte pas uniquement sur la vitesse. Inception agrège plusieurs évaluations de conversation et de travail agentique, dont τ³-bench Telecom, Retail et Airline, IFBench et BFCL v4.
Selon ses résultats, Mercury Voice dépasse le composite obtenu par Gemma 4 31B, GPT-6 Luna, GLM-5.3-Flash et Qwen3.5-397B.
Sur la moyenne des trois déclinaisons de τ³-bench, l’entreprise indique également obtenir une qualité supérieure à presque tous les modèles qu’elle a testés, avec une latence deux fois inférieure au modèle suivant le plus rapide.
Ces comparaisons ont été produites par Inception et ne constituent pas une évaluation indépendante. Des premiers déploiements dans les appels et les drive-through
Audivi AI utilise Mercury Voice pour automatiser la prise de commande dans des drive-through, y compris les modifications de commandes et les échanges commerciaux pendant la conversation.
Altur l’emploie pour des agents téléphoniques destinés aux établissements financiers. Les appels peuvent inclure la négociation de plans de paiement et la gestion d’objections.
OpenCall rapporte une latence médiane proche de 170 ms sur sa propre charge de production. Ce chiffre correspond à son environnement et ne doit pas être confondu avec les 320 ms mesurées sur le jeu de prompts utilisé par Inception pour comparer les modèles. Moins d’un centime par minute selon Inception
Le tarif standard est fixé à 0,40 dollar par million de tokens en entrée et 1,50 dollar en sortie.
Une remise de lancement de 50 % ramène temporairement ces montants à 0,20 dollar et 0,75 dollar. Pour un profil d’agent vocal considéré comme typique par Inception, le coût estimé atteint environ 0,009 dollar par minute de conversation.
L’entreprise compare ce chiffre aux 0,045 dollar par minute qu’elle calcule pour GPT-4.1 sur le même profil.
Mercury Voice est accessible aux entreprises via l’API Inception, avec un endpoint compatible avec l’API OpenAI. Le modèle peut ainsi prendre la place du LLM dans des infrastructures utilisant LiveKit, Pipecat, Vapi ou Retell. L’accès passe actuellement par le service commercial d’Inception.