Microsoft réduit l’attente des agents vocaux avec trois nouveaux modèles MAI

Microsoft AI complète sa gamme audio avec MAI-Transcribe-2-Streaming, MAI-Voice-2.1 et MAI-Voice-2.1-Flash. Transcription dès les premières centaines de millisecondes, synthèse vocale multilingue et génération de 45 secondes d’audio en 150 ms ciblent directement les agents vocaux temps réel.

Commencer à traiter la phrase avant qu’elle soit terminée

Attendre la fin d’une intervention n’est plus nécessaire pour obtenir les premiers éléments de transcription. MAI-Transcribe-2-Streaming produit ses premières hypothèses un peu plus de 100 ms après la réception de l’audio, puis les révise progressivement à mesure que le contexte arrive.

Cette transcription partielle peut être exploitée avant que le texte définitif soit stabilisé. Un agent vocal peut ainsi commencer son raisonnement ou appeler un outil pendant que son interlocuteur parle encore.

Le modèle couvre 60 langues avec détection automatique et continue de la langue. Sur Artificial Analysis, il occupe actuellement la première position en précision pour les transcriptions finales et partielles. Microsoft indique également que ses évaluations internes affichent les mots deux fois plus rapidement que son concurrent le plus proche dans des usages comme la dictée ou le sous-titrage. Cette dernière comparaison provient des tests de Microsoft. Une même voix dans 23 langues

La seconde partie de la gamme concerne la génération. MAI-Voice-2.1 prend en charge 23 langues réparties sur 26 locales.

Une même identité vocale peut passer d’une langue à l’autre sans changer de speaker. Microsoft indique que le modèle adapte également son accent à la langue parlée, plutôt que de conserver l’accent associé à la langue initiale.

Les deux nouveaux modèles vocaux prennent en charge le clonage à partir de quelques secondes d’audio de référence dans toutes les langues supportées. Microsoft mentionne également des mécanismes de consentement destinés à limiter les usages non autorisés. 45 secondes d’audio générées avec 150 ms de latence

MAI-Voice-2.1-Flash reprend les capacités linguistiques de MAI-Voice-2.1 avec une architecture destinée aux volumes importants et aux applications sensibles à la latence.

Microsoft indique que Flash peut générer 45 secondes d’audio avec une latence de bout en bout de 150 ms. L’inférence serait 55 % plus rapide et le coût environ 60 % inférieur à celui de modèles comparables, selon les mesures de l’entreprise.

L’association avec MAI-Transcribe-2-Streaming cible directement la boucle d’un agent vocal : écouter, commencer à interpréter la demande, utiliser éventuellement des outils, puis générer la réponse sans accumuler trop d’attente entre chaque étape. De 0,54 dollar par heure à 15 dollars par million de caractères

MAI-Transcribe-2-Streaming est proposé au tarif de lancement de 0,54 dollar par heure d’audio jusqu’à la fin de l’année.

Pour la synthèse vocale, MAI-Voice-2.1 coûte 22 dollars par million de caractères, contre 15 dollars par million de caractères pour MAI-Voice-2.1-Flash.

Microsoft a également créé Chatter, une démonstration réunissant les modèles dans le MAI Playground. Les trois sont accessibles via Microsoft Foundry, MAI Playground, Vercel et Azure Voice Live. MAI-Voice-2.1 et sa variante Flash sont aussi proposés via OpenRouter, tandis qu'une intégration LiveKit est prévue ultérieurement.