Grok Voice Transcribe 2.0 descend à 2,7 % d’erreurs en streaming

Grok Voice Transcribe 2.0 améliore la transcription des conversations, commandes vocales et contenus multilingues. Le modèle de SpaceXAI prend la tête du classement streaming d’Artificial Analysis et conserve un tarif de 0,10 dollar par heure en batch et 0,20 dollar en temps réel.

Les progrès se concentrent sur les audios difficiles

Une ligne téléphonique médiocre, une adresse e-mail dictée ou une commande de quelques mots laissent peu de marge à un système de transcription. C’est précisément sur ces situations que SpaceXAI concentre Grok Voice Transcribe 2.0, son nouveau modèle speech-to-text construit sur la même base audio que Grok Voice.

L’entraînement s’appuie notamment, selon l’entreprise, sur des enregistrements bruités, multilingues et issus de différents environnements réels, complétés par une phase de post-training. SpaceXAI indique que cette base audio est déjà utilisée pour des appels de support, de la narration vidéo et l’assistant Grok intégré aux véhicules Tesla.

Sur ses propres évaluations, l’entreprise mesure une progression dans quatre catégories : appels téléphoniques, conversations avec Grok, informations dictées comme les numéros de téléphone ou adresses e-mail, et commandes vocales courtes dans 19 langues. Le Word Error Rate passe notamment de 20,6 % à 6,8 % entre les versions 1.0 et 2.0 sur ce dernier test.

Les résultats restent internes et varient sensiblement selon les situations. Sur les appels de support en anglais, Transcribe 2.0 affiche par exemple 7,1 % de WER contre 10,6 % pour son prédécesseur. Sur les conversations avec Grok, l’écart est plus marqué, de 8,7 % à 3,3 %. Premier en précision streaming sur Artificial Analysis

Une mesure indépendante permet de compléter ces chiffres. Sur le classement public d’Artificial Analysis, Grok Voice Transcribe 2.0 obtient un WER de 2,7 % pour la transcription finale en streaming, contre 3,9 % pour la génération précédente. Il occupait ainsi la première position du classement en précision lors de sa sortie.

La progression publique est donc plus mesurée que la formule « deux fois plus précis » utilisée par SpaceXAI, qui agrège des résultats provenant de ses propres jeux d’évaluation.

Cette précision supplémentaire s’accompagne aussi d’un compromis. Artificial Analysis mesure 0,49 seconde avant la transcription finale, contre 0,37 seconde pour Transcribe 1.0. ElevenLabs Scribe v2 Realtime atteint de son côté 0,14 seconde sur cette mesure. Transcribe 2.0 privilégie donc davantage la réduction des erreurs que la latence minimale. Changement de langue au milieu d’une phrase

Le multilingue constitue l’une des évolutions les plus importantes de cette version. Le modèle détecte automatiquement la langue et peut suivre un changement en cours d’enregistrement sans nécessiter une seconde passe.

La documentation Speech-to-Text de SpaceXAI confirme également la prise en charge de fonctions destinées aux usages professionnels : timestamps au niveau de chaque mot avec scores de confiance, identification des différents locuteurs, transcription indépendante de huit canaux maximum et possibilité de fournir jusqu’à 100 termes spécifiques pour favoriser leur reconnaissance.

Les nombres, devises, dates, numéros de téléphone et adresses e-mail peuvent être directement formatés dans la transcription. Le système sait également retirer les hésitations et détecter la fin d’une prise de parole, une fonction pensée notamment pour les agents vocaux. Loom relie la voix au code

Atlassian utilise déjà Transcribe 2.0 dans Loom après l’avoir jugé plus précis que sa solution précédente pour transcrire ses vidéos. L’intégration ouvre un workflow assez direct : une personne enregistre ses instructions dans Loom, la transcription peut ensuite être transmise à Cursor pour transformer ces demandes en modifications de code.

Le modèle est facturé 0,10 dollar par heure d’audio en batch et 0,20 dollar en streaming, sans supplément annoncé pour la diarisation, les timestamps ou les termes personnalisés. Ces prix restent identiques à ceux de Transcribe 1.0.

La documentation actuelle de l’API indique désormais `grok-voice-transcribe-2.0` comme modèle par défaut, tandis que la version 1.0 peut encore être sélectionnée explicitement.