Un seul modèle pour transcrire, traduire et naviguer entre 22 langues indiennes

Sarvam AI fait évoluer son modèle de reconnaissance vocale avec Saaras V4, un système associant encodeur audio et modèle de langage hybride de 3 milliards de paramètres. Il réunit cinq formats de transcription et cible les langues indiennes, les accents anglais, le code-mixing et les environnements audio dégradés.

Cinq lectures différentes du même enregistrement

Une conversation mêlant hindi et anglais peut être retranscrite telle qu’elle est prononcée, normalisée, romanisée ou directement traduite. Saaras V4 rassemble ces opérations dans le même modèle plutôt que de les répartir entre plusieurs traitements successifs.

Cinq modes sont proposés. `verbatim` conserve chaque mot dans l’écriture native, `transcribe` normalise notamment les nombres et les dates, `codemix` maintient les termes anglais en alphabet latin au milieu du texte natif, `translit` romanise l’ensemble de la transcription et `translate` produit une traduction anglaise.

Sarvam AI cherche ainsi à traiter directement une caractéristique courante de la parole multilingue en Inde : le passage d’une langue à l’autre au cours d’une même phrase. Un décodeur de 3 milliards de paramètres entraîné en interne

L’architecture associe un encodeur audio à Sarvam-3B, un décodeur autorégressif hybride de type state-space comptant 3 milliards de paramètres et entraîné intégralement par Sarvam AI.

L’encodeur convertit d’abord le signal sonore en représentations acoustiques. Un adaptateur réduit ensuite leur dimension temporelle avant de les projeter dans l’espace du modèle de langage. Le décodeur reçoit ces informations avec les instructions textuelles puis génère la transcription token après token.

Cette compression temporelle sert également à traiter des enregistrements plus longs sans saturer aussi rapidement la fenêtre de contexte. 4,35 % de WER moyen sur sept benchmarks anglais

Sarvam AI rapporte un WER moyen de 4,35 % sur sept jeux d’évaluation couvrant réunions, podcasts, livres audio, appels financiers, discours et différents accents anglais.

Dans la comparaison publiée par l’entreprise, ElevenLabs Scribe v2 atteint 4,62 %, AssemblyAI 4,66 % et Deepgram Nova 3 5,57 %. Six des jeux de données proviennent des résultats publiés sur l'Open ASR Leaderboard de Hugging Face, auxquels Sarvam ajoute Svarah pour l’anglais avec accent indien.

Ces valeurs utilisent la normalisation et le système de scoring de l’Open ASR Leaderboard, mais la synthèse comparative est celle publiée par Sarvam AI. Les langues indiennes au centre de l’évaluation

La différence devient plus marquée sur les évaluations consacrées aux langues indiennes. Sur Vistaar, Saaras V4 obtient un LLM-WER global de 11,12 % dans les résultats de Sarvam AI, contre 14,44 % pour Scribe v2, 23,33 % pour Deepgram Nova 3 et 25,89 % pour GPT-4o Transcribe.

Sarvam utilise ici deux métriques. Le WER traditionnel compte les substitutions, suppressions et insertions par rapport à la transcription de référence. Le LLM-WER ajoute une étape d’évaluation sémantique destinée à distinguer une véritable erreur de transcription d’une différence orthographique ou de format ne modifiant pas le sens.

Le modèle identifie également automatiquement la langue parlée. Sarvam rapporte un taux d’erreur de 5,22 % sur les 22 langues indiennes évaluées, qui descend à 2,9 % sur les dix langues les plus parlées du groupe. Donner au modèle les mots qu’il risque de manquer

Saaras V4 accepte aussi une liste de termes à privilégier pendant la transcription. Ce keyterm prompting peut contenir des noms de personnes, produits, acronymes ou termes propres à un domaine.

Sur IndicContextEval d’AI4Bharat, Sarvam rapporte un WER de 16,03 % dans la configuration L5, où les termes du domaine sont transmis au modèle dans leur écriture native avec l’indication de la langue.

Le système cible également les enregistrements soumis au vent, à la compression, au clipping, au bruit de circulation ou à d’autres interférences, ainsi que les conversations mêlant plusieurs langues et variations dialectales. Moins de 150 ms avant le premier token

Pour les usages temps réel, Sarvam annonce un time to first token inférieur à 150 ms en streaming. Les enregistrements de plusieurs minutes peuvent également être traités nativement.

L’API REST prend en charge les fichiers de moins de 30 secondes, tandis que le traitement batch accepte des fichiers allant jusqu’à deux heures et peut ajouter la diarisation des interlocuteurs. Une connexion WebSocket fournit les transcriptions partielles destinées aux applications vocales en direct.

Des SDK Python et Node.js sont disponibles, avec des intégrations pour Vercel AI SDK, LiveKit Agents et Pipecat Agents.