Scribe v2 se spécialise dans les noms de médicaments et la dictée clinique
ElevenLabs étend Scribe v2 avec une version spécialisée dans la transcription médicale. Scribe v2 Medical cible les médicaments, l’anatomie, les pathologies et la dictée clinique, tout en conservant les fonctions et la tarification du modèle généraliste.
Une transcription spécialisée pour l’audio clinique
Entre les noms de médicaments proches phonétiquement, les dosages, les unités et le vocabulaire anatomique, l’audio médical expose les modèles Speech to Text à des erreurs qui peuvent modifier le sens d’une transcription.
Scribe v2 Medical est une version de Scribe v2 fine-tunée spécifiquement pour ces contenus. Le modèle fonctionne en batch et conserve la même API que Scribe v2, avec diarisation des locuteurs, timestamps, détection d’entités et keyterm prompting. Il prend en charge plus de 90 langues.
La documentation précise son périmètre : le texte produit doit servir de brouillon destiné à être relu et corrigé par un professionnel de santé ou une personne autorisée. Le modèle n’est pas conçu pour interpréter les informations médicales, établir un diagnostic ou recommander un traitement. 4,9 % de WER sur MedDictate
Sur MedDictate, benchmark de dictées cliniques en anglais, français et allemand, ElevenLabs mesure un WER global de 4,9 % pour Scribe v2 Medical, contre 7,6 % pour Scribe v2. GPT Transcribe atteint 5,9 % et Muse Voice Transcribe 7,8 % dans les mêmes évaluations réalisées par ElevenLabs.
Les écarts varient selon la langue. Scribe v2 Medical obtient 3 % en anglais, 8,3 % en français et 7,2 % en allemand. GPT Transcribe obtient respectivement 3,9 %, 7,8 % et 9,6 %. Le modèle d’OpenAI reste donc légèrement devant sur le français dans ce benchmark, tandis que Scribe v2 Medical obtient le WER global le plus faible parmi les modèles comparés.
Sur MedTerm, qui isole davantage la reconnaissance du vocabulaire clinique, ElevenLabs mesure 77,7 % de rappel des termes médicaux et un Term-WER de 10,4 %. Scribe v2 atteint respectivement 77,1 % et 10,7 %, tandis que GPT Transcribe obtient 74 % et 12,3 %. Les mots isolés restent plus difficiles
Un troisième benchmark, publié par Eka Care, rassemble 3 619 extraits en anglais mêlant noms de médicaments et de pathologies, phrases cliniques et conversations entre soignants et patients.
Dans l’évaluation réalisée par ElevenLabs, Scribe v2 Medical atteint 6,50 % de SemWER et 6,02 % de kwWER. La version standard de Scribe v2 obtient 7,35 % et 7,04 %, tandis que Deepgram Nova-3 Medical atteint 7,79 % et 7,65 %.
Les termes prononcés seuls restent toutefois plus difficiles à reconnaître. ElevenLabs mesure 14,3 % de WER sur les mots médicaux isolés, contre 7,5 % lorsque ces termes apparaissent dans une phrase. Le keyterm prompting peut fournir au modèle une liste de termes susceptibles d’apparaître afin d’orienter leur transcription. Pas de recul mesuré sur la parole généraliste
La spécialisation médicale ne se traduit pas, dans le test publié par ElevenLabs, par une baisse mesurable sur la parole quotidienne. Sur 6 000 échantillons non médicaux issus de Common Voice, Scribe v2 Medical et Scribe v2 obtiennent tous deux un WER arrondi à 5,3 %.
Le modèle conserve également la même tarification que Scribe v2. Il utilise l’identifiant `scribev2medical` dans la Speech to Text API et fonctionne actuellement sur l’endpoint batch plutôt qu’en transcription temps réel. Des données médicales avec rétention nulle
Pour les usages impliquant des données de santé protégées, Scribe v2 Medical est éligible HIPAA pour les clients Enterprise disposant d’un Business Associate Agreement et utilisant le Zero Retention Mode.
Dans cette configuration, ElevenLabs indique supprimer l’audio envoyé et le texte généré dès la fin de la requête. La conservation éventuelle de la transcription relève ensuite de l’application qui utilise l’API.