Dates, sentiment, format : Scribe v2 édite ses transcriptions après écoute
ElevenLabs ajoute Transcript Editing à Scribe v2 et Scribe v2 Realtime. Une instruction en langage naturel peut reformater, annoter ou modifier automatiquement une transcription tout en conservant séparément le texte original.
Une instruction après la transcription
Convertir toutes les dates au format ISO, développer les abréviations à leur première occurrence ou ajouter un sentiment à chaque phrase peut désormais être demandé directement lors d’une transcription.
Avec Transcript Editing, Scribe v2 reçoit une instruction en langage naturel en même temps que l’audio. La transcription est d’abord produite normalement, puis cette instruction est appliquée au texte obtenu.
Les deux versions sont renvoyées séparément. Le champ `text` conserve la transcription originale et `editedtranscript` contient sa version modifiée. Les timestamps associés aux mots restent eux aussi rattachés au texte initial. Jusqu’à 2 000 caractères d’instructions
Une même instruction peut atteindre 2 000 caractères et regrouper plusieurs transformations.
ElevenLabs donne comme exemples la conversion des heures vers un format 24 heures, le développement d’abréviations comme ETA ou ASAP, la suppression de certains termes, l’ajout d’une indication positive, négative ou neutre après chaque phrase ou encore la transformation complète du résultat en liste.
Les instructions peuvent être rédigées dans différentes langues, même si ElevenLabs indique obtenir de meilleurs résultats en anglais. La langue du transcript final reste celle de l’audio original.
Certaines opérations disposent toujours de paramètres dédiés. ElevenLabs recommande par exemple le keyterm prompting pour favoriser la reconnaissance de noms ou termes précis, `noverbatim` pour retirer hésitations et disfluences, et `numbersformat` pour gérer l’écriture des nombres. Le même principe arrive dans Scribe v2 Realtime
Scribe v2 Realtime accepte également ces instructions. Elles sont transmises une seule fois lors de l’ouverture de la connexion.
Chaque transcription finalisée est ensuite suivie d’un événement `editedtranscript`. Les résultats partiels ne sont pas modifiés, ce qui évite de réécrire continuellement un texte encore en cours de transcription.
Le traitement intervient après la reconnaissance vocale. La documentation précise donc qu’il ajoute une latence qui augmente avec la longueur du transcript. L’original reste disponible
Le fonctionnement sépare volontairement transcription et transformation. Si l’édition échoue, Scribe conserve le résultat original et renvoie une erreur distincte pour la partie modifiée.
Les informations structurées comme les timestamps mot par mot, les identifiants de locuteurs et les formats additionnels continuent également de correspondre à la transcription originale plutôt qu’au texte réécrit.
Transcript Editing ne peut actuellement pas être combiné avec `entitydetection`, `entityredaction` ou `usemultichannel`. 30 % supplémentaires sur le coût de transcription
La fonction est expérimentale et disponible avec Scribe v2 et Scribe v2 Realtime. Son utilisation ajoute 30 % au coût de base de la transcription, avec un minimum facturé correspondant à dix secondes d’audio par requête.
Côté API, l’intégration passe par le paramètre `transcriptedit` en Python et `transcriptEdit` en TypeScript. La version modifiée est ensuite renvoyée dans `editedtranscript` ou `editedTranscript` selon le SDK utilisé.