Une transcription plus attentive au contexte avec Qwen-Audio 3.0
Le modèle Qwen-Audio 3.0 utilise le contexte et des listes de mots clés pour fiabiliser la reconnaissance vocale. Ce qui change pour les comptes rendus.
La famille Qwen-Audio-3.0-ASR-Flash renforce la reconnaissance vocale en s’appuyant sur le contexte de la conversation et sur des listes de termes spécialisés. Un développeur peut transmettre les échanges précédents, ajouter des mots à privilégier et laisser le service détecter automatiquement la langue, parmi une trentaine prises en charge.
Trois modes couvrent des usages différents. Qwen-Audio-3.0-ASR-Flash-Streaming traite un flux audio en temps réel via WebSocket, tandis que la version Flash reçoit un fichier ou une URL par HTTP. Filetrans fonctionne de manière asynchrone pour les enregistrements plus longs, avec soumission de la tâche puis récupération du résultat une fois le traitement terminé.
En streaming, le service retourne des résultats intermédiaires puis définitifs, accompagnés de repères temporels pour chaque phrase et chaque mot. Le développeur peut privilégier une segmentation plus rapide pour les interactions vocales ou une découpe sémantique mieux adaptée aux réunions. Le contexte peut aussi être actualisé pendant la transcription sans interrompre la session.
La version destinée aux fichiers ajoute notamment la séparation des intervenants, la sélection des pistes audio et l’utilisation de listes de mots temporaires ou réutilisables. Les résultats sont livrés sous forme de texte structuré avec les phrases, les intervenants et les repères temporels associés.
Qwen affirme atteindre un taux de rappel de 95,36 % sur des termes médicaux et de 93,24 % sur du vocabulaire industriel lors de ses évaluations internes. L’entreprise présente également une fonction de réécriture destinée à retirer les hésitations et à structurer automatiquement les transcriptions.