Transcrire dans le cloud, nettoyer en local : Superwhisper structure sa famille S1

Superwhisper réunit S1-Voice pour la transcription cloud, S1-Language pour la reformulation et S1-mini pour le nettoyage local.

Superwhisper présente trois modèles développés en interne pour couvrir les différentes étapes de son outil de dictée. S1-Voice convertit la parole en texte dans le cloud, S1-Language transforme ce texte selon des instructions, tandis que S1-mini assure localement des opérations plus ciblées de nettoyage et de mise en forme.

Cette distinction est importante : S1-mini n’est pas un modèle de reconnaissance vocale. Il reçoit une transcription déjà produite et intervient ensuite pour retirer les hésitations, interpréter les corrections orales, structurer les listes ou formater un message. Une utilisation entièrement locale suppose donc de l’associer à un modèle vocal lui aussi exécuté sur l’appareil. Superwhisper recommande par exemple Cohere Transcribe en local avec S1-mini ; l’autre configuration proposée combine S1-Voice et S1-Language dans le cloud.

S1-mini compte 600 millions de paramètres pour un fichier annoncé à 462 Mo. Son exécution ne nécessite aucune requête réseau. Un curseur permet de choisir entre cinq niveaux de ton, du style informel en minuscules à une rédaction formelle avec ponctuation complète et contractions développées.

Le modèle peut transformer une énumération dictée en liste, reconnaître la structure d’un courriel, convertir une adresse prononcée en adresse électronique ou corriger une reprise comme « mardi, je veux dire jeudi ». Superwhisper précise qu’il ne doit pas ajouter d’information absente, vérifier les faits, atténuer les grossièretés ou modifier un dialecte. Son rôle reste limité à la restitution et à l’organisation du contenu dicté.

L’entreprise publie les résultats d’une évaluation interne portant sur 7 519 cas tirés de 104 transcriptions réservées aux tests. Elle annonce une précision de 94,8 % au niveau des tokens, un taux d’erreur d’édition de 11,6 % et une sélection correcte de la structure — liste ou paragraphe — dans 97,6 % des cas. La restitution exacte des adresses électroniques atteint 92 %. Ces chiffres évaluent surtout le post-traitement de textes attendus et ne mesurent pas la qualité de la reconnaissance audio en amont.

Superwhisper indique également publier S1-mini avec des poids ouverts sur Hugging Face. L’annonce ne fournit toutefois pas de lien direct vers le dépôt ni de licence détaillée. La liste publique des modèles ne répertorie pas encore S1-mini au moment de la consultation. La disponibilité des poids ne permet donc pas encore de déterminer précisément les droits de modification, de redistribution ou d’utilisation commerciale.

S1-Voice prend en charge la première étape de la chaîne. Hébergé par Superwhisper, il est proposé aux abonnés Pro et couvre plus de 100 langues selon la documentation des modèles vocaux. L’entreprise affirme que les dictées de moins de trente secondes sont généralement renvoyées 0,32 seconde après l’arrêt de l’enregistrement.

Sur huit jeux de données comprenant des réunions, des conférences financières et de la parole spontanée, Superwhisper annonce un taux d’erreur moyen de 6,8 % et un résultat de 2,2 % sur LibriSpeech. S1-Voice aurait obtenu le meilleur résultat parmi les quinze modèles évalués, avec un score agrégé de 83 sur 100, contre 76 pour Wispr Flow. Ces mesures ont été réalisées par l’éditeur : l’annonce ne publie pas l’ensemble des fichiers, sorties et paramètres nécessaires à une reproduction indépendante, et le score agrégé ne constitue pas une métrique standard directement comparable à d’autres classements.

S1-Language intervient après la transcription pour appliquer des consignes plus élaborées. Il peut nettoyer une dictée, produire un résumé de réunion, respecter un format de notes ou adapter un courriel à des règles prédéfinies. Ce modèle est lui aussi hébergé dans le cloud, réservé à l’offre Pro et doté d’une fenêtre contextuelle annoncée à 128 000 tokens. Il apparaît dans le sélecteur de Superwhisper aux côtés de modèles proposés par Anthropic, OpenAI et Groq.

Le choix des modèles détermine le parcours des données. Avec une chaîne entièrement locale, l’audio et le texte restent sur l’appareil. Lorsqu’un modèle cloud est sélectionné, les données passent par l’infrastructure de Superwhisper. L’entreprise affirme que les contenus transmis à ses modèles ou aux fournisseurs intégrés ne sont ni conservés ni utilisés pour l’entraînement, dans le cadre d’accords de non-rétention. Cette garantie relève des engagements contractuels décrits par l’éditeur ; elle ne transforme pas une configuration cloud en traitement local.

La présentation du 19 août formalise une famille déjà déployée progressivement. Le journal des versions indique que S1-Voice et S1-Language avaient quitté leur statut expérimental en avril 2026. S1-mini était disponible à titre expérimental depuis juin, son réglage de ton ayant été ajouté en juillet. La version 2.17.2 du 6 août mentionnait ensuite officiellement l’arrivée de la famille S1.

Superwhisper est disponible sur macOS, Windows et iOS, mais ses documents publics ne précisent pas encore clairement la compatibilité de S1-mini avec chaque plateforme et chaque type de processeur. Au-delà des résultats internes annoncés, l’évaluation devra notamment porter sur les accents, les environnements bruyants, les dictées multilingues et les vocabulaires spécialisés qui ont servi à positionner ces modèles.