Parakeet Redux fait tenir 1,2 Go de reconnaissance vocale dans 178 Mo

Moondream décline le modèle de transcription Parakeet de NVIDIA en deux versions : Redux compresse ses poids à 178 Mo pour accélérer l’exécution locale sur CPU et Mac, tandis qu’Ultra conserve la pleine précision et réduit les erreurs de transcription sur GPU.

Trois valeurs pour compresser les poids

Faire tourner localement un modèle de transcription ne dépend pas uniquement de sa puissance de calcul. Sur CPU et Apple Silicon, la vitesse à laquelle les poids circulent entre la mémoire et le processeur peut devenir le principal facteur limitant.

Moondream Parakeet Redux réduit cette charge en appliquant une quantification ternaire à l’encoder de Parakeet : chaque poids ne peut prendre que trois valeurs, -1, 0 ou +1. Le modèle passe ainsi de 1,2 Go à 178 Mo, tout en conservant la même architecture, le même tokenizer et la prise en charge de 25 langues.

Le moteur Photon de Moondream exploite directement cette représentation compacte avec des kernels adaptés aux différentes architectures. Sur un MacBook Air M2, l’équipe mesure 38 secondes d’audio traitées par seconde sur CPU et 43 sur GPU. Avec huit cores d’un AMD EPYC 9575F, le débit atteint 113 secondes d’audio par seconde. Ces performances proviennent des benchmarks publiés par Moondream. Une compression avec peu de pertes, sauf dans le bruit

Réduire fortement les poids pose immédiatement la question de la précision. Moondream la mesure avec le Word Error Rate, ou WER, où un résultat inférieur indique moins d’erreurs de transcription.

Sur sept jeux de tests en anglais, Redux obtient un WER moyen de 6,55 %, contre 6,26 % pour le Parakeet original. Sur FLEURS et ses 25 langues, la version compressée passe en revanche de 11,62 % à 10,56 %. Sur des enregistrements longs TED-LIUM, elle descend également de 2,71 % à 2,51 %.

Le compromis devient plus visible avec du bruit de fond : le WER grimpe de 6,72 % sur le modèle original à 9,04 % avec Redux. Pour ce type d’enregistrement, Moondream oriente plutôt vers sa seconde version, Parakeet Ultra. Ultra conserve la taille et travaille sur la précision

Parakeet Ultra suit la direction inverse. Les poids restent en pleine précision et le modèle reçoit un post-training supplémentaire destiné à réduire les erreurs, avec une exécution pensée pour GPU.

D’après les évaluations de Moondream, Ultra atteint 5,80 % de WER sur les sept tests anglais, 9,55 % sur FLEURS, 5,79 % sur les enregistrements professionnels et 5,82 % avec bruit de fond. Sur onze conférences TED-LIUM de 10 à 20 minutes, il descend à 1,94 %, contre 2,71 % pour le modèle Parakeet original.

Ces résultats restent ceux publiés par Moondream et ne constituent pas une comparaison indépendante avec l’ensemble des modèles de transcription disponibles. La segmentation audio entre directement dans le modèle

Les deux versions intègrent également la détection d’activité vocale. Pour les enregistrements longs, Photon cherche les pauses afin de découper automatiquement l’audio en segments allant jusqu’à 30 secondes, sans nécessiter un modèle VAD externe.

La transcription peut être effectuée à partir de fichiers ou d’un flux audio en direct, avec timestamps par segment ou par mot. En streaming, Photon commence à fournir une prévisualisation après quatre secondes d’audio puis la réactualise toutes les deux secondes à mesure que davantage de contexte devient disponible.

Les poids de Redux sont disponibles via Hugging Face sous licence CC-BY-4.0, comme le modèle Parakeet original de NVIDIA. Redux cible principalement les CPU et Apple Silicon, tandis qu’Ultra conserve la pleine précision pour une utilisation sur GPU.