Desert Ant Labs installe ses modèles directement dans les applications

Desert Ant Labs lance 18 modèles spécialisés pour traiter l’audio, le texte et les images sur les appareils, sans envoyer les contenus vers le cloud.

Transcrire dix minutes d’audio en deux secondes, nettoyer un enregistrement de cinq minutes en une seconde ou masquer des données personnelles pendant leur saisie. Desert Ant Labs promet d’exécuter chacune de ces opérations directement sur un téléphone ou un ordinateur, sans facturation par requête et sans transmettre le contenu à un serveur distant.

Présentée le 8 septembre, la société se décrit comme un laboratoire européen d’intelligence artificielle de pointe. Son premier catalogue réunit 18 modèles consacrés à des tâches précises dans l’audio, le texte et l’image. Douze sont actuellement disponibles et six restent en bêta, sans SDK public au moment du lancement.

Cette distinction nuance l’annonce selon laquelle les 18 modèles sont déjà « live ». Align, Clear, Clips, Ear, Emo, Gist, Redact, Shapes, Title, Tongue, Uhm et Voz peuvent être intégrés. Eye, Face, Moderator, Schemer, Toxic et Who sont présentés dans le catalogue, mais leur documentation les classe encore parmi les modèles à venir et invite les développeurs à demander un accès anticipé.

L’entreprise ne cherche pas, pour le moment, à construire un assistant général capable de répondre à n’importe quelle question. Chaque modèle reçoit une fonction délimitée : reconnaître la parole, améliorer une voix, repérer les meilleurs passages d’une transcription, identifier une langue, masquer des informations personnelles ou proposer un titre.

Cette spécialisation permet de réduire fortement la taille des fichiers et le calcul nécessaire. Tongue, consacré à l’identification de la langue, ne pèse que 2 Mo. Clear occupe 9 Mo et Redact 12 Mo sur les appareils Apple. À l’autre extrémité du catalogue, Voz et Clips atteignent respectivement 467 et 284 Mo, mais restent suffisamment compacts pour être téléchargés avec une application ou à la demande.

Desert Ant Labs fournit des SDK pour Swift, Kotlin et JavaScript. Cette couverture concerne l’ensemble de la gamme, mais pas nécessairement chaque modèle. Voz, par exemple, fonctionne actuellement avec Swift sur les appareils Apple équipés de leurs propres puces. Clear et Redact disposent d’implémentations plus larges couvrant aussi Android et le Web.

La société est issue de l’équipe à l’origine de Detail, une application de création vidéo développée depuis cinq ans. Certaines fonctions de Detail reposaient jusqu’ici sur des services distants pour améliorer le son, transcrire des enregistrements ou sélectionner des extraits. À mesure que l’application gagnait des utilisateurs, le coût de ces appels augmentait.

L’équipe affirme avoir commencé à entraîner et à adapter ses propres modèles pour remplacer ces services. Clear aurait pris la place d’un outil Dolby pour l’amélioration audio, Voz aurait accéléré les transcriptions locales et Clips aurait remplacé Claude Sonnet dans le système de montage automatique. Detail 6, prévu avec iOS 27, doit supprimer les derniers appels à des services d’IA distants utilisés par l’application.

Cette expérience explique le positionnement très orienté vers les produits. Desert Ant Labs ne vend pas seulement des fichiers à télécharger, mais une combinaison de modèles, de runtimes et d’interfaces de programmation adaptées à chaque plateforme. Clear et Voz exploitent ainsi le Neural Engine des appareils Apple, tandis que la version Web de Clear utilise les mêmes poids à travers WebAssembly.

Voz constitue l’une des principales démonstrations techniques de la gamme. Le modèle peut produire une transcription dans 25 langues européennes, avec une heure de début et de fin pour chaque mot. Sur un iPhone 17 Pro, Desert Ant Labs annonce deux secondes pour dix minutes d’audio et six secondes pour trente minutes. Un iPhone 15 Pro réaliserait la même transcription de trente minutes en sept secondes.

Le modèle repose sur Parakeet TDT 0.6B v3 de NVIDIA, publié sous licence CC BY 4.0. Desert Ant Labs indique ne pas avoir modifié ses poids. Son travail porte sur la conversion, la compression et l’environnement d’exécution destiné au Neural Engine.

La comparaison avec Whisper demande néanmoins quelques précautions. Le facteur de vitesse de 4,7 a été mesuré par l’entreprise sur un Mac M3 Ultra, face à Whisper large-v3-turbo exécuté avec whisper.cpp. Il ne représente donc pas un avantage garanti sur tous les appareils, toutes les implémentations ou tous les types d’enregistrements.

Voz n’est pas non plus systématiquement plus précis. Sur six jeux publics de reconnaissance vocale en anglais, son taux moyen d’erreur sur les mots atteint 7,40 %, contre 7 % pour Whisper large-v3-turbo. Il fait mieux sur les réunions du jeu AMI, avec 11,84 % contre 13,87 %, mais reste légèrement derrière Whisper sur plusieurs autres ensembles.

Les résultats varient davantage entre les langues. Sur les mesures publiées par l’entreprise, le taux d’erreur va de 3,31 % pour l’italien à 39,46 % pour le grec. Voz ne détecte par ailleurs pas automatiquement la langue parlée. Un enregistrement dans une langue non prise en charge peut produire une transcription plausible en apparence, mais incorrecte. Desert Ant Labs recommande de lui associer Ear, son modèle de détection des langues vocales.

Les 467 Mo de Voz doivent être téléchargés puis conservés sur l’appareil. Après cette installation, une première préparation par Core ML peut prendre une vingtaine de secondes. Les chargements suivants descendraient à environ 0,2 seconde. Ces détails illustrent l’un des compromis du calcul local : l’attente et la facture du serveur disparaissent, mais l’application doit gérer le stockage, la compatibilité matérielle et l’initialisation du modèle.

Clear applique la même logique à l’amélioration de la voix. Son fichier de 9 Mo supprime le bruit, ajuste le niveau sonore et réencode un enregistrement à 48 kHz. Deux versions sont proposées. Clear Studio cherche à éliminer presque entièrement le bruit de fond, tandis que Clear Natural conserve davantage d’ambiance, de respiration et de texture vocale.

Desert Ant Labs annonce une vitesse 302 fois