Cartesia complète sa pile vocale avec Sonic 3.5 (TTS) et Ink 2 (STT)

Cartesia lance Sonic 3.5 et Ink 2, deux modèles de voix et transcription en temps réel basés sur l’architecture SSM pour réduire la latence des IA.

Avec Sonic 3.5 et Ink 2, Cartesia couvre les deux bouts de la chaîne des voice agents en temps réel : la synthèse vocale (TTS) d'un côté, la transcription (STT) de l'autre. Fondée par des chercheurs de Stanford à l'origine des State Space Models, la société revendique pour les deux la première place sur les classements de streaming d'Artificial Analysis, et se présente comme le seul fournisseur à tenir simultanément le haut du tableau côté parole et côté écoute.

Sonic 3.5, présenté comme le modèle de voix le plus naturel, affiche une latence inférieure à 90 ms jusqu'au premier son et une prise en charge native de 42 langues. Il lit correctement chiffres, codes, e-mails et numéros de téléphone sans préparation, et tranche les hétéronymes anglais selon le contexte. Ink 2 met de son côté l'accent sur la précision et la détection de fin de tour : il repère sémantiquement quand une personne a fini de parler, sans détecteur d'activité vocale séparé, et émet un cycle complet d'événements de tour de parole. Il gère aussi nativement les données structurées comme les numéros et les dates. À ce stade, Ink 2 ne traite toutefois que l'anglais, là où Sonic 3.5 couvre des dizaines de langues.

Les deux modèles reposent sur l'architecture SSM de Cartesia, que la société oppose aux transformers pour sa faible latence en streaming. Sonic 3.5 et Ink 2 sont accessibles via l'API et le playground de Cartesia.