Fish Audio lève 52 M$ un an après avoir quitté GitHub

Fish Audio réunit 52 millions de dollars pour imposer son modèle vocal S2.1 Pro. Une technologie de clonage rapide qui vise le marché des entreprises.

Fish Audio boucle un tour d'amorçage de cinquante-deux millions de dollars, un an après sa constitution en société. Coreline Ventures et Capital Today mènent l'opération, rejoints par 359 Capital, Play Time, HF0, 645 Ventures, Parable, Bayhouse Ventures, Carya Venture Partners et Alphalist Partners. L'origine du projet tient dans une image assez précise. Shijia Liao, alors ingénieur de recherche vidéo chez NVIDIA et spectateur assidu de streams de VTubers, supportait mal l'inexpressivité des voix de synthèse et s'est mis à entraîner des modèles sur une unique carte 4090, chez lui. Le dépôt qui en est sorti, Fish Speech, dépasse aujourd'hui les trente et un mille étoiles sur GitHub.

La thèse de la maison tient dans une distinction. Prononcer correctement et interpréter juste sont deux problèmes différents, et le secteur ne se serait attaqué qu'au premier. Une voix de synthèse convainc sur une phrase et se fissure vers la dixième. Sa cofondatrice et directrice générale, passée par l'IA vocale d'Amazon Alexa puis de Meta, revendique d'avoir pris le problème par l'autre bout.

Cinq modèles sont sortis en un an, quatre de synthèse et un de transcription, l'effectif passant de trois à vingt-deux personnes. Un point mérite précision, que la communication de l'entreprise laisse dans l'ombre : trois des modèles de synthèse sont ouverts, mais le dernier, S2.1 Pro, n'est accessible que par l'API payante. Celui-ci couvre plus de quatre-vingt-trois langues avec une prosodie native et un contrôle des émotions à l'échelle du mot, via plus de quinze mille commandes en langage courant, et clone une voix à partir de cinq secondes d'audio.

Le post-entraînement s'appuie sur les préférences réelles des utilisateurs, ce qui expliquerait la tenue du modèle sur l'anglais accentué, le mandarin, le japonais, le coréen et l'espagnol, là où des modèles calés sur l'anglais américain standard décrochent. L'équipe de recherche a par ailleurs refondu la pile d'inférence avec des kernels FP8 maison, revendiquant plus de huit mille tokens par seconde sur un seul H200. Déploiement sur site, zéro rétention de données et configurations conformes HIPAA visent les secteurs régulés, l'entreprise et les développeurs pesant les deux tiers d'un chiffre d'affaires annuel récurrent annoncé à vingt et un millions de dollars.

La suite portera sur un modèle de compréhension audio et sur du speech-to-speech. Reste que les comparaisons mises en avant, environ deux tiers d'auditeurs préférant S2.1 Pro à ses concurrents lors de tests d'écoute à l'aveugle, proviennent de l'entreprise et ne s'accompagnent d'aucun protocole publié.