Chercher une voix, générer, transcrire : Fish Audio se branche aux agents via MCP

Le serveur MCP de Fish Audio connecte Claude, Codex, Cursor et Windsurf pour rechercher des voix, générer de l’audio et transcrire des fichiers.

Un serveur MCP connecte les fonctions vocales de Fish Audio à Claude, Codex, Cursor et Windsurf pour rechercher des voix, générer de l’audio et transcrire des fichiers.

Chercher une voix, écouter ses extraits, lui confier un script ou transcrire un enregistrement peut désormais se faire depuis un agent IA. Fish Audio ouvre un serveur MCP qui donne accès à sa bibliothèque vocale, à la synthèse de parole, à la transcription et au suivi des crédits depuis les outils déjà utilisés pour écrire ou coder.

Le branchement passe par une adresse unique, `https://api.fish.audio/mcp`, compatible avec Claude Code, Claude.ai, Cursor, Codex CLI, Windsurf et les autres clients prenant en charge MCP. L’authentification utilise OAuth : une fenêtre de navigateur s’ouvre pour connecter le compte Fish Audio, sans clé API à copier dans la configuration.

Une fois l’accès accordé, les commandes se formulent en langage naturel. L’agent peut rechercher les voix japonaises les plus populaires et faire écouter leurs extraits, choisir une voix anglaise calme pour lire un fichier, convertir un script en audio ou transcrire un enregistrement avant d’en extraire les actions à suivre. Il peut aussi consulter le solde de crédits du compte.

Dans Claude Code ou Codex, ces fonctions s’enchaînent avec les commandes du terminal. Un agent peut lire un dossier de scripts, générer les narrations en série, télécharger les fichiers produits ou envoyer un enregistrement local vers le service de transcription. Les générations audio sont renvoyées sous forme d’URL permanentes. Pour les fichiers locaux, le transfert passe par un espace temporaire supprimé automatiquement après sept jours.

La diction reste contrôlable depuis le texte avec des indications entre crochets, comme `[whispering]`, `[excited]` ou `[laughing]`. Ces consignes modifient l’interprétation sans être prononcées. Si aucune voix n’est précisée, le service choisit une voix présélectionnée adaptée à la langue demandée.

L’usage du serveur MCP est prélevé sur les crédits inclus dans l’abonnement Fish Audio, comme dans l’application web. Il ne consomme pas les crédits de l’API destinée aux développeurs. Le connecteur propose ainsi une autre porte d’entrée : l’API et les SDK restent destinés aux intégrations logicielles, tandis que MCP place directement les fonctions vocales dans les échanges avec l’agent.