Stability AI ouvre Stable Audio 3.0, une famille de quatre modèles audio génératifs en open-weight
Stability AI lance Stable Audio 3.0, quatre modèles de génération musicale jusqu'à 2,7 milliards de paramètres, dont trois sont disponibles en open-weight.
Stable Audio 3.0 regroupe quatre modèles de génération musicale conçus pour des usages et des déploiements distincts. Trois d'entre eux, dont les paramètres vont de 459 millions à 1,4 milliard, sont diffusés en open-weight et téléchargeables sur Hugging Face. Le quatrième, plus lourd à 2,7 milliards de paramètres, reste réservé à un usage professionnel via l'API de Stability AI ou un hébergement sous licence entreprise.
La gamme permet de produire des effets sonores, des pistes courtes ou des chansons complètes, jusqu'à un peu plus de six minutes en longueur variable. Les modèles les plus légers fonctionnent sur appareils portables sans carte graphique dédiée. L'ensemble repose sur une architecture inédite, articulée autour d'un autoencodeur sémantique-acoustique qui assure une génération plus longue et plus souple.
Les sorties appartiennent à l'utilisateur, qui peut les distribuer et les commercialiser sous la Stability AI Community License jusqu'à un million de dollars de revenus. L'entraînement s'appuie sur un jeu de données entièrement licencié. Le fine-tuning par LoRA est pris en charge et documenté pour la première fois. En parallèle, une liste d'attente ouvre l'accès anticipé à une future suite d'outils destinée aux musiciens.