Cinq minutes de musique générée avec MiniMax Music 3
MiniMax Music 3 génère des morceaux jusqu’à cinq minutes avec contrôle des paroles, de l’arrangement et de la structure musicale.
MiniMax Music 3 génère des morceaux complets pouvant atteindre cinq minutes à partir de paroles et d’une description musicale détaillée. Le modèle cherche notamment à maintenir sur la durée les thèmes, le rythme, l’identité vocale et l’évolution de l’arrangement, avec des structures pouvant inclure intro, couplets, refrains, ponts, passages instrumentaux et outro.
Le contrôle repose sur deux entrées complémentaires. Les paroles peuvent intégrer des balises comme `[Verse]`, `[Chorus]`, `[Bridge]` ou `[Solo]`, tandis qu’une description séparée définit le genre, le BPM, la tonalité, la progression émotionnelle, les caractéristiques vocales, les instruments et leur évolution au fil du morceau. MiniMax fournit également un outil capable de transformer une instruction courte en Structured Caption plus détaillée.
L’architecture sépare la cohérence globale du morceau de ses détails acoustiques. Un Global LLM de 8 milliards de paramètres, initialisé à partir de Qwen3-8B, s’occupe de la progression musicale à long terme. Un Local LLM de 600 millions de paramètres complète ensuite les informations acoustiques à l’échelle de chaque frame. Les états internes des deux modèles sont fusionnés avant une étape de Flow Matching de 2,4 milliards de paramètres puis un Flow-VAE chargé de reconstruire le signal audio.
Cette organisation évite de reposer uniquement sur les tokens discrets du tokenizer lors de la synthèse finale. MiniMax indique que les représentations continues issues des LLM permettent de conserver davantage d’informations concernant l’articulation vocale, les textures instrumentales et la continuité temporelle. Le résultat est produit en WAV stéréo 32 kHz, 16 bits.
Le modèle est téléchargeable et peut être exécuté avec SGLang-Omni, Diffusers ou ComfyUI. La documentation Diffusers indique qu’une exécution en pleine précision peut tenir sur une carte disposant de moins de 24 Go de VRAM, avec environ 22 Go en utilisant l’offloading CPU. Un mode plus lent permet également de descendre jusqu’à 8 Go de VRAM en chargeant progressivement les couches du language model.
Cette ouverture vers l’exécution locale reste accompagnée de plusieurs limites. La génération fonctionne actuellement uniquement en mode non-streaming, le prompt textuel est limité à 5 000 tokens et la sortie à 9 000 frames acoustiques. MiniMax précise également que les indications de tempo, tonalité, instrumentation, paroles ou structure constituent des contrôles génératifs et non des garanties strictes : le résultat peut s’écarter de certaines instructions.