MiniMax发布音乐生成大模型Music3:支持5分钟完整歌曲生成,采用分层自回归架构
SmartHey8月14日消息,MiniMax于8月14日正式发布全新音乐生成模型MiniMax-Music3,支持根据用户输入的歌词与音乐描述,端到端生成最长5分钟的高质量完整歌曲。
该模型创新性地采用分层自回归架构,兼顾宏观结构控制与微观声学细节还原:
Global LLM(全局语言模型)参数量为8B,负责逐帧预测首个RVQ码本,精准建模整首歌曲的长程语义连贯性、段落逻辑与结构演进(如主歌→副歌→桥段等);其基座基于Qwen3-8B初始化,训练阶段首先适配音乐专属语义词元的嵌入层与输出层,再与Local LLM协同联合建模全部RVQ码本。
Local LLM(局部语言模型)参数量为0.6B,专注于每帧内其余声学RVQ码本的精细化预测,高效重建音高、音色、动态与空间感等细粒度声学特征。
在输出能力上,MiniMax-Music3可生成最高达5分钟的单曲,输出格式为32kHz采样率、16-bit精度的立体声WAV文件,满足专业级音频交付需求。
据官方介绍,模型在长时序生成中显著提升稳定性,能持续保持统一的音乐主题、稳定节奏律动、人声演唱身份一致性以及编曲的自然推进,完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏及尾奏等标准流行音乐结构。
