MiniMax 发布 MiniMax-Music3:首个开源长音频音乐生成模型,一次生成 5 分钟完整歌曲

近日,AI 领域迎来了一项备受瞩目的进展。国内 AI 初创公司 MiniMax 正式对外发布了其最新的文本转音乐模型——MiniMax-Music3。这款模型的发布不仅标志着 AI 音乐生成技术向着“长音频”和“高保真”方向迈出了关键一步,更重要的是,它采取了开放权重的策略,为开发者社区和独立创作者提供了极大的便利。

MiniMax-Music3 的核心亮点在于其能够生成长达 5 分钟的完整歌曲。在以往的 AI 音乐生成领域,大多数模型生成的音频长度通常在几十秒到一两分钟之间,往往只能作为背景音乐片段或短视频配乐。而 MiniMax-Music3 则突破了这一限制,它允许用户在输入歌词的同时,利用章节标签和结构化描述,让模型一次性生成结构完整、时长可达 5 分钟的完整乐曲。这种“端到端”的生成能力,极大地简化了音乐创作的工作流。

从技术规格来看,MiniMax-Music3 输出的是 32kHz、16 位立体声的 WAV 格式音频文件。这一高采样率和位深确保了生成的音乐具有接近原声的高保真度,能够满足专业音频制作和高质量媒体内容的需求。模型在生成过程中,能够严格遵循用户指定的结构标签(如主歌 Verse、副歌 Chorus、桥段 Bridge 等)进行编排,保证了歌曲旋律的连贯性和逻辑性。

与传统商业化的封闭模型不同,MiniMax-Music3 的一个显著特征是“开放权重”。这意味着模型的核心参数是公开的,开发者不仅可以直接下载模型进行本地部署,还可以根据自身需求对模型进行微调。这对于学术研究、特定风格的定制化开发以及开源社区的贡献都具有重要意义。MarkTechPost 在报道中特别提到,该模型提供了三种不同的服务路径,这为不同规模的应用场景提供了灵活的部署方案。

MiniMax-Music3 的出现,进一步加剧了 AI 音乐生成领域的竞争格局。目前市场上,Suno 和 Udio 等商业产品占据了主导地位,但它们通常采用订阅制且模型参数不公开。MiniMax 通过开放权重和长音频生成的优势,为用户提供了更多元的选择。对于独立音乐人、游戏开发者以及内容创作者而言,这意味着他们可以更自由地获取高质量的生成式音乐素材,而无需受限于商业平台的版权条款或生成长度限制。

此外,结构化描述的引入也是该模型的一大创新。用户不仅需要提供歌词,还可以输入关于音乐风格(如 Jazz, Pop)、乐器配置(如 Piano, Drums)以及情绪氛围的详细描述。这种“歌词+结构+元数据”的输入方式,让 AI 对音乐的理解更加深入,从而生成更符合用户预期的作品。

总结来说,MiniMax-Music3 的发布不仅是技术参数的更新,更是 AI 音乐生成范式的一次转变。它证明了 AI 在处理长序列音频时的能力,并通过开放策略降低了技术门槛。随着更多开发者基于此模型进行二次开发,我们有理由期待未来会出现更多风格独特、高质量的 AI 生成音乐作品。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/17/minimax-releases-minimax-music3/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注