查看摘要
In this report, we introduce Qwen-Music, a powerful music generation model capable of producing highly musical and high-fidelity songs with complete vocal singing. Qwen-Music supports two core tasks: Text to Music Generation, which create entirely new songs from text descriptions, lyrics, and musical attributes, and Cover Song Generation, which reinterprets existing songs with different styles and vocal characteristics. Architecturally, Qwen-Music integrates three core components: Qwen-Music-Tokenizer, Qwen-Music-LLM, and Qwen-Music-Render. Qwen-Music-Tokenizer compresses audio into a 25 Hz single-codebook stream of Music Semantic Tokens that preserve semantic and melodic information for LLM prediction. Based on these tokens, Qwen-Music-LLM performs autoregressive music semantic modeling, with a key novelty being a melody-token-based chain-of-thought (Melody-CoT) mechanism that plans melodies before full-song generation, improving creativity, musicality, structural coherence, and reference-audio-based melody cloning. To overcome the fidelity limitations of discrete semantic tokens, Qwen-Music-Render performs generative stereo rendering, enriching acoustic details and producing high-fidelity stereo waveforms. Finally, we train Qwen-Music-LLM on more than 5 million hours of multilingual music data covering hundreds of languages. We first apply quality-aware pre-training curriculum, then use progressive post-training, comprising supervised initialization, offline DPO, and online GSPO, to further improve musicality and instruction-following ability. Across 600 Chinese and English prompts, Qwen-Music achieves state-of-the-art results in 13 of 16 objective musicality and audio-quality metrics. Professional evaluators also prefer Qwen-Music over leading proprietary systems. For cover song generation, Qwen-Music preserves reference melodies more accurately than leading proprietary systems.
📖 深度解读
好的,我将为您解读这篇关于 Qwen-Music 音乐生成模型的论文。
1. 一句话总结
Qwen-Music 是一个强大的音乐生成系统,它通过“先规划旋律,再生成歌曲,最后高保真渲染”的思路,解决了AI创作完整歌曲时旋律不稳、音质不佳的难题,并支持根据参考旋律翻唱歌曲。
2. 研究背景与动机
- 核心问题:如何生成一首音乐性强、结构连贯、人声清晰且音质达到高保真标准的完整歌曲。这需要同时处理好歌词、旋律、人声、伴奏和整体结构的长期依赖关系。
- 问题的重要性:当前的音乐生成模型虽然在进步,但生成具有稳定旋律发展、清晰歌词咬字、逼真演唱和自然伴奏的歌曲仍然极具挑战性。一个实用的系统还应允许用户控制风格、情绪等属性,并能基于参考旋律进行“翻唱”。
- 现有方法的不足:
- 语义与声学的错配:模型需要在语义层面规划歌词、旋律和结构,同时在声学层面渲染音色、相位等细节。直接生成波形计算量巨大,而使用离散token又容易丢失声学细节。
- 旋律控制缺失:文本描述通常只指定风格和歌词,无法精确控制歌曲的旋律走向,导致生成结果在音乐性上不可预测。
- 翻唱任务复杂:翻唱需要模型在保留原曲旋律的同时,自由改变编曲、演唱风格和人声,这对模型的控制力提出了更高要求。
3. 核心方法
Qwen-Music 的核心架构由三个组件构成,形成一个“语义规划-声学渲染”的流水线。
- 关键组件与创新点:
- Qwen-Music-Tokenizer(音乐分词器):将原始音频压缩成每秒25个的“音乐语义令牌”。它通过一个四阶段训练(自监督预训练、因果适配、多任务微调、矢量量化)的0.6B参数模型,确保这些令牌既足够紧凑(方便语言模型处理),又保留了歌词、旋律、和声等关键音乐语义信息。
- Qwen-Music-LLM(音乐语言模型):这是系统的“大脑”,负责根据文本描述和歌词,自回归地生成音乐语义令牌。其核心创新是Melody-CoT(旋律思维链)机制。
- 直觉解释:就像写文章前先列大纲,Melody-CoT 让模型在生成整首歌曲的复杂令牌之前,先生成一个粗略的、相对音高的旋律序列作为“计划”。这极大地提升了生成歌曲的旋律性、结构连贯性和创造力。
- 统一框架:这个旋律计划同样可以作为条件输入。对于翻唱任务,只需从参考音频中提取旋律令牌,与目标风格描述一同输入,模型就能生成遵循原曲旋律但风格全新的歌曲。
- Qwen-Music-Render(音乐渲染器):这是系统的“喉舌”,负责将语言模型生成的“音乐语义令牌”草图,渲染成高保真的48kHz立体声音频。它采用一个三阶段流程:
- 扩散Transformer (DiT):根据语义令牌和文本条件,生成连续的声学潜变量。
- Spec-VAE:将潜变量解码为粗糙的频谱图。
- Band-Mode Refiner(频段模式精炼器):一个轻量级模块,对频谱图进行“精修”,在不同频段分别修正相位和幅度误差,最终通过逆傅里叶变换合成高质量波形。
4. 实验与结果
- 数据集/基准:
- 训练数据:超过500万小时的多语言音乐数据。
- 评估基准:使用包含600个中英文提示的内部测试集,以及SongBench、SongEval、AudioBox-Aesthetic等客观指标。翻唱任务在AI生成和真实热门歌曲两个参考集上评估。
- 对比基线:与当前顶尖的商业系统对比,包括 Suno V5.5, Suno V5, Mureka V8, MiniMax Music 2.6/2.5+。
- 主要实验结果:
- 主观偏好(图2):在专业音乐人盲测中,Qwen-Music 的胜率显著优于除Suno V5.5外的所有系统。例如,对MiniMax 2.6的胜率为66.7%,对Suno V5为55.4%,与Suno V5.5基本持平(胜率50.3%)。
- 客观指标(表5):在16项音乐性与音质客观指标中,Qwen-Music 在13项上取得了最佳结果,尤其在旋律、编曲、人声质量和整体音乐性上表现突出。
- 翻唱性能(表6, 7):在AI生成的参考集上,Qwen-Music 的旋律保留准确度(Melody MAE)优于Suno V5.5和MiniMax Cover。在真实歌曲参考集上,其大部分指标也优于MiniMax Cover。
- 消融实验揭示了什么:
- 渲染器文本条件(表8):为渲染器提供歌词和音乐标签的文本条件,并使用“文本丢弃”的分类器自由引导策略,能显著提升最终音频质量。
- Band-Mode Refiner(表9):该精炼器能有效提升频谱重建质量,尤其是在感知相关的梅尔频谱距离指标上,从0.572降至0.461,证明了其有效性。
5. 优势与局限
- 本文方法的主要优势:
- 创新的旋律规划:Melody-CoT机制是核心亮点,它显式地解耦了旋律创作与歌曲生成,显著提升了生成音乐的旋律性和结构感。
- 统一的生成框架:巧妙地将“文本生成音乐”和“参考音频翻唱”两大任务统一在一个框架下,通过旋律令牌作为桥梁,实现了灵活的控制。
- 高质量渲染:通过“语义草图+生成式渲染+频段精炼”的级联方式,有效克服了离散令牌丢失声学细节的瓶颈,实现了高保真立体声输出。
- 局限性:
- 歌词可懂度非最优:尽管PER指标排名第二(6.10),但与最佳的Suno V5.5(4.19)相比仍有差距,表明在清晰咬字方面还有提升空间。
- 标签遵循能力有短板:在“流派”和“乐器”等标签的遵循度上,略逊于Mureka V8和Suno V5,说明对抽象风格属性的精确控制能力有待加强。
- 翻唱任务中的权衡:论文展示了两种Melody-CoT模式(section-level和unique-section-level),一种旋律跟随更准,另一种风格控制更好,表明在旋律保真度和风格控制自由度之间仍存在需要权衡的挑战。
6. 关键结论与启发
- 最重要的Takeaway:将“旋律规划”作为中间步骤引入音乐语言模型,是提升生成歌曲音乐性和结构性的有效策略。 这种“思维链”式的生成方式,为解决其他需要长期结构规划的生成任务提供了新思路。
- 对后续研究的启发与延伸方向:
- 更精细的控制:未来可以探索对演唱技巧、情感表达、演奏技法等更细粒度的控制,让生成音乐更具表现力。
- 更高效的结构建模:论文提到未来将探索更灵活的“长上下文音乐结构建模”,以处理更复杂的曲式结构。
- 渲染架构优化:研究更高效的渲染架构,在保持高音质的同时降低计算成本,是走向实时或大规模应用的关键。
- 多模态融合:Melody-CoT的思路可以扩展到视频配乐等领域,根据视频内容规划旋律,再生成与之匹配的音乐。
🔥 推荐必读
🏷️ 领域音乐生成 > 文本到音乐 (Text-to-Music)音乐生成 > 可控音乐生成
💡 创新旋律思维链(Melody-CoT)——基于自回归语言模型,通过先生成旋律规划序列再生成歌曲语义令牌的方式,提升长期结构连贯性
⭐ 评分8.5