人人都是音乐家!中科大&科大讯飞重磅开源OpenMusic:音乐生成更高质量,更有乐感

质量 生成 音乐 文本 感知
发布于 2025-05-17
1698

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:

提出了一种质量感知训练策略与Masked扩散Transformer架构,用于解决音乐生成领域的质量低、文本对齐度差等问题,并显著提升生成音乐的质量和美学性。

关键要点:

  • 创新提出质量感知训练策略,使模型能够辨别训练数据质量并生成高质量音乐。
  • 引入Masked扩散Transformer架构以优化音乐信号潜在空间的建模效果。
  • 通过优化音乐数据标注处理,解决低质量字幕和文本对齐度差的问题。
  • 实验结果表明,提出的方法在多项指标上优于传统U-Net架构,生成质量和美学性均显著提升。
  • 结合粗粒度文本控制和细粒度token控制,实现模型解耦与高质量音频生成。

内容结构:

背景

介绍文本到音乐(TTM)生成领域现状与挑战,包括开源数据集质量低、文本与音频对齐度差等问题。重点阐述这些问题对音乐生成模型发展的限制。

创新方法及思路

质量信息注入

提出质量感知训练策略,通过MOS评分模型注入音频质量信息。采用两种策略:粗粒度方法嵌入质量文本,细粒度方法使用质量token进行控制。

质量感知型Masked扩散Transformer

从音乐性建模角度优化Transformer架构,加入频谱掩码以加速收敛,显著提升质量感知能力和音乐生成的美学性。

优化音乐标注描述

使用预训练标注模型(LP-Musiccaps)优化大规模音乐数据标注,通过过滤低质量数据并融合原始标注信息,解决文本标注不准确的问题。

实验

对比多种架构与策略,包括U-Net与Transformer架构、质量感知消融实验等,证明Masked扩散Transformer在生成质量与指标上的显著优势。

结论与展望

识别并解决了音频质量低与文本未对齐的挑战,提出的质量感知方法与Masked扩散Transformer显著提升了音乐生成的质量和音乐性,为文本到音乐生成领域提供了新方向。

文章总结:

研究通过创新性的质量感知训练策略和架构优化,解决了音乐生成领域的核心挑战,并为未来高质量音乐生成模型的发展提供了重要参考。

AI生成未来