描述
Jukebox 由 OpenAI 开发,是一款先进的神经网络,专为人工智能音乐生成而设计。它直接以原始音频形式生成音乐,能够包含初步的人声并模仿各种流派和艺术家风格。这代表了生成模型的一项重大进步,超越了符号音乐生成,捕捉了原始音频的细微差别。
Jukebox 的核心采用分层 VQ-VAE(向量量化变分自编码器)模型,将原始音频压缩到离散的低维空间。这种压缩对于处理音频数据固有的极长序列至关重要,使模型能够学习高级语义结构。VQ-VAE 架构的灵感来自 VQ-VAE-2,并进行了修改以解决码本坍塌问题并提高重建质量,包括添加了频谱损失。该模型使用三个压缩级别,将 44kHz 的原始音频分别下采样 8 倍、32 倍和 128 倍,保留了音高、音色和音量等基本音乐信息。
在音频压缩之后,训练 Transformer 模型作为先验模型来学习这些压缩音频码的分布。这些先验模型在离散空间中生成音乐,顶层先验模型捕捉长程结构,底层先验模型添加局部音乐细节。模型使用稀疏 Transformer 的简化变体进行自回归训练,每个模型具有 72 层因子化自注意力。这种分层方法使 Jukebox 能够生成具有令人印象深刻的音频质量的连贯音乐作品。
Jukebox 可以根据流派、艺术家和歌词等各种输入进行条件化。通过将这些作为输入,用户可以引导生成过程以所需的风格创作音乐。该模型在包含 120 万首歌曲的大型数据集上进行了训练,这些歌曲与 LyricWiki 的歌词和元数据配对。特别是歌词的条件化,需要复杂的对齐技术才能将歌词内容与相应的音频片段匹配,从而增强了模型生成人声的能力。
尽管功能强大,Jukebox 仍存在局限性。生成的歌曲可能缺乏熟悉的较大音乐结构,例如重复的副歌,并且下采样/上采样过程可能会引入可辨别的噪声。采样过程也很慢,渲染一分钟音频大约需要 9 小时,因此不适合交互式应用。未来的工作旨在提高音乐性、减少噪声并提高采样速度,可能通过蒸馏到并行采样器来实现。OpenAI 还计划将模型的范围扩展到包括其他语言和地区的歌曲,以促进人机在音乐创作中的协作。
Jukebox亮点
以原始音频形式生成音乐
包含初步的人声合成能力
支持根据流派、艺术家和歌词进行条件化
模仿各种音乐流派
模仿各种艺术家风格
利用分层 VQ-VAE 进行音频压缩
采用 Transformer 模型生成代码
在包含 120 万首歌曲的大型数据集上进行训练
模型权重和代码已公开发布
包含一个用于探索生成样本的工具
以多个压缩级别输出音乐
学习长程音乐结构
Jukebox入门
访问模型权重和代码:从提供的 GitHub 存储库下载已发布的 Jukebox 模型及相关代码。
准备输入数据:收集所需的流派、艺术家和歌词信息以进行音乐生成。
配置生成参数:设置所需音频质量、长度和条件化输入的参数。
运行生成过程:执行 Jukebox 模型以生成原始音频音乐样本。
探索生成样本:使用提供的工具收听和分析输出。
集成到项目中:为自定义音乐生成应用程序改编已发布的代码。
Jukebox的使用案例
- AI 音乐生成
- 音乐风格模仿
- 初步人声合成
- 创意音乐探索
- 配乐创作
- 音乐研究




