跳转到主要内容
ToolPotion

Jukebox | OpenAI

Jukebox 是一个神经网络,可以生成包括初步人声在内的原始音频音乐。它可以创作各种流派和艺术家风格的音乐,为人工智能驱动的音乐创作提供了一种新颖的方法。模型权重和代码已发布,并附带一个用于探索生成样本的工具。

访问URL

描述

Jukebox 由 OpenAI 开发,是一款先进的神经网络,专为人工智能音乐生成而设计。它直接以原始音频形式生成音乐,能够包含初步的人声并模仿各种流派和艺术家风格。这代表了生成模型的一项重大进步,超越了符号音乐生成,捕捉了原始音频的细微差别。

Jukebox 的核心采用分层 VQ-VAE(向量量化变分自编码器)模型,将原始音频压缩到离散的低维空间。这种压缩对于处理音频数据固有的极长序列至关重要,使模型能够学习高级语义结构。VQ-VAE 架构的灵感来自 VQ-VAE-2,并进行了修改以解决码本坍塌问题并提高重建质量,包括添加了频谱损失。该模型使用三个压缩级别,将 44kHz 的原始音频分别下采样 8 倍、32 倍和 128 倍,保留了音高、音色和音量等基本音乐信息。

在音频压缩之后,训练 Transformer 模型作为先验模型来学习这些压缩音频码的分布。这些先验模型在离散空间中生成音乐,顶层先验模型捕捉长程结构,底层先验模型添加局部音乐细节。模型使用稀疏 Transformer 的简化变体进行自回归训练,每个模型具有 72 层因子化自注意力。这种分层方法使 Jukebox 能够生成具有令人印象深刻的音频质量的连贯音乐作品。

Jukebox 可以根据流派、艺术家和歌词等各种输入进行条件化。通过将这些作为输入,用户可以引导生成过程以所需的风格创作音乐。该模型在包含 120 万首歌曲的大型数据集上进行了训练,这些歌曲与 LyricWiki 的歌词和元数据配对。特别是歌词的条件化,需要复杂的对齐技术才能将歌词内容与相应的音频片段匹配,从而增强了模型生成人声的能力。

尽管功能强大,Jukebox 仍存在局限性。生成的歌曲可能缺乏熟悉的较大音乐结构,例如重复的副歌,并且下采样/上采样过程可能会引入可辨别的噪声。采样过程也很慢,渲染一分钟音频大约需要 9 小时,因此不适合交互式应用。未来的工作旨在提高音乐性、减少噪声并提高采样速度,可能通过蒸馏到并行采样器来实现。OpenAI 还计划将模型的范围扩展到包括其他语言和地区的歌曲,以促进人机在音乐创作中的协作。

Jukebox亮点

  • 以原始音频形式生成音乐

  • 包含初步的人声合成能力

  • 支持根据流派、艺术家和歌词进行条件化

  • 模仿各种音乐流派

  • 模仿各种艺术家风格

  • 利用分层 VQ-VAE 进行音频压缩

  • 采用 Transformer 模型生成代码

  • 在包含 120 万首歌曲的大型数据集上进行训练

  • 模型权重和代码已公开发布

  • 包含一个用于探索生成样本的工具

  • 以多个压缩级别输出音乐

  • 学习长程音乐结构

Jukebox入门

  1. 访问模型权重和代码:从提供的 GitHub 存储库下载已发布的 Jukebox 模型及相关代码。

  2. 准备输入数据:收集所需的流派、艺术家和歌词信息以进行音乐生成。

  3. 配置生成参数:设置所需音频质量、长度和条件化输入的参数。

  4. 运行生成过程:执行 Jukebox 模型以生成原始音频音乐样本。

  5. 探索生成样本:使用提供的工具收听和分析输出。

  6. 集成到项目中:为自定义音乐生成应用程序改编已发布的代码。

Jukebox的使用案例

  • AI 音乐生成
  • 音乐风格模仿
  • 初步人声合成
  • 创意音乐探索
  • 配乐创作
  • 音乐研究

Jukebox的常见问题

Jukebox 评价

加载中...

与 Jukebox 类似的热门AI工具

AI GitHub 仓库

Audiocraft 是一个用于深度学习音频生成和处理的 PyTorch 库。它提供了像 MusicGen(用于可控音乐生成)和 AudioGen(用于文本到声音)这样的最先进模型。该库还包含 EnCodec 音频压缩器和用于研究的训练代码。

AI 音乐生成器

AI 模型

AudioGen 是一个自回归生成式 AI 模型,可根据描述性文本标题创建音频样本。它解决了音频生成中的挑战,例如分离声源、处理现实世界噪声以及文本标注稀缺的问题。该模型在学习到的离散音频表示上运行,以实现高保真输出。

AI 音乐生成器

Lyria 3.5 是 Google DeepMind 开发的先进音乐生成模型,帮助用户轻松创作歌曲。它提供技术控制和在各种流派中创作曲目的能力,使音乐创作变得可及且富有创新性。

精选AI 音乐生成器

AI 模型

MusicLM 是一个 AI 模型,可以根据文本描述生成高保真音乐。它可以生成长达 24 kHz 的音乐,并在数分钟内保持一致性,在音频质量和文本遵循度方面优于之前的系统。它还支持旋律条件生成。

AI 音乐生成器

AI 模型

AudioLDM 是一个利用潜在扩散模型进行文本到音频生成的框架。它将各种模态转换为统一的“音频语言”(LOA),用于生成语音、音乐和音效。这种方法支持上下文学习,并利用自监督预训练模型进行多功能音频创作。

AI 音乐生成器

Google Flow Music 是一个生成式 AI 平台,用于创作、混音和分享录音室品质的歌曲。它允许用户指导 AI 音乐视频,使用 vibe-code 发明新乐器,并轻松个性化他们的声音,所有这些都在一个集成的录音室环境中完成。

精选AI 音乐生成器

SongAI 的 AI 音乐生成器可创建带有男声或女声的原创音乐,支持 MP3 音频和 MP4 视频。可从音频文件或您自己的声音生成音乐。探索自定义模式,增强风格,并即时享受为各种创意需求打造的创新、无与伦比的音乐。

AI 音乐生成器

AI Music Generator 是一个文本转音乐的平台,可以在不到一分钟的时间内创建超过 50 种风格的专业质量歌曲,提供编辑工具、音轨分离和付费计划的完整商业权利。

AI 音乐生成器媒体与娱乐