説明
OpenAIによって開発されたJukeboxは、AIによる音楽生成に特化した高度なニューラルネットワークです。初歩的な歌声を含み、様々なジャンルやアーティストのスタイルを模倣する能力を持ち、生のオーディオとして直接音楽を生成します。これは、記号的な音楽生成を超えて、生のオーディオのニュアンスを捉える生成モデルにおける重要な進歩を示しています。
Jukeboxは、階層的なVQ-VAE(Vector Quantized Variational Autoencoder)モデルを使用して、生のオーディオを離散的で低次元の空間に圧縮します。この圧縮は、オーディオデータに固有の非常に長いシーケンスを処理するために不可欠であり、モデルが高レベルのセマンティック構造を学習することを可能にします。VQ-VAEアーキテクチャはVQ-VAE-2に触発されており、コードブックの崩壊に対処し、スペクトル損失の追加を含む再構築品質を向上させるための変更が加えられています。モデルは、44kHzの生のオーディオを8倍、32倍、128倍にダウンサンプリングする3つの圧縮レベルを使用し、ピッチ、音色、音量などの不可欠な音楽情報を保持します。
オーディオ圧縮の後、トランスフォーマーモデルがプライアモデルとして学習され、これらの圧縮されたオーディオコードの分布を学習します。これらのプライアは離散空間で音楽を生成し、最上位のプライアは長距離構造を捉え、下位のプライアは局所的な音楽的詳細を追加します。モデルは、Sparse Transformersの簡略化されたバリアントを使用して自己回帰的に学習され、各モデルは72層のファクタライズド自己注意機構を備えています。この階層的なアプローチにより、Jukeboxは印象的なオーディオ品質で一貫した楽曲を生成できます。
Jukeboxは、ジャンル、アーティスト、歌詞などの様々な入力に基づいて条件付けできます。これらをインプットとして提供することで、ユーザーは望むスタイルで音楽を生成するように生成プロセスを誘導できます。このモデルは、LyricWikiからの歌詞とメタデータとペアになった120万曲の大規模データセットで学習されました。特に歌詞に基づく条件付けは、歌詞の内容と対応するオーディオセグメントを一致させるための高度なアライメント技術を必要とし、歌声生成のモデルの能力を向上させました。
その能力にもかかわらず、Jukeboxには限界があります。生成された楽曲には、繰り返しのコーラスのような一般的な大きな音楽構造が欠けている場合があり、ダウンサンプリング/アップサンプリングプロセスで識別可能なノイズが発生する可能性があります。サンプリングプロセスも遅く、1分間のオーディオをレンダリングするのに約9時間かかるため、インタラクティブなアプリケーションには適していません。今後の作業では、音楽性、ノイズの低減、サンプリング速度の向上を目指しており、並列サンプラーへの蒸留を通じて実現される可能性があります。OpenAIはまた、モデルの範囲を他の言語や地域の楽曲を含めるように拡大し、音楽制作における人間とモデルの協調を促進する予定です。
Jukeboxのハイライト
生のオーディオとして音楽を生成
初歩的な歌声生成機能を搭載
ジャンル、アーティスト、歌詞に基づく条件付けをサポート
様々な音楽ジャンルを模倣
様々なアーティストのスタイルを模倣
オーディオ圧縮に階層型VQ-VAEを使用
コード生成にトランスフォーマーモデルを採用
120万曲の大規模データセットで学習済み
モデルの重みとコードは公開済み
生成されたサンプルを探索するためのツールを含む
複数の圧縮レベルで音楽を出力
長距離の音楽構造を学習
Jukeboxをはじめる
モデルの重みとコードにアクセスする: 提供されたGitHubリポジトリから、公開されているJukeboxモデルと関連コードをダウンロードします。
入力データを準備する: 音楽生成のために、希望するジャンル、アーティスト、歌詞の情報を収集します。
生成パラメータを設定する: 希望するオーディオ品質、長さ、条件付け入力のパラメータを設定します。
生成プロセスを実行する: Jukeboxモデルを実行して、生のオーディオ音楽サンプルを生成します。
生成されたサンプルを探索する: 提供されたツールを使用して、出力を聴き、分析します。
プロジェクトに統合する: 公開されているコードをカスタム音楽生成アプリケーションに合わせて調整します。
Jukeboxの使用例
- AI音楽生成
- 音楽スタイルの模倣
- 初歩的な歌声合成
- 創造的な音楽探求
- サウンドトラック作曲
- 音楽研究




