メインコンテンツへスキップ
ToolPotion

Jukebox | OpenAI

Jukeboxは、生のオーディオとして、初歩的な歌声を含む音楽を生成するニューラルネットワークです。様々なジャンルやアーティストのスタイルで楽曲を生成でき、AIによる音楽制作に新しいアプローチを提供します。モデルの重みとコード、生成されたサンプルを探索するためのツールが公開されています。

URLを訪問

説明

OpenAIによって開発されたJukeboxは、AIによる音楽生成に特化した高度なニューラルネットワークです。初歩的な歌声を含み、様々なジャンルやアーティストのスタイルを模倣する能力を持ち、生のオーディオとして直接音楽を生成します。これは、記号的な音楽生成を超えて、生のオーディオのニュアンスを捉える生成モデルにおける重要な進歩を示しています。

Jukeboxは、階層的なVQ-VAE(Vector Quantized Variational Autoencoder)モデルを使用して、生のオーディオを離散的で低次元の空間に圧縮します。この圧縮は、オーディオデータに固有の非常に長いシーケンスを処理するために不可欠であり、モデルが高レベルのセマンティック構造を学習することを可能にします。VQ-VAEアーキテクチャはVQ-VAE-2に触発されており、コードブックの崩壊に対処し、スペクトル損失の追加を含む再構築品質を向上させるための変更が加えられています。モデルは、44kHzの生のオーディオを8倍、32倍、128倍にダウンサンプリングする3つの圧縮レベルを使用し、ピッチ、音色、音量などの不可欠な音楽情報を保持します。

オーディオ圧縮の後、トランスフォーマーモデルがプライアモデルとして学習され、これらの圧縮されたオーディオコードの分布を学習します。これらのプライアは離散空間で音楽を生成し、最上位のプライアは長距離構造を捉え、下位のプライアは局所的な音楽的詳細を追加します。モデルは、Sparse Transformersの簡略化されたバリアントを使用して自己回帰的に学習され、各モデルは72層のファクタライズド自己注意機構を備えています。この階層的なアプローチにより、Jukeboxは印象的なオーディオ品質で一貫した楽曲を生成できます。

Jukeboxは、ジャンル、アーティスト、歌詞などの様々な入力に基づいて条件付けできます。これらをインプットとして提供することで、ユーザーは望むスタイルで音楽を生成するように生成プロセスを誘導できます。このモデルは、LyricWikiからの歌詞とメタデータとペアになった120万曲の大規模データセットで学習されました。特に歌詞に基づく条件付けは、歌詞の内容と対応するオーディオセグメントを一致させるための高度なアライメント技術を必要とし、歌声生成のモデルの能力を向上させました。

その能力にもかかわらず、Jukeboxには限界があります。生成された楽曲には、繰り返しのコーラスのような一般的な大きな音楽構造が欠けている場合があり、ダウンサンプリング/アップサンプリングプロセスで識別可能なノイズが発生する可能性があります。サンプリングプロセスも遅く、1分間のオーディオをレンダリングするのに約9時間かかるため、インタラクティブなアプリケーションには適していません。今後の作業では、音楽性、ノイズの低減、サンプリング速度の向上を目指しており、並列サンプラーへの蒸留を通じて実現される可能性があります。OpenAIはまた、モデルの範囲を他の言語や地域の楽曲を含めるように拡大し、音楽制作における人間とモデルの協調を促進する予定です。

Jukeboxのハイライト

  • 生のオーディオとして音楽を生成

  • 初歩的な歌声生成機能を搭載

  • ジャンル、アーティスト、歌詞に基づく条件付けをサポート

  • 様々な音楽ジャンルを模倣

  • 様々なアーティストのスタイルを模倣

  • オーディオ圧縮に階層型VQ-VAEを使用

  • コード生成にトランスフォーマーモデルを採用

  • 120万曲の大規模データセットで学習済み

  • モデルの重みとコードは公開済み

  • 生成されたサンプルを探索するためのツールを含む

  • 複数の圧縮レベルで音楽を出力

  • 長距離の音楽構造を学習

Jukeboxをはじめる

  1. モデルの重みとコードにアクセスする: 提供されたGitHubリポジトリから、公開されているJukeboxモデルと関連コードをダウンロードします。

  2. 入力データを準備する: 音楽生成のために、希望するジャンル、アーティスト、歌詞の情報を収集します。

  3. 生成パラメータを設定する: 希望するオーディオ品質、長さ、条件付け入力のパラメータを設定します。

  4. 生成プロセスを実行する: Jukeboxモデルを実行して、生のオーディオ音楽サンプルを生成します。

  5. 生成されたサンプルを探索する: 提供されたツールを使用して、出力を聴き、分析します。

  6. プロジェクトに統合する: 公開されているコードをカスタム音楽生成アプリケーションに合わせて調整します。

Jukeboxの使用例

  • AI音楽生成
  • 音楽スタイルの模倣
  • 初歩的な歌声合成
  • 創造的な音楽探求
  • サウンドトラック作曲
  • 音楽研究

JukeboxのFAQ

Jukebox のレビュー

読み込み中...

Jukebox に似た人気のAIツール

AI GitHub リポジトリ

Audiocraftは、オーディオ生成および処理のためのPyTorchライブラリです。制御可能な音楽生成のためのMusicGenや、テキストからサウンドへのAudioGenなどの最先端モデルを提供します。このライブラリには、オーディオ圧縮器であるEnCodecと、研究用のトレーニングコードも含まれています。

AI音楽ジェネレーター

AI モデル

AudioGenは、説明的なテキストキャプションに基づいてオーディオサンプルを作成する自己回帰型生成AIモデルです。ソースの分離、実世界のノイズの処理、テキストアノテーションの不足といったオーディオ生成における課題に対処します。このモデルは、高忠実度の出力を実現するために、学習済みの離散オーディオ表現上で動作します。

AI音楽ジェネレーター

Lyria 3.5は、Google DeepMindによる高度な音楽生成モデルで、ユーザーが簡単に曲を作曲できるよう支援します。技術的なコントロールを提供し、さまざまなジャンルのトラックを作成できるため、音楽制作がアクセスしやすく革新的になります。

注目AI音楽ジェネレーター

AI モデル

MusicLMは、テキストの説明から高忠実度の音楽を生成するAIモデルです。最大24kHzの音楽を数分間一貫して生成でき、オーディオ品質とテキストへの忠実度において従来のシステムを上回ります。メロディーによる条件付けもサポートしています。

AI音楽ジェネレーター

AI モデル

AudioLDMは、潜在拡散モデルを活用したテキストからオーディオへの生成フレームワークです。様々なモダリティを統一された「オーディオ言語(LOA)」に変換し、音声、音楽、効果音を生成します。このアプローチにより、インコンテキスト学習が可能になり、自己教師あり事前学習済みモデルを活用して多様なオーディオ作成を実現します。

AI音楽ジェネレーター

AI アプリ

Google Flow Musicは、スタジオ品質の楽曲を作成、リミックス、共有できる生成AIプラットフォームです。統合されたスタジオ環境内で、ユーザーはAIによるミュージックビデオのディレクション、Vibe-codeによる新しい楽器の発明、サウンドの簡単なパーソナライズが可能です。

注目AI音楽ジェネレーター

SongAIのAIミュージックジェネレーターは、男性または女性ボーカル、MP3オーディオ、MP4ビデオでオリジナルの音楽を作成します。オーディオファイルやご自身の声から音楽を生成できます。カスタムモードを探求し、スタイルを強化して、様々なクリエイティブなニーズに対応する革新的で比類のない音楽を即座に楽しんでください。

AI音楽ジェネレーター

AI Music Generatorは、50以上のスタイルでスタジオ品質の曲を1分以内に作成するテキストから音楽へのプラットフォームで、編集ツール、ステム分離、そして有料プランでの完全な商業権を提供します。

AI音楽ジェネレーターメディア・エンターテインメント