説明
MusicLMは、Google Researchによって開発された、テキストの説明から直接高忠実度の音楽を生成するための高度なAIモデルです。この革新的なシステムは、条件付き音楽生成の複雑なプロセスを、階層的なシーケンス・ツー・シーケンス・モデリングタスクとして捉えています。24kHzのサンプリングレートで音楽を生成でき、数分間という長時間の再生においても驚くほど一貫性を保ちます。
実験により、MusicLMは生成されるオーディオの品質と、提供されたテキストプロンプトへの忠実度の両方において、既存のシステムを大幅に上回ることが示されています。単純なテキストから音楽への生成を超えて、MusicLMはテキストと既存のメロディーの両方による条件付けを含む高度な機能を提供します。これにより、ユーザーは口ずさんだりハミングしたりしたメロディーを、テキストキャプションで指定されたスタイルに合わせて変換することができ、音楽の創造性と操作の新たな道が開かれます。
このモデルの汎用性は、リッチなキャプションに基づいて音楽を生成する能力によってさらに強調されており、ジャンル、楽器、ムードの詳細な説明に一致するオーディオを生成します。例えば、アーケードゲームのメインサウンドトラック、レゲトンとエレクトロニックダンスミュージックのフュージョンでスペーシーなサウンドのもの、またはゆったりとした雰囲気のテンポの遅いレゲエソングを作成できます。
MusicLMは「ストーリーモード」生成もサポートしており、一連のテキストプロンプトがモデルの音楽の継続方法に影響を与え、進化するサウンドスケープを作成します。さらに、視覚芸術による条件付けも可能で、サルバドール・ダリの「記憶の固執」やアンリ・マティスの「ダンス」のような絵画にインスパイアされた音楽を生成できます。
この分野でのさらなる研究開発を促進するため、Google Researchは、専門家によって慎重に提供されたリッチなテキスト説明を特徴とする5.5千の音楽とテキストのペアからなるデータセットであるMusicCapsを公開しました。このリリースは、AI駆動の音楽制作と分析の進歩を加速することを目的としています。
MusicLMのハイライト
テキストの説明から高忠実度の音楽を生成
24kHzサンプリングレートでオーディオを生成
数分間、音楽の一貫性を維持
オーディオ品質で従来のシステムを上回る
テキストの説明への高い忠実度を達成
テキストとメロディーの両方による条件付けをサポート
テキストスタイルに基づいて口ずさんだりハミングしたりしたメロディーを変換
リッチなキャプションから音楽を生成
進化する音楽のためのシーケンシャルテキストプロンプトをサポート(「ストーリーモード」)
視覚芸術(絵画)にインスパイアされた音楽を生成可能
MusicCapsデータセットを公開(5.5k音楽-テキストペア)
MusicLMをはじめる
モデルにアクセス: 利用可能なインターフェースまたはAPIを通じてMusicLMモデルを利用します。
テキストプロンプトを提供: 希望する音楽の詳細なテキスト説明を入力します。
オプションのメロディー条件付け: 生成をガイドするためにメロディー(ハミングまたは口ずさみ)を提供します。
オーディオを生成: 音楽生成プロセスを開始します。
出力を調整: 希望する音楽的特性のためにプロンプトまたはメロディーを調整します。
統合: 生成された音楽をプロジェクトまたはアプリケーションに組み込みます。
MusicLMの使用例
- 音楽生成
- サウンドトラック作成
- メロディー変換
- 創造的探求
- データセット拡張
- 芸術的インスピレーション


