説明
SoundStormは、非常に効率的で非自己回帰的なオーディオ生成のために設計された高度なAIモデルです。AudioLMからのセマンティックトークンを入力として受け取り、双方向アテンションと信頼度ベースの並列デコーディングを利用して、ニューラルオーディオコーデックのトークンを生成します。このアプローチにより、オーディオ生成が大幅に高速化され、AudioLMの自己回帰生成と比較して数百分の一の速度を達成します。
このモデルは、同等の品質と、音声および音響条件における優れた一貫性を、前モデルと比較して生成することに優れています。重要な機能として、TPU-v4上でわずか0.5秒で30秒のオーディオを生成できる能力があります。SoundStormは、より長いオーディオシーケンスに対するスケーラビリティを示し、高品質で自然な対話セグメントの合成を可能にします。これは、話者のターンが注釈付けされたトランスクリプトと、希望する話者からの短い音声プロンプトを条件として合成することで実現されます。
SPEAR-TTSのようなテキストからセマンティックへのモデリングステージと統合すると、SoundStormは自然に聞こえる対話を合成できます。ユーザーは、トランスクリプトを通じて話される内容、短い音声プロンプトを介して話者の声、話者のターン注釈を介して会話の流れを正確に制御できます。例えば、30秒の対話セグメントの合成は、トレーニング中に見られなかったテキストや話者であっても、単一のTPU-v4上でわずか2秒で完了します。
SoundStormは、プロンプトなしおよびプロンプトありのオーディオ生成の両方の機能を提供します。プロンプトなしのシナリオでは、異なる話者をサンプリングしますが、プロンプトありの場合、話者の声を高い忠実度で維持します。これにより、さまざまなオーディオ合成タスクのための強力なツールとなります。AudioLMや貪欲デコーディングなどのベースラインメソッドと比較して、SoundStormは、プロンプトからの音響の一貫性と音声の保持を改善し、オーディオ品質も向上させます。
モデルの効率的な生成パイプラインにより、オーディオ生成の研究がよりアクセスしやすくなります。声の模倣能力は、なりすましなどの悪用の可能性に関する懸念を引き起こしますが、安全策が開発されています。SoundStormによって生成されたオーディオは、専用の分類器によって検出可能であることが示されており、一部のリスクが軽減されています。この研究は、オーディオ生成技術を責任を持って進歩させることを目指しています。
SoundStormのハイライト
効率的な非自己回帰オーディオ生成
AudioLMより数百分の一の速度でオーディオを生成
音声と音響条件の高い一貫性を維持
話者制御による自然な対話セグメントの合成
AudioLMからのセマンティックトークンを入力として受け入れる
双方向アテンションと信頼度ベースの並列デコーディングを利用
より長いオーディオシーケンスへのスケーラビリティ
コンテンツ、音声、話者のターンを制御した対話合成をサポート
テキストからセマンティックモデルへのオーディオ生成が可能
プロンプト生成における高い音響一貫性と音声保持を示す
貪欲デコーディングベースラインと比較して高品質なオーディオを生成
SoundStormをはじめる
モデルへのアクセス: SoundStormモデルとその関連コンポーネントへのアクセスを取得します。
環境設定: モデルを実行するために必要なソフトウェアおよびハードウェア環境を構成します。
セマンティックトークンの入力: AudioLMによって生成されたセマンティックトークンをSoundStormに提供します。
APIによる統合: モデルのAPIを利用して、オーディオ生成パイプラインにシームレスに統合します。
条件付け情報の提供: 制御された合成のために、トランスクリプト、話者のターン注釈、音声プロンプトを提供します。
オーディオ生成: 生成プロセスを実行して、ニューラルオーディオコーデック表現を生成します。
オーディオデコード: 生成された表現をニューラルオーディオコーデックを使用して可聴音に変換します。
SoundStormの使用例
- 対話合成
- ボイスクローニング
- 高速オーディオ生成
- 音声合成
- オーディオコンテンツ作成
- アクセシビリティツール
- 研究の加速

