説明
VideoPoetは、AI駆動のビデオ合成における重要な進歩を表しており、ゼロショットビデオ生成のために設計された大規模言語モデルとして機能します。その中核的な革新は、あらゆるオートリグレッシブ言語モデルを洗練されたビデオジェネレーターに変換できる、シンプルなモデリング方法にあります。このアプローチにより、テキストプロンプトから高品質なビデオを作成でき、広範囲で興味深く、高忠実度のモーションを生成する顕著な能力を示します。
技術的な基盤として、VideoPoetは事前学習済みのMAGVIT V2ビデオトークナイザーとSoundStreamオーディオトークナイザーを利用しています。これらのコンポーネントは、可変長の画像、ビデオ、オーディオクリップを、統一された語彙内の離散コードに変換します。これらのコードはテキストベースの言語モデルと互換性があり、テキストのような他のモダリティとのシームレスな統合を容易にします。その後、オートリグレッシブ言語モデルは、ビデオ、画像、オーディオ、テキストのモダリティ全体で学習し、シーケンス内の次のビデオまたはオーディオトークンを予測します。トレーニングフレームワークには、テキストからビデオ、テキストから画像、画像からビデオ、ビデオフレーム継続、ビデオインペインティングおよびアウトペインティング、ビデオスタイライゼーション、ビデオからオーディオなど、マルチモーダル生成学習目標の混合が含まれています。これらのタスクを組み合わせることで、テキストからオーディオ生成のような追加のゼロショット機能を実現できます。
VideoPoetの機能は、単純な生成を超えています。テキストプロンプトに基づいて高モーション、可変長のビデオを出力でき、テキストガイダンスなしで入力ビデオに一致するオーディオを生成することもできます。このモデルは、ショートフォームコンテンツに適した、正方形または縦長の向きでのビデオ生成をサポートします。さらに、被写体が異なるモーションやスタイルに従うことを可能にする制御可能なビデオ編集、およびユーザーが生成された候補から選択してモーションタイプを洗練できるインタラクティブ編集に優れています。画像からビデオへの生成も主要な機能であり、入力画像をテキストプロンプトでガイドされたビデオに変換します。ゼロショットスタイライゼーションにより、テキストプロンプトに基づいてビデオが様々な芸術的スタイルを採用できるようになり、制御可能なカメラモーションはプロンプトエンジニアリングを通じて指定でき、ズームアウト、ドリーク、FPVドローンショットのようなエフェクトを可能にします。
このモデルは、特に多様で高忠実度のモーションの生成において、最先端のビデオ生成能力を示しています。1秒間の入力クリップに基づいて1秒間の出力を反復的に予測することで、より長いビデオを生成でき、オブジェクトの同一性を強く保持します。これにより、VideoPoetはビジュアルストーリーテリング、コンテンツ作成、および新しいメディア合成形式の探求のための強力なツールとなります。この研究は、ダイナミックなビジュアルナラティブを作成し、スタイルのエフェクトを容易に適用する可能性を強調しています。
VideoPoetのハイライト
テキストプロンプトからのゼロショットビデオ生成
テキストガイダンスなしのビデオからオーディオ生成
テキストからビデオ、テキストから画像、画像からビデオ生成をサポート
ビデオフレーム継続、インペインティング、アウトペインティングを可能にする
ビデオスタイライゼーションと制御可能なカメラモーションを促進する
可変長のビデオ生成が可能
長いクリップでのオブジェクト同一性の強い保持
ショートフォームコンテンツ用の正方形および縦長のビデオ向きをサポート
候補選択によるインタラクティブビデオ編集
マルチモーダルタスクのための生成学習目標を組み合わせる
MAGVIT V2およびSoundStreamトークナイザーを利用
高モーションおよび高忠実度のビデオコンテンツを出力
VideoPoetをはじめる
モデルへのアクセス: 研究インターフェースまたはAPIを通じてVideoPoetモデルを利用します。
プロンプトの入力: 希望するビデオコンテンツの詳細なテキスト説明を提供します。
パラメータの指定: ビデオの向き(正方形/縦長)と希望する長さを定義します。
ビデオ生成: ビデオシーケンスを作成するために生成プロセスを開始します。
オーディオ生成: オプションで、作成されたビデオに一致するオーディオを生成します。
ビデオ編集: スタイライゼーション、カメラモーション、またはインタラクティブ編集を適用して洗練します。
統合: 生成されたビデオクリップをストーリーテリングまたはコンテンツプロジェクトに組み込みます。
VideoPoetの使用例
- コンテンツ作成
- ストーリーテリング
- ビデオ編集
- プロトタイピング
- 芸術的探求
- オーディオビジュアル同期
- ショートフォームビデオ
- コンセプトの視覚化





