説明
TokenFlowは、追加のトレーニングやファインチューニングを一切必要とせずに、事前学習済みのテキストから画像への拡散モデルを活用した、一貫性のあるビデオ編集のための革新的なフレームワークを提案します。生成AIの急速な進歩はビデオ生成にも及んでいますが、現在の最先端のビデオモデルは、視覚的な品質とユーザー制御において画像モデルに劣ることがよくあります。この研究では、テキストから画像への拡散モデルのパワーをテキスト駆動型のビデオ編集に活用する方法を紹介します。
ソースビデオとターゲットのテキストプロンプトが与えられると、TokenFlowはターゲットテキストに一致する高品質のビデオを生成し、元の入力ビデオの空間レイアウトとダイナミクスを細心の注意を払って維持します。主な革新は、編集されたビデオの一貫性が、拡散特徴空間内の一貫性を強制することによって達成できるという観察にあります。これは、モデル内で容易に入手可能なフレーム間の対応関係に基づいて拡散特徴量を明示的に伝播することによって達成されます。その結果、フレームワークはトレーニングやファインチューニングの必要なしに動作し、市販のテキストから画像への編集技術と互換性があります。
この実装はPyTorchで提供されており、ICLR 2024で発表された「TokenFlow: Consistent Diffusion Features for Consistent Video Editing」論文の公式リポジトリです。このプロジェクトは、さまざまな実世界のビデオにわたる最先端の編集結果を示しています。ユーザーは、提供されたリンクを通じて、サンプル結果、プロジェクトの詳細、および基盤となる研究を探索できます。このフレームワークは構造を維持する編集のために設計されており、Plug-and-Play、ControlNet、SDEditなどの既存の画像編集技術に基づいています。LDMデコーダーは、元のビデオコンテンツによってはわずかなジッターを導入する可能性があるため、ユーザーは選択したベース編集技術との互換性を確保することをお勧めします。
TokenFlowの主要機能
TokenFlowの公式PyTorch実装
事前学習済み拡散モデルを使用した一貫性のあるビデオ編集を可能にする
追加のトレーニングやファインチューニングは不要
入力ビデオの空間レイアウトとダイナミクスを維持する
テキスト駆動型のビデオ編集を実現する
拡散特徴空間内の一貫性を強制する
フレーム間の対応関係を利用した特徴量伝播
市販のテキストから画像への編集方法と互換性がある
最先端の編集結果を示す
構造を維持する編集をサポートする
Plug-and-Play、ControlNet、SDEdit技術と連携する
TokenFlowをはじめる
クローン: GitHubからTokenFlowリポジトリをクローンします。
依存関係のインストール: conda環境を作成し、`pip install -r requirements.txt`を使用して必要なパッケージをインストールします。
前処理: 指定されたデータパスと反転プロンプトを使用して`python preprocess.py`を実行し、ビデオを準備します。
設定: 選択した編集方法(例: `configs/config_pnp.yaml`)のYAML設定ファイルを作成します。
実行: 設定を使用して、`python run_tokenflow_pnp.py`などの編集スクリプトを実行します。
TokenFlowの使用例
- テキスト駆動型のビデオ変更
- 構造を維持するビデオ編集
- AIを活用したビデオコンテンツ作成
- ビデオ品質の向上
- ビデオAIの研究開発





