説明
V-JEPA、またはVideo Joint Embedding Predictive Architectureは、Meta AI Research (FAIR) によって開発された、ビデオからの自己教師あり視覚表現学習のための公式PyTorchコードベースです。この手法は、VideoMix2Mのようなデータセットからのビデオピクセルをパッシブに観察することにより、堅牢な視覚表現の学習に焦点を当てています。ピクセル再構築に依存する生成モデルとは異なり、V-JEPAは教師なし特徴予測目的を使用します。事前学習済みの画像エンコーダー、テキスト、ネガティブサンプル、人間によるアノテーション、またはピクセルレベルの再構築を必要としないため、純粋な教師なしアプローチです。
V-JEPAの方法論の核心は、ピクセルデコーダーではなく、潜在空間で動作する予測子を含みます。この予測子は、観測された部分に基づいて、ビデオの欠落領域の予測を行います。これらの予測を視覚化するために、条件付き拡散モデルを使用して、潜在空間の予測を解釈可能なピクセルにデコードします。重要なことに、このデコードプロセス中、事前学習済みのV-JEPAエンコーダーおよび予測子ネットワークは固定されたままであり、学習された表現が維持されることを保証します。
コードベースは、事前学習と評価の両方を容易にするように構造化されています。`configs` ディレクトリ内の設定ファイルは、実験パラメータを指定し、ユーザーがログ、チェックポイント、およびトレーニングデータのパスをカスタマイズできるようにします。`app` ディレクトリにはトレーニングループが含まれており、`main.py` はローカルデバッグ用、`main_distributed.py` は submitit や SLURM のようなツールを使用してクラスターでの分散トレーニングを開始するために使用されます。`evals` ディレクトリには、画像およびビデオ分類などのタスクの評価スクリプトが格納されており、ローカルおよび分散実行の両方をサポートしています。
データ準備には、ビデオデータセット用のCSVファイルの作成が含まれます。各行は、ビデオファイルへの絶対パスと整数クラスラベルを指定します(教師なし事前学習中は無視されますが、教師あり評価に使用されます)。画像データセットは、標準のPyTorch ImageFolderクラスを使用して準備され、特定のディレクトリ構造が必要です。このプロジェクトは、ViT-LおよびViT-Hバリアントを含む事前学習済みモデルと、K400、SSv2、ImageNet1K、Places205、iNat21などのさまざまな下流タスク用の注意プローブを提供し、学習された表現の汎用性を示しています。
V-JEPAの主要機能
共同埋め込み予測アーキテクチャ (JEPA) を使用したビデオからの自己教師あり学習
潜在空間における教師なし特徴予測目的
ピクセルレベルの再構築や人間によるアノテーションへの依存なし
下流のビデオおよび画像タスクのための汎用的な視覚表現
提供されるモデルと設定を備えた公式PyTorchコードベース
ローカルおよび分散トレーニングと評価をサポート
事前学習済みモデル (ViT-L, ViT-H) および注意プローブを含む
ビデオおよび画像データセットのための柔軟なデータ準備
コードベースには事前学習および評価用のスクリプトが含まれる
潜在空間における条件付き拡散モデルによる視覚化
V-JEPAをはじめる
リポジトリのクローン: GitHubからV-JEPAコードベースを取得します。
依存関係のインストール: Python環境(例: condaを使用)をセットアップし、必要なパッケージをインストールします。
実験の設定: データ、ログ、チェックポイントのために、`configs` ディレクトリ内の設定ファイルを更新します。
データの準備: 指定されたCSVまたはImageFolder構造に従って、ビデオおよび画像データセットをフォーマットします。
事前学習の開始: `app/main.py` または `app/main_distributed.py` を使用して、ローカルまたは分散事前学習を実行します。
評価の開始: `evals/main.py` または `evals/main_distributed.py` を使用して、下流タスクのローカルまたは分散評価を実行します。
事前学習済みモデルの利用: 提供されている事前学習済みV-JEPAモデルをダウンロードし、アプリケーションに統合します。
V-JEPAの使用例
- ビデオ表現学習
- 画像分類
- ビデオ分類
- 下流タスクへの適応
- 研究開発
- 特徴予測








