Deskripsi
V-JEPA, atau Video Joint Embedding Predictive Architecture, adalah basis kode PyTorch resmi yang dikembangkan oleh Meta AI Research (FAIR) untuk pembelajaran representasi visual mandiri dari video. Metode ini berfokus pada pembelajaran representasi visual yang kuat dengan mengamati piksel video secara pasif dari dataset seperti VideoMix2M. Berbeda dengan model generatif yang mengandalkan rekonstruksi piksel, V-JEPA menggunakan tujuan prediksi fitur tanpa pengawasan. Ia tidak memerlukan encoder gambar yang telah dilatih sebelumnya, teks, contoh negatif, anotasi manusia, atau rekonstruksi tingkat piksel, menjadikannya pendekatan yang sepenuhnya tanpa pengawasan.
Inti dari metodologi V-JEPA melibatkan prediktor yang beroperasi di ruang laten, bukan dekoder piksel. Prediktor ini membuat prediksi untuk wilayah video yang hilang berdasarkan bagian yang diamati. Untuk memvisualisasikan prediksi ini, model difusi kondisional digunakan untuk mendekode prediksi ruang laten menjadi piksel yang dapat diinterpretasikan. Sangat penting, selama proses dekode ini, jaringan encoder dan prediktor V-JEPA yang telah dilatih sebelumnya tetap beku, memastikan bahwa representasi yang dipelajari dipertahankan.
Basis kode disusun untuk memfasilitasi pra-pelatihan dan evaluasi. File konfigurasi di direktori `configs` menentukan parameter eksperimen, memungkinkan pengguna untuk menyesuaikan jalur untuk log, checkpoint, dan data pelatihan. Direktori `app` berisi loop pelatihan, dengan `main.py` untuk debugging lokal dan `main_distributed.py` untuk meluncurkan pelatihan terdistribusi pada kluster menggunakan alat seperti submitit dan SLURM. Direktori `evals` berisi skrip evaluasi untuk tugas-tugas seperti klasifikasi gambar dan video, yang juga mendukung eksekusi lokal dan terdistribusi.
Persiapan data melibatkan pembuatan file CSV untuk dataset video, di mana setiap baris menentukan jalur absolut ke file video dan label kelas bilangan bulat (yang diabaikan selama pra-pelatihan tanpa pengawasan tetapi digunakan untuk evaluasi yang diawasi). Dataset gambar disiapkan menggunakan kelas PyTorch ImageFolder standar, yang memerlukan struktur direktori tertentu. Proyek ini menyediakan model yang telah dilatih sebelumnya, termasuk varian ViT-L dan ViT-H, bersama dengan probe atensi untuk berbagai tugas hilir seperti K400, SSv2, ImageNet1K, Places205, dan iNat21, yang menunjukkan keserbagunaan representasi yang dipelajari.
Fitur Inti V-JEPA
Pembelajaran mandiri dari video menggunakan Arsitektur Prediktif Joint-Embedding (JEPA)
Tujuan prediksi fitur tanpa pengawasan di ruang laten
Tidak bergantung pada rekonstruksi tingkat piksel atau anotasi manusia
Representasi visual serbaguna untuk tugas video dan gambar hilir
Basis kode PyTorch resmi dengan model dan konfigurasi yang disediakan
Mendukung pelatihan dan evaluasi lokal dan terdistribusi
Termasuk model yang telah dilatih sebelumnya (ViT-L, ViT-H) dan probe atensi
Persiapan data yang fleksibel untuk dataset video dan gambar
Basis kode mencakup skrip untuk pra-pelatihan dan evaluasi
Visualisasi melalui model difusi kondisional di ruang laten
Memulai dengan V-JEPA
Kloning Repositori: Dapatkan basis kode V-JEPA dari GitHub.
Instal Dependensi: Siapkan lingkungan Python (misalnya, menggunakan conda) dan instal paket yang diperlukan.
Konfigurasi Eksperimen: Perbarui jalur dalam file konfigurasi di direktori `configs` untuk data, log, dan checkpoint.
Siapkan Data: Format dataset video dan gambar sesuai dengan struktur CSV atau ImageFolder yang ditentukan.
Luncurkan Pra-pelatihan: Jalankan pra-pelatihan lokal atau terdistribusi menggunakan `app/main.py` atau `app/main_distributed.py`.
Luncurkan Evaluasi: Jalankan evaluasi lokal atau terdistribusi untuk tugas hilir menggunakan `evals/main.py` atau `evals/main_distributed.py`.
Gunakan Model yang Telah Dilatih Sebelumnya: Unduh dan integrasikan model V-JEPA yang telah dilatih sebelumnya yang disediakan untuk aplikasi Anda.
Kasus Penggunaan V-JEPA
- Pembelajaran Representasi Video
- Klasifikasi Gambar
- Klasifikasi Video
- Adaptasi Tugas Hilir
- Penelitian dan Pengembangan
- Prediksi Fitur








