Deskripsi
TokenFlow menghadirkan kerangka kerja inovatif untuk pengeditan video yang konsisten, memanfaatkan model difusi text-to-image yang telah dilatih sebelumnya tanpa memerlukan pelatihan atau fine-tuning tambahan. Kemajuan pesat dalam AI generatif telah meluas ke pembuatan video, namun model video state-of-the-art saat ini seringkali tertinggal dari model gambar dalam kualitas visual dan kontrol pengguna. Karya ini memperkenalkan metode yang memanfaatkan kekuatan model difusi text-to-image untuk pengeditan video yang digerakkan oleh teks.
Diberikan video sumber dan prompt teks target, TokenFlow menghasilkan video berkualitas tinggi yang selaras dengan teks target sambil dengan cermat mempertahankan tata letak spasial dan dinamika video input asli. Inovasi inti terletak pada pengamatan bahwa konsistensi dalam video yang diedit dapat dicapai dengan memberlakukan konsistensi dalam ruang fitur difusi. Hal ini dicapai dengan secara eksplisit menyebarkan fitur difusi berdasarkan korespondensi antar-frame yang tersedia dalam model. Akibatnya, kerangka kerja beroperasi tanpa memerlukan pelatihan atau fine-tuning apa pun dan kompatibel dengan teknik pengeditan text-to-image apa pun yang siap pakai.
Implementasi disediakan dalam PyTorch dan merupakan repositori resmi untuk makalah "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", yang dipresentasikan di ICLR 2024. Proyek ini menunjukkan hasil pengeditan state-of-the-art di berbagai video dunia nyata. Pengguna dapat menjelajahi contoh hasil, detail proyek, dan penelitian yang mendasarinya melalui tautan yang disediakan. Kerangka kerja ini dirancang untuk pengeditan yang mempertahankan struktur dan dibangun di atas teknik pengeditan gambar yang ada seperti Plug-and-Play, ControlNet, dan SDEdit. Pengguna disarankan untuk memastikan kompatibilitas dengan teknik pengeditan dasar yang mereka pilih, karena decoder LDM dapat menimbulkan sedikit kegugupan tergantung pada konten video asli.
Fitur Inti TokenFlow
Implementasi PyTorch resmi TokenFlow
Memungkinkan pengeditan video yang konsisten menggunakan model difusi yang telah dilatih sebelumnya
Tidak memerlukan pelatihan atau fine-tuning lebih lanjut
Mempertahankan tata letak spasial dan dinamika video input
Mencapai pengeditan video yang digerakkan oleh teks
Memberlakukan konsistensi dalam ruang fitur difusi
Memanfaatkan korespondensi antar-frame untuk propagasi fitur
Kompatibel dengan metode pengeditan text-to-image yang siap pakai
Menunjukkan hasil pengeditan state-of-the-art
Mendukung pengeditan yang mempertahankan struktur
Bekerja dengan teknik Plug-and-Play, ControlNet, dan SDEdit
Memulai dengan TokenFlow
Clone: Clone repositori TokenFlow dari GitHub.
Instal dependensi: Buat lingkungan conda dan instal paket yang diperlukan menggunakan `pip install -r requirements.txt`.
Pra-pemrosesan: Siapkan video Anda dengan menjalankan `python preprocess.py` dengan jalur data dan prompt inversi yang ditentukan.
Konfigurasi: Buat file konfigurasi YAML untuk metode pengeditan pilihan Anda (misalnya, `configs/config_pnp.yaml`).
Eksekusi: Jalankan skrip pengeditan, seperti `python run_tokenflow_pnp.py`, menggunakan konfigurasi Anda.
Kasus Penggunaan TokenFlow
- Modifikasi video yang digerakkan oleh teks
- Pengeditan video yang mempertahankan struktur
- Pembuatan konten video bertenaga AI
- Meningkatkan kualitas video
- Penelitian dan pengembangan AI video





