Description
TokenFlow présente un cadre innovant pour le montage vidéo cohérent, exploitant des modèles de diffusion texte-image pré-entraînés sans nécessiter d'entraînement ou de réglage fin supplémentaire. Les progrès rapides de l'IA générative se sont étendus à la génération vidéo, mais les modèles vidéo de pointe actuels sont souvent inférieurs aux modèles d'image en termes de qualité visuelle et de contrôle utilisateur. Ce travail introduit une méthode qui exploite la puissance des modèles de diffusion texte-image pour le montage vidéo piloté par le texte.
Étant donné une vidéo source et une invite textuelle cible, TokenFlow génère une vidéo de haute qualité qui correspond au texte cible tout en préservant méticuleusement la disposition spatiale et la dynamique de la vidéo d'entrée d'origine. L'innovation principale réside dans l'observation que la cohérence de la vidéo éditée peut être obtenue en appliquant la cohérence dans l'espace des caractéristiques de diffusion. Ceci est réalisé en propageant explicitement les caractéristiques de diffusion sur la base de correspondances inter-images facilement disponibles au sein du modèle. Par conséquent, le cadre fonctionne sans avoir besoin d'aucun entraînement ou réglage fin et est compatible avec toute technique d'édition texte-image prête à l'emploi.
L'implémentation est fournie en PyTorch et est le dépôt officiel de l'article "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", présenté à l'ICLR 2024. Le projet démontre des résultats d'édition de pointe sur une variété de vidéos du monde réel. Les utilisateurs peuvent explorer des exemples de résultats, des détails du projet et la recherche sous-jacente via les liens fournis. Le cadre est conçu pour des modifications préservant la structure et s'appuie sur des techniques d'édition d'images existantes telles que Plug-and-Play, ControlNet et SDEdit. Il est conseillé aux utilisateurs de s'assurer de la compatibilité avec leur technique d'édition de base choisie, car le décodeur LDM pourrait introduire un léger tremblement en fonction du contenu vidéo d'origine.
Fonctionnalités principales de TokenFlow
Implémentation PyTorch officielle de TokenFlow
Permet le montage vidéo cohérent à l'aide de modèles de diffusion pré-entraînés
Aucun entraînement ou réglage fin supplémentaire requis
Préserve la disposition spatiale et la dynamique des vidéos d'entrée
Permet le montage vidéo piloté par le texte
Applique la cohérence dans l'espace des caractéristiques de diffusion
Utilise des correspondances inter-images pour la propagation des caractéristiques
Compatible avec les méthodes d'édition texte-image prêtes à l'emploi
Démontre des résultats d'édition de pointe
Prend en charge les modifications préservant la structure
Fonctionne avec les techniques Plug-and-Play, ControlNet et SDEdit
Premiers pas avec TokenFlow
Cloner : Clonez le dépôt TokenFlow depuis GitHub.
Installer les dépendances : Créez un environnement conda et installez les paquets requis en utilisant `pip install -r requirements.txt`.
Prétraiter : Préparez votre vidéo en exécutant `python preprocess.py` avec le chemin des données et l'invite d'inversion spécifiés.
Configurer : Créez un fichier de configuration YAML pour votre méthode d'édition choisie (par exemple, `configs/config_pnp.yaml`).
Exécuter : Lancez le script d'édition, tel que `python run_tokenflow_pnp.py`, en utilisant votre configuration.
Cas d'utilisation de TokenFlow
- Modification vidéo pilotée par le texte
- Montage vidéo préservant la structure
- Création de contenu vidéo assistée par IA
- Amélioration de la qualité vidéo
- Recherche et développement en IA vidéo





