Descrição
TokenFlow apresenta um framework inovador para edição de vídeo consistente, aproveitando modelos de difusão pré-treinados de texto para imagem sem a necessidade de treinamento ou ajuste fino adicional. Os rápidos avanços em IA generativa se estenderam à geração de vídeo, mas os modelos de vídeo de ponta atuais muitas vezes ficam aquém dos modelos de imagem em qualidade visual e controle do usuário. Este trabalho introduz um método que aproveita o poder dos modelos de difusão de texto para imagem para edição de vídeo orientada por texto.
Dada uma vídeo fonte e um prompt de texto alvo, TokenFlow gera um vídeo de alta qualidade que se alinha com o texto alvo, preservando meticulosamente o layout espacial e a dinâmica do vídeo de entrada original. A inovação central reside na observação de que a consistência no vídeo editado pode ser alcançada impondo consistência no espaço de recursos de difusão. Isso é realizado propagando explicitamente recursos de difusão com base em correspondências inter-quadros prontamente disponíveis dentro do modelo. Consequentemente, o framework opera sem a necessidade de qualquer treinamento ou ajuste fino e é compatível com qualquer técnica de edição de texto para imagem pronta para uso.
A implementação é fornecida em PyTorch e é o repositório oficial do artigo "TokenFlow: Consistent Diffusion Features for Consistent Video Editing", apresentado na ICLR 2024. O projeto demonstra resultados de edição de ponta em uma variedade de vídeos do mundo real. Os usuários podem explorar resultados de amostra, detalhes do projeto e a pesquisa subjacente através dos links fornecidos. O framework é projetado para edições que preservam a estrutura e se baseia em técnicas de edição de imagem existentes, como Plug-and-Play, ControlNet e SDEdit. Recomenda-se que os usuários garantam a compatibilidade com sua técnica de edição base escolhida, pois o decodificador LDM pode introduzir um leve tremor dependendo do conteúdo do vídeo original.
Recursos principais de TokenFlow
Implementação oficial em PyTorch do TokenFlow
Permite edição de vídeo consistente usando modelos de difusão pré-treinados
Não requer treinamento ou ajuste fino adicional
Preserva o layout espacial e a dinâmica dos vídeos de entrada
Alcança edição de vídeo orientada por texto
Impõe consistência no espaço de recursos de difusão
Utiliza correspondências inter-quadros para propagação de recursos
Compatível com métodos de edição de texto para imagem prontos para uso
Demonstra resultados de edição de ponta
Suporta edições que preservam a estrutura
Funciona com técnicas Plug-and-Play, ControlNet e SDEdit
Primeiros passos com TokenFlow
Clonar: Clone o repositório TokenFlow do GitHub.
Instalar dependências: Crie um ambiente conda e instale os pacotes necessários usando `pip install -r requirements.txt`.
Pré-processar: Prepare seu vídeo executando `python preprocess.py` com o caminho dos dados e o prompt de inversão especificados.
Configurar: Crie um arquivo de configuração YAML para o método de edição escolhido (por exemplo, `configs/config_pnp.yaml`).
Executar: Execute o script de edição, como `python run_tokenflow_pnp.py`, usando sua configuração.
Casos de uso de TokenFlow
- Modificação de vídeo orientada por texto
- Edição de vídeo com preservação de estrutura
- Criação de conteúdo de vídeo com IA
- Melhoria da qualidade de vídeo
- Pesquisa e desenvolvimento em IA de vídeo





