Описание
TokenFlow представляет собой инновационную структуру для последовательного редактирования видео, использующую предварительно обученные диффузионные модели text-to-image без необходимости дополнительного обучения или дообучения. Быстрый прогресс в области генеративного ИИ распространился и на генерацию видео, однако современные передовые видеомодели часто уступают моделям изображений в визуальном качестве и контроле пользователя. Данная работа представляет метод, который использует мощь диффузионных моделей text-to-image для редактирования видео на основе текста.
Учитывая исходное видео и целевой текстовый запрос, TokenFlow генерирует высококачественное видео, соответствующее целевому тексту, при этом тщательно сохраняя пространственную компоновку и динамику исходного входного видео. Ключевая инновация заключается в наблюдении, что согласованность в отредактированном видео может быть достигнута за счет обеспечения согласованности в пространстве диффузионных признаков. Это достигается путем явного распространения диффузионных признаков на основе легкодоступных межфреймовых соответствий в модели. Следовательно, структура работает без необходимости какого-либо обучения или дообучения и совместима с любыми готовыми методами редактирования text-to-image.
Реализация предоставлена на PyTorch и является официальным репозиторием для статьи «TokenFlow: Consistent Diffusion Features for Consistent Video Editing», представленной на ICLR 2024. Проект демонстрирует передовые результаты редактирования на различных реальных видео. Пользователи могут ознакомиться с примерами результатов, деталями проекта и лежащими в его основе исследованиями по предоставленным ссылкам. Структура предназначена для редактирования с сохранением структуры и основана на существующих методах редактирования изображений, таких как Plug-and-Play, ControlNet и SDEdit. Пользователям рекомендуется убедиться в совместимости с выбранным базовым методом редактирования, поскольку декодер LDM может вносить незначительные искажения в зависимости от исходного содержимого видео.
Основные функции TokenFlow
Официальная реализация TokenFlow на PyTorch
Обеспечивает последовательное редактирование видео с использованием предварительно обученных диффузионных моделей
Не требуется дополнительное обучение или дообучение
Сохраняет пространственную компоновку и динамику входных видео
Обеспечивает редактирование видео на основе текста
Обеспечивает согласованность в пространстве диффузионных признаков
Использует межфреймовые соответствия для распространения признаков
Совместим с готовыми методами редактирования text-to-image
Демонстрирует передовые результаты редактирования
Поддерживает редактирование с сохранением структуры
Работает с методами Plug-and-Play, ControlNet и SDEdit
Начало работы с TokenFlow
Клонировать: Клонируйте репозиторий TokenFlow с GitHub.
Установить зависимости: Создайте conda-окружение и установите необходимые пакеты с помощью `pip install -r requirements.txt`.
Предварительная обработка: Подготовьте ваше видео, запустив `python preprocess.py` с указанием пути к данным и инверсионного запроса.
Настроить: Создайте YAML-файл конфигурации для выбранного вами метода редактирования (например, `configs/config_pnp.yaml`).
Выполнить: Запустите скрипт редактирования, например `python run_tokenflow_pnp.py`, используя вашу конфигурацию.
Варианты использования TokenFlow
- Модификация видео на основе текста
- Редактирование видео с сохранением структуры
- Создание видеоконтента с помощью ИИ
- Улучшение качества видео
- Исследования и разработка в области видео ИИ





