跳转到主要内容
ToolPotion

TokenFlow

TokenFlow 是一个 PyTorch 实现,用于使用预训练的文本到图像扩散模型进行一致的视频编辑。它支持无需进一步训练即可进行文本驱动的视频编辑,通过强制执行帧间对应关系中的扩散特征一致性来保留空间布局和动态。在真实世界视频上取得了最先进的结果。

访问URL

描述

TokenFlow 提出了一种创新的框架,用于进行一致的视频编辑,该框架利用预训练的文本到图像扩散模型,而无需任何额外的训练或微调。生成式 AI 的快速发展已扩展到视频生成领域,但当前最先进的视频模型在视觉质量和用户控制方面通常不如图像模型。这项工作引入了一种方法,该方法利用文本到图像扩散模型的力量来进行文本驱动的视频编辑。

给定源视频和目标文本提示,TokenFlow 会生成一个高质量的视频,该视频与目标文本对齐,同时精心保留原始输入视频的空间布局和动态。核心创新在于观察到,通过在扩散特征空间内强制执行一致性,可以实现编辑视频的一致性。这是通过根据模型中易于获得的帧间对应关系显式传播扩散特征来实现的。因此,该框架无需任何训练或微调即可运行,并且与任何现成的文本到图像编辑技术兼容。

该实现以 PyTorch 提供,是 ICLR 2024 上发表的“TokenFlow: Consistent Diffusion Features for Consistent Video Editing”论文的官方存储库。该项目在各种真实世界视频中展示了最先进的编辑结果。用户可以通过提供的链接探索示例结果、项目详情和底层研究。该框架专为结构保持编辑而设计,并建立在即插即用、ControlNet 和 SDEdit 等现有图像编辑技术之上。建议用户确保与他们选择的基础编辑技术的兼容性,因为 LDM 解码器可能会根据原始视频内容引入轻微的抖动。

TokenFlow的核心功能

  • TokenFlow 的官方 PyTorch 实现

  • 使用预训练的扩散模型实现一致的视频编辑

  • 无需进一步训练或微调

  • 保留输入视频的空间布局和动态

  • 实现文本驱动的视频编辑

  • 强制执行扩散特征空间的一致性

  • 利用帧间对应关系进行特征传播

  • 兼容现成的文本到图像编辑方法

  • 展示了最先进的编辑结果

  • 支持结构保持编辑

  • 可与即插即用、ControlNet 和 SDEdit 技术配合使用

TokenFlow入门

  1. 克隆:从 GitHub 克隆 TokenFlow 存储库。

  2. 安装依赖项:创建一个 conda 环境并使用 `pip install -r requirements.txt` 安装所需的包。

  3. 预处理:通过运行 `python preprocess.py` 并指定数据路径和反演提示来准备您的视频。

  4. 配置:为您选择的编辑方法创建一个 YAML 配置文件(例如 `configs/config_pnp.yaml`)。

  5. 执行:使用您的配置运行编辑脚本,例如 `python run_tokenflow_pnp.py`。

TokenFlow的使用案例

  • 文本驱动的视频修改
  • 结构保持视频编辑
  • AI 驱动的视频内容创作
  • 增强视频质量
  • 视频 AI 的研究与开发

TokenFlow的常见问题

TokenFlow 评价

加载中...

与 TokenFlow 类似的热门AI工具

AI 模型

Lumiere 是 Google Research 开发的时空扩散模型,用于生成逼真、多样且连贯的视频。它能在单次运行中合成整个视频时长,从而实现高级的文本到视频、图像到视频、视频修复以及风格化生成任务,并具有出色的时间一致性。

AI 视频生成器

AI 应用

VideoAI 是一个 AI 视频生成器,利用领先的模型如 Kling、Wan、Seedance 和 Veo 将文本和图像转换为视频。它还为创作者提供图像工具和 AI 音乐生成。

AI 视频生成器媒体与娱乐

AI 模型

Imagen Video 是 Google Research 开发的一种文本条件视频生成系统。它利用级联视频扩散模型,根据文本提示生成高清视频,为各种创意应用提供高保真度、可控性和世界知识。

AI 视频生成器

Stable Video Diffusion Online 使用先进的 AI 模型将图像和文本转换为短视频。此研究预览工具扩展了媒体、教育和营销的内容创作可能性,允许用户通过快速处理和用户友好的界面,从简单的输入生成动态视觉叙事。

AI 视频生成器

CapCut AI 视频编辑器提供智能在线视频编辑功能,集成了先进的 AI 工具,助您创作热门内容。它拥有 AI 设计、视频工作室、图像和视频生成器以及文本转语音功能,让每个人都能轻松高效地进行专业视频创作。

精选AI 视频编辑器

AI 模型

VideoPoet 是 Google Research 开发的一款大型语言模型,能够进行零样本视频生成。它将自回归语言模型转化为高质量的视频生成器,支持文本到视频、视频到音频以及各种编辑任务,并具有出色的时间一致性和运动保真度。

AI 视频生成器

AI GitHub 仓库

Kandinsky 2 是一个多语言文本到图像的潜在扩散模型。它提供高级的图像生成功能,包括文本到图像、图像到图像和图像修复。该模型支持 ControlNet 以增强图像生成控制,并利用强大的编码器来改进对文本和图像的理解,从而产生更具美感的输出。

AI 模型与大语言模型

AI GitHub 仓库

StoryDiffusion 是一款用于生成长序列一致图像和视频的 AI 工具。它利用一致的自注意力机制实现图像生成中的角色一致性,并使用运动预测器进行视频生成,兼容 SD1.5 和 SDXL 模型。该项目被 NeurIPS 2024 接受为 Spotlight Presentation Paper。

AI 图像生成器