描述
StoryDiffusion 是一个尖端的 AI 系统,专为生成跨越长序列的连贯一致的图像和视频而设计。该项目被 NeurIPS 2024 接受为 Spotlight Presentation Paper,引入了新颖的方法来解决在长程内容创作中保持视觉一致性的挑战。
其核心创新在于“一致性自注意力”机制,该机制专门为实现角色一致的图像生成而设计。此功能可热插拔,并与现有的 Stable Diffusion 模型兼容,包括 SD1.5 和 SDXL 架构。为了实现有效的角色一致性,用户需要提供至少三个文本提示,建议使用五个到六个提示以获得最佳布局安排。这确保了在生成的图像系列中,角色和视觉元素保持一致。
为了补充图像生成能力,StoryDiffusion 集成了“运动预测器”用于长程视频生成。该组件通过在压缩的图像语义空间中预测运动来工作,从而能够创建具有更显著和流畅运动的视频。这是通过一个两阶段过程实现的:首先,使用自注意力模块生成一系列一致的图像,然后无缝地在这些图像之间进行过渡以形成视频。
该系统提供了多样的应用,包括漫画生成和图像到视频转换。漫画生成功能利用一致的图像生成来创建连续的漫画格。图像到视频功能允许用户输入一系列条件图像,模型随后利用这些图像生成视频。这种方法有助于创建非常长且高质量的 AI 生成内容。该项目提供了官方实现和演示,包括一个低 GPU 内存版本,以提高可访问性。
StoryDiffusion 的开发专注于 AI 驱动媒体生成的研究和开发。该项目托管在 GitHub 上,鼓励社区贡献和透明度。安装需要 Python 3.8+ 和 PyTorch 2.0.0,依赖项通过 requirements 文件进行管理。开发人员强调负责任地使用该技术,遵守当地法律和道德准则。
StoryDiffusion的核心功能
用于角色一致图像生成的“一致性自注意力”机制
可热插拔,兼容 SD1.5 和 SDXL 模型
用于长程视频生成的运动预测器
两阶段长视频生成方法
漫画生成能力
从条件图像生成图像到视频
提供低 GPU 内存版本
NeurIPS 2024 Spotlight Presentation Paper 的官方实现
支持多个文本提示以进行布局安排
在压缩图像语义空间中预测运动
StoryDiffusion入门
克隆仓库:从 GitHub 仓库获取 StoryDiffusion 代码。
安装依赖项:设置 Python 环境并使用 pip 安装所需包。
配置设置:根据需要调整参数并提供文本提示以进行图像/视频生成。
运行生成:执行提供的脚本或演示以创建漫画或视频。
优化输出:尝试不同的提示配置以改进一致性和运动效果。
StoryDiffusion的使用案例
- 漫画书创作
- 故事板制作
- 视频生成
- 角色动画
- 视觉叙事
- 内容创作
- AI 研究







