描述
Stable Diffusion 3 Medium 是一个由 Stability AI 开发的多模态扩散变换器 (MMDiT) 文本到图像模型。该模型显著提高了图像质量、排版和复杂提示理解的性能,同时保持资源效率。它旨在根据文本提示生成图像,使其成为艺术家、设计师和研究人员的宝贵工具。
该模型利用三个固定的预训练文本编码器:OpenCLIP-ViT/G、CLIP-ViT/L 和 T5-xxl。这些编码器增强了模型解释和生成与用户提示紧密对齐的图像的能力。该模型是公开可用的,但用户必须同意分享其联系信息并接受条件以访问其文件和内容。
Stable Diffusion 3 Medium 根据 Stability Community License 发布,允许年收入低于 100 万美元的组织或个人免费用于研究、非商业和商业目的。对于超过此阈值的用户,需要付费企业许可证。该模型特别适合生成艺术作品、教育工具和生成模型的研究,同时遵循可接受使用政策。
该模型的训练数据集包括合成数据和经过筛选的公开可用数据,预训练于 10 亿张图像,并在 3000 万张高质量美学图像上进行微调。该模型以几种变体打包,每个变体都配备相同的一组 MMDiT 和 VAE 权重,确保用户便利。对于本地或自托管使用,推荐使用 ComfyUI 进行推理。
在模型开发过程中实施了安全措施,以减轻与有害内容相关的风险。鼓励开发人员进行自己的测试,并根据其特定用例应用额外的安全措施。总体而言,Stable Diffusion 3 Medium 代表了生成 AI 领域的重大进展,提供了强大的基于文本输入的图像生成能力。
stable-diffusion-3-medium亮点
模型类型:MMDiT 文本到图像
许可证:社区许可证
训练数据集:10 亿张图像
微调数据:3000 万张高质量图像
预训练编码器:OpenCLIP-ViT/G、CLIP-ViT/L、T5-xxl
预期用途:艺术生成、教育工具
安全措施:在开发过程中实施
访问要求:同意条款以获取访问权限
stable-diffusion-3-medium入门
访问页面:访问 Hugging Face 模型页面。
加载模型:同意条款后下载模型文件。
配置环境:设置运行模型所需的环境。
集成:在您的应用程序中使用模型进行文本到图像生成。
微调:根据特定任务调整模型参数。
stable-diffusion-3-medium的使用案例
- 艺术生成
- 设计应用
- 教育工具
- 生成模型研究
- 创意流程








