惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

aimingoo的专栏
aimingoo的专栏
G
Google Developers Blog
B
Blog RSS Feed
A
About on SuperTechFans
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
V
V2EX
Stack Overflow Blog
Stack Overflow Blog
C
Check Point Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Engineering at Meta
Engineering at Meta
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 司徒正美
D
Docker
F
Fortinet All Blogs
Hugging Face - Blog
Hugging Face - Blog
Last Week in AI
Last Week in AI
H
Help Net Security
WordPress大学
WordPress大学
MyScale Blog
MyScale Blog
博客园 - Franky
人人都是产品经理
人人都是产品经理
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Blog — PlanetScale
Blog — PlanetScale
L
LangChain Blog

Stable Diffusion

50 系显卡跑 sd1.5 的兼容性问题解决指南! SD 要生成满意的图比我想象的难很多 [求解答] 学习 sd 等精确绘图是否已经过时? ComfyUI 如何变现 模型商用的定义是什么? 文生图大模型都不是很大? 有办法通过给一幅人像,换成指定图片的服装吗? 一个基于 SDXL 的可以生成 Apple 风格 emoji 的模型 macOS Stable Diffusion ? Stable Diffusion 自建共享站 分享 GPT-4o mini 和 Stable Diffusion 3 等模型白嫖网站 刚开发了个免费不限次数 Stable Diffusion 3.5 图片生成器 做了一个 AI 图片站,最近比较热的 Stable Diffusion 3.5 求 AI 生图教程推荐, 以及学习路线 Stable Diffusion | Flux 赐教: 可否通过本地 PC 替代云端实现 Stable Diffusion 生图,降低本? flux1 模型整个体验下来,感觉比 Stable Diffusion 和 Midjourney 都厉害-Flux1ai 写了一个目前最快的离线 AI 图像生成安卓 APP 据说是比 Stable Diffusion 和 Midjourney 都厉害的开源图像生成模型 → FLUX.1 花费一个月时间,做了一款管理 Stable Diffusion 的工具 有偿求助 Stable Diffusion 生产艺术二维码。 [开源自荐] 自动同步和保存你的 Stable Diffusion 作品 Stable Diffusion 写实人物模型,怎么让他不出 X 图? 做了一个 Stable diffusion 提示词生成工具 分享一款刚刚对外开放的在线的免费 Stable Diffusion 3 生图工具产品 简易 AI 图片 prompt 查看器 Stable Diffusion Prompt Reader v1.3.5 请教一下 Stable Diffusion 的问题 小白都能上手的 Stable Diffusion 在线生成器,有没有? 想研究下 stable diffusion,收一台 Windows 整机 求各位大佬,推荐个 ai 绘画的电脑配置 stable diffusion 使用同样的参数,似乎不能百分百复现别人的图片?
Stable Fast: 超轻量级 Stable Diffusion 推理优化框架
nethard · 2023-10-17 · via Stable Diffusion

本人第一个正式开源项目,欢迎大家关注!聚焦于推理优化领域,希望能帮助到有相关模型推理加速需求的朋友,或者希望学习这方面知识的朋友。

项目主页

这是什么?

stable-fast 是一个为 HuggingFace DiffusersNVIDIA GPUs 上的超轻量级推理优化库。 stable-fast 通过利用一些关键技术和特性提供超快的推理优化:

  • __CUDNN 卷积融合__:stable-fast 为各种组合的 Conv + Bias + Add + Act 计算模式实现了一系列功能齐全且完全兼容的 CUDNN 卷积融合运算符。
  • __低精度 & 融合的 GEMM__:stable-fast 实现了一系列使用 fp16 精度的融合 GEMM 运算符,这比 PyTorch 的默认设置更快(以 fp16 读取和写入,以 fp32 计算)。
  • __NHWC & 融合的 GroupNorm__:stable-fast 使用 OpenAI 的triton实现了高度优化的融合的 NHWC GroupNorm + GELU 运算符,消除了内存格式排列运算符的需要。
  • __完全追踪的模型__:stable-fast 改进了 torch.jit.trace 接口,使其更适合追踪复杂模型。几乎每一部分的 StableDiffusionPipeline 都可以被追踪并转换为 __TorchScript__。它比 torch.compile 更稳定,并且比 torch.compile 的 CPU 开销明显小,并支持 ControlNet 和 __LoRA__。
  • __CUDA Graph__:stable-fast 可以将 UNet 结构捕获到 CUDA Graph 格式,当批量大小小时可以减少 CPU 开销。
  • __融合的多头注意力__:stable-fast 仅仅直接使用 xformers 并使其与 TorchScript 兼容。

与其他加速库的差异

  • __快速__:stable-fast 是专门为 HuggingFace Diffusers 优化的。它在所有库中都实现了最佳性能。
  • __简约__:stable-fast 作为 PyTorch 的一个插件框架工作。它利用现有的 PyTorch 功能和基础设施,并与其他加速技术兼容,以及流行的微调技术和部署解决方案。

性能比较

A100 SXM 80GB (SD v1.5, 512x512, fp16)

框架 性能
Vanilla PyTorch 23 it/s
AITemplate 44 it/s
TensorRT 52 it/s
OneFlow 55 it/s
Stable Fast (与 xformers & triton 共同工作) 60 it/s

RTX 3090 Ti (SD v1.5, 512x512, fp16)

框架 性能
Vanilla PyTorch 16 it/s
AITemplate 31 it/s
TensorRT 33 it/s
OneFlow 39 it/s
Stable Fast (与 xformers & triton 共同工作) 38 it/s