惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
T
Threatpost
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Tenable Blog
AWS News Blog
AWS News Blog
Know Your Adversary
Know Your Adversary
TaoSecurity Blog
TaoSecurity Blog
P
Palo Alto Networks Blog
Spread Privacy
Spread Privacy
I
Intezer
Security Latest
Security Latest
The Last Watchdog
The Last Watchdog
Google DeepMind News
Google DeepMind News
Help Net Security
Help Net Security
Cyberwarzone
Cyberwarzone
N
News and Events Feed by Topic
O
OpenAI News
A
Arctic Wolf
S
Secure Thoughts
Attack and Defense Labs
Attack and Defense Labs
N
News and Events Feed by Topic
M
MIT News - Artificial intelligence
F
Full Disclosure
P
Privacy International News Feed
The GitHub Blog
The GitHub Blog
T
Troy Hunt's Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
H
Hacker News: Front Page
aimingoo的专栏
aimingoo的专栏
S
Security @ Cisco Blogs
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Apple Machine Learning Research
Apple Machine Learning Research
Engineering at Meta
Engineering at Meta
Cloudbric
Cloudbric
大猫的无限游戏
大猫的无限游戏
Google Online Security Blog
Google Online Security Blog
Recent Announcements
Recent Announcements
H
Help Net Security
量子位
V
V2EX
美团技术团队
G
Google Developers Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
S
Schneier on Security
V2EX - 技术
V2EX - 技术
D
Docker
博客园 - 【当耐特】
Project Zero
Project Zero
博客园 - 司徒正美

Stable Diffusion

50 系显卡跑 sd1.5 的兼容性问题解决指南! - V2EX SD 要生成满意的图比我想象的难很多 - V2EX [求解答] 学习 sd 等精确绘图是否已经过时? - V2EX ComfyUI 如何变现 - V2EX 模型商用的定义是什么? - V2EX 文生图大模型都不是很大? - V2EX 有办法通过给一幅人像,换成指定图片的服装吗? - V2EX 一个基于 SDXL 的可以生成 Apple 风格 emoji 的模型 - V2EX macOS Stable Diffusion ? - V2EX Stable Diffusion 自建共享站 - V2EX 分享 GPT-4o mini 和 Stable Diffusion 3 等模型白嫖网站 - V2EX 刚开发了个免费不限次数 Stable Diffusion 3.5 图片生成器 - V2EX 做了一个 AI 图片站,最近比较热的 Stable Diffusion 3.5 - V2EX 求 AI 生图教程推荐, 以及学习路线 Stable Diffusion | Flux - V2EX 赐教: 可否通过本地 PC 替代云端实现 Stable Diffusion 生图,降低本? - V2EX flux1 模型整个体验下来,感觉比 Stable Diffusion 和 Midjourney 都厉害-Flux1ai - V2EX 写了一个目前最快的离线 AI 图像生成安卓 APP - V2EX 据说是比 Stable Diffusion 和 Midjourney 都厉害的开源图像生成模型 → FLUX.1 花费一个月时间,做了一款管理 Stable Diffusion 的工具 - V2EX 有偿求助 Stable Diffusion 生产艺术二维码。 - V2EX [开源自荐] 自动同步和保存你的 Stable Diffusion 作品 - V2EX Stable Diffusion 写实人物模型,怎么让他不出 X 图? - V2EX 做了一个 Stable diffusion 提示词生成工具 - V2EX 分享一款刚刚对外开放的在线的免费 Stable Diffusion 3 生图工具产品 - V2EX 简易 AI 图片 prompt 查看器 Stable Diffusion Prompt Reader v1.3.5 - V2EX 请教一下 Stable Diffusion 的问题 小白都能上手的 Stable Diffusion 在线生成器,有没有? 想研究下 stable diffusion,收一台 Windows 整机 求各位大佬,推荐个 ai 绘画的电脑配置 stable diffusion 使用同样的参数,似乎不能百分百复现别人的图片? - V2EX Stable Diffusion 桌面应用 - V2EX Fooocus —— 将 Stable Diffusion 和 Midjourney 设计相结合的开源模型 - V2EX Stable Diffusion 3 发布了,都没人讨论吗? - V2EX 各位都用 stable diffusion 做过啥有意思的事情 - V2EX 搞了一个可以体验 Stable Cascade 模型的网站: https://stablecascade.net - V2EX ai 绘画如何画多张人物保持一致的图片 - V2EX 玩过 stable diffusion 作图的大佬们,可以分享下你们的心得吗 - V2EX 使用开源的 stable diffusion 本地离线生成 ai 图片可以拿去卖吗? - V2EX Stable-Video-Diffusion Img to Videos - V2EX Stable Video Diffusion 发布已经几天了,看看 X 上的人怎么玩花活的。 - V2EX 花了 2 小时,快速做了一个 stable video diffusion 静态页面 - V2EX 这个好玩,基于 stable diffusion 的涂鸦转大作 - V2EX 苹果官方出的 ML Stable Diffusion 效果怎么样? - V2EX AI Tool: One Image to Generate a Video - V2EX Stable Diffusion 二次开发 OR AI 测肤 - V2EX 关于 Stable Video Diffusion,做个了小页面 - V2EX 原创:旗舰游戏显卡(980Ti,1080Ti,TiTan V,2080Ti,3090,4090), AI 画图 stable diffusion)和大模型(chatglm2-6b)推理性能横评 - V2EX
Stable Fast: 超轻量级 Stable Diffusion 推理优化框架 - V2EX
nethard · 2023-10-17 · via Stable Diffusion

本人第一个正式开源项目,欢迎大家关注!聚焦于推理优化领域,希望能帮助到有相关模型推理加速需求的朋友,或者希望学习这方面知识的朋友。

项目主页

这是什么?

stable-fast 是一个为 HuggingFace DiffusersNVIDIA GPUs 上的超轻量级推理优化库。 stable-fast 通过利用一些关键技术和特性提供超快的推理优化:

  • __CUDNN 卷积融合__:stable-fast 为各种组合的 Conv + Bias + Add + Act 计算模式实现了一系列功能齐全且完全兼容的 CUDNN 卷积融合运算符。
  • __低精度 & 融合的 GEMM__:stable-fast 实现了一系列使用 fp16 精度的融合 GEMM 运算符,这比 PyTorch 的默认设置更快(以 fp16 读取和写入,以 fp32 计算)。
  • __NHWC & 融合的 GroupNorm__:stable-fast 使用 OpenAI 的triton实现了高度优化的融合的 NHWC GroupNorm + GELU 运算符,消除了内存格式排列运算符的需要。
  • __完全追踪的模型__:stable-fast 改进了 torch.jit.trace 接口,使其更适合追踪复杂模型。几乎每一部分的 StableDiffusionPipeline 都可以被追踪并转换为 __TorchScript__。它比 torch.compile 更稳定,并且比 torch.compile 的 CPU 开销明显小,并支持 ControlNet 和 __LoRA__。
  • __CUDA Graph__:stable-fast 可以将 UNet 结构捕获到 CUDA Graph 格式,当批量大小小时可以减少 CPU 开销。
  • __融合的多头注意力__:stable-fast 仅仅直接使用 xformers 并使其与 TorchScript 兼容。

与其他加速库的差异

  • __快速__:stable-fast 是专门为 HuggingFace Diffusers 优化的。它在所有库中都实现了最佳性能。
  • __简约__:stable-fast 作为 PyTorch 的一个插件框架工作。它利用现有的 PyTorch 功能和基础设施,并与其他加速技术兼容,以及流行的微调技术和部署解决方案。

性能比较

A100 SXM 80GB (SD v1.5, 512x512, fp16)

框架 性能
Vanilla PyTorch 23 it/s
AITemplate 44 it/s
TensorRT 52 it/s
OneFlow 55 it/s
Stable Fast (与 xformers & triton 共同工作) 60 it/s

RTX 3090 Ti (SD v1.5, 512x512, fp16)

框架 性能
Vanilla PyTorch 16 it/s
AITemplate 31 it/s
TensorRT 33 it/s
OneFlow 39 it/s
Stable Fast (与 xformers & triton 共同工作) 38 it/s