惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
博客园_首页
WordPress大学
WordPress大学
大猫的无限游戏
大猫的无限游戏
有赞技术团队
有赞技术团队
阮一峰的网络日志
阮一峰的网络日志
Hugging Face - Blog
Hugging Face - Blog
博客园 - 【当耐特】
酷 壳 – CoolShell
酷 壳 – CoolShell
Y
Y Combinator Blog
Vercel News
Vercel News
The GitHub Blog
The GitHub Blog
T
The Blog of Author Tim Ferriss
云风的 BLOG
云风的 BLOG
博客园 - 司徒正美
Engineering at Meta
Engineering at Meta
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
J
Java Code Geeks
Stack Overflow Blog
Stack Overflow Blog
N
Netflix TechBlog - Medium
Martin Fowler
Martin Fowler
宝玉的分享
宝玉的分享
G
Google Developers Blog
Last Week in AI
Last Week in AI

问与答

智谱的 code plan 和 api 有什么区别么 你每天用的最多的 app 是啥? 有人做过 AI 标书吗? 星巴克用的什么牌子微波炉?加热好均匀 codex 中的 gpt5.5 出来了吗? 你们都用 coding plan 做什么? chatgpt 忽然间打不开了 想问下哪个 AI 可以生成网站? 我做了一个叫「订阅斩」的 iOS App,专门对付那些悄悄扣钱的订阅 求分享 SDD 相关实践经验 Grok 不充会员是不是会显示系统繁忙嘞 想要多人拼车开 gpt pro 100 刀 MiniMax 和 Kimi 便宜的 coding plan 真的恶心啊 国内的校友关系的网站为什么都没了? 请分享你的 clash 规则配置,开了 tun 模式,实在太卡了。 目前国产哪个模型 chat 最强? 现在做工具类小程序还能挣钱吗 老婆第一个母亲节,送点什么礼物呢 选哪种模型? vscode 插件 codex,一写代码 mac 风扇转个不停怎么解? 大家对于软件部门领导不参与代码工作有什么看法 为什么有那么多 V 友通过阴阳各种国货来质疑主流价值观? 好用的果蔬清洗机推荐 某网站的 HTTP API 和 WSS 都套了 CF,有什么办法找到真实服务器部署位置吗? 是我的幻觉吗,我为什么感觉国产模型现在真的很强, glm5.1 我斥巨资买了一个域名,准备做一个面向全球用户的校友社区,大家帮忙看看域名是否合适? 安卓淘宝每次启动进入淘宝精选,有办法不这样吗? 动态 JSON 序列化对强类型语言很难吗? 怎么做到说话简洁有条理且让人容易理解? 有没有在线实时语音识别的羊毛呢?
关于 5070ti 模型推理的速度和本地部署思考
tootfsg · 2026-05-19 · via 问与答
前置条件:5070ti 16g ,llama.cpp ,全跑在显存。

1. 跑 gemma4 26b a4b iq4_xs 量化( MoE 结构)

速度大概是 120t/s-150t/s ,首 token 和后续输出都很快

2. 跑 devstral small2 24b q4_k_m 量化 (稠密结构)

速度大概是 8t/s-10t/s ,首 token 可能很慢,整体输出都慢得多。



思考:

现在的模型有两种结构:稠密( Dense )和 MoE (混合专家模型)。

以上述两种模型举例

稠密模型是所有层( dev 这个有 40 层)都参与计算,消耗 24b 的完整算力,也就是单 token 2x24b=48gflops (不算量化),算力消耗大,推理成本高。

moe 是总共 26b 参数,每次推理只激活 4b

参数,只消耗激活参数 4b 的算力,单 token 算力消耗 2x4=8gflops ,算力消耗小很多,但有 26b 的参数(知识)。gemma 这个有 128 个专家,每次激活 8 个专家和 1 个共享专家(所有 token 必须首先经过共享专家),moe 模型是通过动态路由判断选择专家的。



可以看出算力需求差异巨大。



常见的几个顶级开源模型

glm5.1 参数 754b 激活 40b

deepseek-v4 pro 参数 1.6t 激活 49b

v4 flash 参数 284b 激活 13b

minimax2.5 参数 229b 激活 10b



moe 模型虽然每次激活的参数少,但必须把完整参数都全量加载到显存中。也就是说算力消耗大大减少,但显存需求没变。



可以大概推测,顶级大模型以后可能只有 moe 结构了,参数小的可能有稠密架构,因为算力成本还尚可接受,参数量很大的稠密结构,恐怕算力成本高到厂商也难以商用吧。



本地部署,我看来推理速度有 40-50token/s ,基本可以自用了,这是一个及格线。



我看来有两种比较好的本地部署方案



1. 买 nv 工作站显卡,pro6000 96g 咸鱼 6w 多,pro6000d 84g (显存没 ecc ,整体比 6000 略差)咸鱼 4w ,pro5000 84g 这种。

2. 用同等价钱稍微低点,等 m5 pro 的 mac mini/studio 发布后购买。



改显存,矿卡,二手的很久的专业卡等就不讨论了,不懂这部分。



mac 跑推理,olmx 官网我看了模型推理速度排行榜,还是差了点,不知道 4w 价钱的 m5 pro 的 mac mini/studio 会不会明显提高。



还有就是比如双 5070ti 跑模型推理,不知道速度怎么样,价钱相对不贵。我用的是 ddr4 pcie 4.0 的主板,双显卡要 pcie 拆分 8x8 ,pcie5.0 肯定更好,我得换主板换内存,成本太高,没法测试,如果内存没这么贵,就换主板买内存搞个 5060ti 16g 来测试了,这个可能也是一种方案吧。