惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Securelist
量子位
博客园_首页
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Cloudflare Blog
Hugging Face - Blog
Hugging Face - Blog
S
SegmentFault 最新的问题
IT之家
IT之家
博客园 - 聂微东
V
V2EX
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
云风的 BLOG
云风的 BLOG
aimingoo的专栏
aimingoo的专栏
S
Secure Thoughts
酷 壳 – CoolShell
酷 壳 – CoolShell
Stack Overflow Blog
Stack Overflow Blog
The Hacker News
The Hacker News
S
Schneier on Security
The GitHub Blog
The GitHub Blog
T
Tenable Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
美团技术团队
D
DataBreaches.Net
C
CERT Recently Published Vulnerability Notes
Hacker News - Newest:
Hacker News - Newest: "LLM"
D
Docker
V
Vulnerabilities – Threatpost
Recent Commits to openclaw:main
Recent Commits to openclaw:main
博客园 - 【当耐特】
The Register - Security
The Register - Security
博客园 - 叶小钗
Jina AI
Jina AI
MongoDB | Blog
MongoDB | Blog
H
Heimdal Security Blog
小众软件
小众软件
PCI Perspectives
PCI Perspectives
Spread Privacy
Spread Privacy
Help Net Security
Help Net Security
TaoSecurity Blog
TaoSecurity Blog
L
Lohrmann on Cybersecurity
A
About on SuperTechFans
S
Security Affairs
C
Cybersecurity and Infrastructure Security Agency CISA
Apple Machine Learning Research
Apple Machine Learning Research
Know Your Adversary
Know Your Adversary
Schneier on Security
Schneier on Security
www.infosecurity-magazine.com
www.infosecurity-magazine.com
WordPress大学
WordPress大学
Simon Willison's Weblog
Simon Willison's Weblog

Local LLM

跑本地大模型 电费要多少? - V2EX 多机异构显卡组合推理 - V2EX 本地部署 GLM-5.2 的门槛太高了,根本玩不起! - V2EX 开源了一个 LLM 推理服务监控面板 - V2EX 大模型小白推荐一下本地模型 - V2EX GLM5.2 个人感觉有点被吹大了 - V2EX 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 - V2EX 分享个自己在用的玩具 - V2EX 配置 kiro 的问题 - V2EX 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? - V2EX lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? Mac book air M5 32G+1TB 能跑本地大模型? 需要购买国产显卡本地部署大模型,哪家的比较好 mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗? - V2EX 都 2026 年了,为什么还有人觉得 AMD 比 Nvidia 更适合部署本地大模型? LiteChat 轻量级本地大模型聊天 WebUI,支持 vLLM DGX Spark、ASUS GX10、MSI EdgeXpert 看起来都像是一个母胎的产品,用起来有差别吗? 推荐一个 GPU 推理速度计算器, 可能方便买配件自建本地大模型的人用上 github 看到一个项目, 3090 跑 27B, 129tps,最高 207tps 请问各位大神,在隔离环境中,有本地 qwen 大模型,有没什么解决方案,做本地的知识库的方案,类似谷歌那个 notebooklm ,也勉强可以? 有一台 16 寸 m1max 64g+1T 满 GPU 的 MacBook Pro 适合部署哪个本地模型 - V2EX 私有化部署大模型的“终点”是 Mac 还是 Nvidia? 我自己的电脑是 5070Ti,总感觉跑一些模型算力不够 能一起给本地部署的开源模型做个适配的 coding agent 吗?我憋了口气 用 antirez 的 llama.cpp fork 把 DeepSeek v4 Flash 在本地跑起来了 全球本地部署开发者们一起,打造一个真正属于开源社区的 Coding Agent 了 自己做了一款在线 GPU 推理速度计算器 · TPS Calculator qwen3.6 27b 本地编码测试 xllm 真的比 vllm+plugin 性能好么? 各位推荐一个 32G Macbook air M5 可以跑的 moe 模型 我的开源项目,欢迎大家使用和批评,本地无字典字符型模型训练架构代码完全开源,可形成语义结构 请教一个关于模型训练主机配置的问题 我做了个工具让 8GB 显卡跑 30B 模型从 3 tok/s 提到 21 tok/s,记录一下技术发现 大伙有想过二次训练吗? 用 DGX Spark 做这些事情,是否能力合适/足够,有佬能解答吗?(估算也行) - V2EX 多台 GPU 之间怎么组网互联? 部署本地模型 token 输出万能公式 有没有简单版的 new-api 项目 想在本地部署 OCR 服务,解析美团的外卖订单截图,求推荐一个好用的 OCR 模型 本地部署靠不靠谱? - V2EX 为什么你该停止使用 Ollama - V2EX 本地大模型多大显存够用? 求可靠本地 vibe coding,有八卡的 L20 服务器 - V2EX 想掏一台 Mac mini M4 Pro 64G 跑 gemma4 31b Q4 接 openclaw 处理日常的问题,有人测试过速度吗? - V2EX 32B 本地 vibe coding 有能用的模型吗 - V2EX Gemma4 + LiteRT-LM 真得有点的东西, e2b 内存仅 2G 左右占用, 在 天玑 的安卓机上跑的飞快. - V2EX 闲置 16GB M1 Pro MBP 跑大模型 - V2EX 有人用 mac studio 测试过 gemma4 31b 16 吗 - V2EX gemma4:e4b 的效果出乎意料, 1050ti 也能很好的生成文章 - V2EX 谷歌的 Gemma 4 怎么样,有必须要本地弄一下吗 - V2EX 2 年以后的硬件和本地大模型 - V2EX 为什么 Qwen 吹这么牛,但是用起来体验这么拉啊,它的真实能力究竟怎么样 - V2EX Gemma 4 31B 大概什么水平,本地部署是不是又成为现实了 - V2EX qwen 本地大模型的问题 - V2EX 好奇有没有人用本地模型写代码? macbook 32G 内存, M5 芯片本地跑大模型有推荐的吗? - V2EX 本地部署 deepseek 70B,回答乱码 - V2EX 3090 跑文本向量模型可以么? 3090 是不是有点过剩? 家用机带宽太小玩不转 local llm 啊 想部署本地大模型来分析股票趋势,有没有专门针对股票的大模型? - V2EX minimax 挂了?? qwen3.5 过度思考的问题 [求助] DGX Spark 上 Ollama 推理极慢,改用 llama.cpp 部署是否更合适? 如何在 vs code 上应用自建的 ollama 模型 现在能本地部署最好的 TTS 是哪套, 太多了,没法都去试 本地 8G RTX4060 破卡,可以产多少 tokens? 如何在内网使用 opencode Qwen3.5-35B-A3B microgpt.py 30B 尺寸哪个小模型编码能力会好一些 ClawdBot 保姆级安装指南:从零搭建你的 24/7 私人 AI 助手 [求助] 求成本可控,性能过关的本地 vibe coding 方案 个人玩 ai,显卡最低起步是 5080 嘛? intel b60 48G 可以买吗 - V2EX 现在还有类似 nextchat 这样的 web 工具可以用自定义 api 使用的吗? 3070RTX 32GB i9 内存 1TB 的游戏本 推荐用来跑什么 AI 工具呢? - V2EX 本地大模型目前意义大吗? 寻找本地搭建方案有偿 讨论下自建内网 RAG 知识库和 AGENT 平台 使用 Nexa 提供的 SDK 在手机上运行端侧大模型 想问问大家有没有搭建本地的 LLM,我对应用场景挺困惑的 想学习下大模型,有什么论文网站推荐吗 Q: 关于读大部头 PDF 和 Mac Mini M4 能做的事情有些问题? 目前开源可以本地部署的模型有哪些? V 友们,有没有推荐的本地台式机文生图的方案?
关于 5070ti 模型推理的速度和本地部署思考
tootfsg · 2026-05-19 · via Local LLM

前置条件:5070ti 16g ,llama.cpp ,全跑在显存。

1. 跑 gemma4 26b a4b iq4_xs 量化( MoE 结构)

速度大概是 120t/s-150t/s ,首 token 和后续输出都很快

2. 跑 devstral small2 24b q4_k_m 量化 (稠密结构)

速度大概是 8t/s-10t/s ,首 token 可能很慢,整体输出都慢得多。

思考:

现在的模型有两种结构:稠密( Dense )和 MoE (混合专家模型)。

以上述两种模型举例

稠密模型是所有层( dev 这个有 40 层)都参与计算,消耗 24b 的完整算力,也就是单 token 2x24b=48gflops (不算量化),算力消耗大,推理成本高。

moe 是总共 26b 参数,每次推理只激活 4b

参数,只消耗激活参数 4b 的算力,单 token 算力消耗 2x4=8gflops ,算力消耗小很多,但有 26b 的参数(知识)。gemma 这个有 128 个专家,每次激活 8 个专家和 1 个共享专家(所有 token 必须首先经过共享专家),moe 模型是通过动态路由判断选择专家的。

可以看出算力需求差异巨大。

常见的几个顶级开源模型

glm5.1 参数 754b 激活 40b

deepseek-v4 pro 参数 1.6t 激活 49b

v4 flash 参数 284b 激活 13b

minimax2.5 参数 229b 激活 10b

moe 模型虽然每次激活的参数少,但必须把完整参数都全量加载到显存中。也就是说算力消耗大大减少,但显存需求没变。

可以大概推测,顶级大模型以后可能只有 moe 结构了,参数小的可能有稠密架构,因为算力成本还尚可接受,参数量很大的稠密结构,恐怕算力成本高到厂商也难以商用吧。

本地部署,我看来推理速度有 40-50token/s ,基本可以自用了,这是一个及格线。

我看来有两种比较好的本地部署方案

1. 买 nv 工作站显卡,pro6000 96g 咸鱼 6w 多,pro6000d 84g (显存没 ecc ,整体比 6000 略差)咸鱼 4w ,pro5000 84g 这种。

2. 用同等价钱稍微低点,等 m5 pro 的 mac mini/studio 发布后购买。

改显存,矿卡,二手的很久的专业卡等就不讨论了,不懂这部分。

mac 跑推理,olmx 官网我看了模型推理速度排行榜,还是差了点,不知道 4w 价钱的 m5 pro 的 mac mini/studio 会不会明显提高。

还有就是比如双 5070ti 跑模型推理,不知道速度怎么样,价钱相对不贵。我用的是 ddr4 pcie 4.0 的主板,双显卡要 pcie 拆分 8x8 ,pcie5.0 肯定更好,我得换主板换内存,成本太高,没法测试,如果内存没这么贵,就换主板买内存搞个 5060ti 16g 来测试了,这个可能也是一种方案吧。

  • 推理
  • 模型
  • 部署

    9 条回复    2026-05-20 16:25:35 +08:00

    tootfsg

    1

    tootfsg      5 月 19 日 via Android

    可以看出,统一内存只适合 MoE

    coefu

    2

    coefu      5 月 20 日   ❤️ 1

    1 ,开源 70B 以下参数的 moe 逻辑能力比 dense 差太多了。

    层宽和层深之间有个甜点位,不同参数量的甜点位又不同。总体来看,那几个大的 moe ,active 的 expert 层数应该都要搞到 40 ~ 60 ,在宽度上做取舍。

    gemma4 E4B 有 42 层,比 qwen3.5 9B 的 32 层 更深,按理来说,逻辑能力应该更好,但是受限于总参数量导致的宽度窄,表征能力不行,所以更容易在逻辑推理的起始位就跑偏,导致整个推理完全无法收敛。这点,通过中等数学的奥赛题可以验证。就算是 gemma4 E4B 横向增加 experts + router ,把总参数也堆起来,依然也无法解决问题。

    2 ,dense 只需要在原始架构上达到了甜点位,横向+experts + router ,依然很能打。如果这种架构做层 plug-in 模式,更有搞头。总体来看,在 linear attention 这条路线上来看 qwen3.6 27B 已经是甜点位了。在纯 transformer 路线上来看 gemma4 31B 似乎也到了甜点位。如果可以搞一个 plug-in 架构,类似 TTT 模式,那真的就是开源福音。

    uprit

    3

    uprit      5 月 20 日

    你那个 devstral small2 24b q4_k_m ,肯定爆显存了,部分内容跑在内存里了,所以才这么慢。

    tootfsg

    4

    tootfsg      5 月 20 日 via Android

    @uprit 没爆显存,我所有模型都开-ngl 99 的,我 cpu 很低,10t/s 都跑不了的,而且爆了直接启动不了的,光上下文调了很多次的。
    不过确实慢了,我记着以前好像是 20 多 t/s 的。我怀疑可能是 cuda 的版本问题,我电脑有 13.1 和 13.2 ,但是 13.2 有人提起过可能有问题。

    启动参数 ngl 99 ,fa on ,jinja ,ctk q8 ,ctv q4 ,np 1 ,c 25600 ,启动后占用显存 15193 ,模型 13302 ,上下文 1625 。

    我 cpu 是 12400f 和 ddr4 ,这个跑不了 10t/s 吧
    唯一的可能就是可能指定了 cuda13.2 编译 llama.cpp 。

    tootfsg

    5

    tootfsg      5 月 20 日 via Android

    @uprit 稠密模型特别耗算力,光纸面比较就比 26b a4b 高了 6 倍算力需求。

    tootfsg

    6

    tootfsg      5 月 20 日 via Android

    说起稠密模型,前些天 mistral 发布了一个 110b 的稠密模型,大的吓人,我想试试,可是中转都买不到。

    tootfsg

    7

    tootfsg      5 月 20 日 via Android

    @uprit 我刚才用 cuda13.1 重新编译了最新 llama.cpp ,发现问题了,不是 cuda 版本问题,是上下文问题。
    我在之前的 chat 上继续问一开始也是 10t/s ,然后我开新 chat ,速度刚开始有 45t/s ,随着输出速度越来越低,完成任务最后 32.08t/s ,总共 1424tokens ,44s 。
    然后我问了第二个问题,刚开始有 22t/s ,速度也是随着输出越来越慢,完成后 17.72t/s ,1813tokens ,1min 42s 。
    两个问题都是编程相关问题,实现某个小功能。
    到此,原因总算是真相大白,水落石出了。

    uprit

    8

    uprit      5 月 20 日

    模型本身就接近 16GB 了,上下文本身就需要占用一部分显存的。-ngl 99 ,不能保证全部加载到 GPU 里,GPU 显存不够,自然会有些层数卸载到内存上。

    tootfsg

    9

    tootfsg      5 月 20 日 via Android

    @uprit 设置-ngl 99 ,不全量加载到显存,启动是直接报错退出的,根本不会使用内存。
    你是用 ai 自动回复的吗,怎么和网页版 gemini 给我的感觉太相似了,那种降智感,一模一样。
    模型接近 16g... 我上面发了模型占 13.3g 。