惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
月光博客
月光博客
B
Blog RSS Feed
C
Check Point Blog
WordPress大学
WordPress大学
T
Tailwind CSS Blog
GbyAI
GbyAI
H
Help Net Security
Y
Y Combinator Blog
I
InfoQ
雷峰网
雷峰网
阮一峰的网络日志
阮一峰的网络日志
小众软件
小众软件
美团技术团队
博客园 - 三生石上(FineUI控件)
MongoDB | Blog
MongoDB | Blog
Jina AI
Jina AI
A
About on SuperTechFans
G
Google Developers Blog
爱范儿
爱范儿
F
Fortinet All Blogs
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
人人都是产品经理
人人都是产品经理

Local LLM

跑本地大模型 电费要多少? 多机异构显卡组合推理 本地部署 GLM-5.2 的门槛太高了,根本玩不起! 开源了一个 LLM 推理服务监控面板 大模型小白推荐一下本地模型 GLM5.2 个人感觉有点被吹大了 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 分享个自己在用的玩具 配置 kiro 的问题 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? Mac book air M5 32G+1TB 能跑本地大模型? 需要购买国产显卡本地部署大模型,哪家的比较好 mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 关于 5070ti 模型推理的速度和本地部署思考 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗?
部署本地模型 token 输出万能公式
diudiuu · 2026-04-20 · via Local LLM

比如看 dgx spark 这台机子,部署 31B BF16 gemma

这台机子的带宽 273 GB/s

31B 参数 × 2 bytes (BF16) ÷ 273 GB/s = 每个 token 227 ms = 理论最大 4.4 token/s

实际能到 3token/s 已经是牛逼 plus ,顶多 2.5token/s

所以有个关系,不要问能不能运行咋的,自己大概算下基本就知道能不能用

简单得推理我觉得至少要到25token/s,看起来才正常

1. 模型必须能加载完,显存只是基本条件

2. 必须要看内存带宽( Memory Bandwidth ),这个太低得话估计就是个跛子,我看几乎很少有人部署模型时注意这个配置,这个也是非常重要得参数

3. 上面得基本是按照英伟达机子算出来得,mac 机子比较特殊,基本只要能加载到 gpu 里面,剩余一点内存,就能用速度不会很慢( 20token/s 将就能用),冷启动稍微慢点

还有个本地模型部署,除了花大钱,本地部署就是玩玩可以,起码现在不要妄想超过线上得模型,尤其写代码方面

我个人认为现在本地模型能做得事

  1. ocr
  2. 总结做知识库
  3. openclaw 还有什么爱马仕这个推理也可以做,需要提前用线上模型完成复杂得代码,本地执行推理一定要记得做好机子散热,一定!!一定一定!!!

希望大家来交流自己得心得,大家共同学习进步