惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Tailwind CSS Blog
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
L
LangChain Blog
博客园_首页
Recent Announcements
Recent Announcements
月光博客
月光博客
酷 壳 – CoolShell
酷 壳 – CoolShell
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
H
Hackread – Cybersecurity News, Data Breaches, AI and More
爱范儿
爱范儿
博客园 - 叶小钗
博客园 - 【当耐特】
The Cloudflare Blog
J
Java Code Geeks
G
Google Developers Blog
云风的 BLOG
云风的 BLOG
Blog — PlanetScale
Blog — PlanetScale
博客园 - 司徒正美
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans

Local LLM

跑本地大模型 电费要多少? 多机异构显卡组合推理 本地部署 GLM-5.2 的门槛太高了,根本玩不起! 开源了一个 LLM 推理服务监控面板 大模型小白推荐一下本地模型 GLM5.2 个人感觉有点被吹大了 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 分享个自己在用的玩具 配置 kiro 的问题 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? Mac book air M5 32G+1TB 能跑本地大模型? 需要购买国产显卡本地部署大模型,哪家的比较好 mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 关于 5070ti 模型推理的速度和本地部署思考 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗?
闲置 16GB M1 Pro MBP 跑大模型
ahdw · 2026-04-08 · via Local LLM

最后的发现

关于量化:

  1. TurboQuant 的编解码都要消耗 M1 Pro 相对孱弱的 APU 性能
  2. 模型权重量化,比如 Q4_K_M 带来的总数据量减少,会被相应的编解码损耗抵消
  3. 最终的效果就是,在 KV Cache 的量化方式相同时,高精度权重,比如 Q8_0,速度会稍慢于 Q4_K_M; 3.1 对同一个权重文件来说,-ctk 用 q8_0,-ctv 用 turbo4 会比两个都用 turbo4 更快 3.2 M5 之前的机型不要轻易尝试 TQ4_1S 这样的量化,虽然 RAM 压力会小,但是编解码的计算开销没有 Tensor API 的加速,对这些老机型来说会导致 tokens/s 的惨烈降低

关于模型:

  1. Qwen3.5-9B-Q4_K_M.gguf 确实很强,质量很高,但是在这台机器上很慢,只有 15-18 tokens/s,而且思考模式关不掉,太啰嗦了,洗车问题和长杆进门问题能思考5分钟以上,甚至10分钟,消耗完 4K-8K 的上下文窗口,都到不了正式回答。但是质量很高,能通过洗车测试,概率通过长杆进门测试
  2. Qwopus3.5-9B-Q4_K_M.gguf 确实改善了原生 Qwen3.5 的一些问题,比如不那么啰嗦了,思考也简短了。但是感觉智力变低了,我无法接受。速度没有变化。
  3. Gemma-4-E4B-IT-Q4_K_M.gguf 很平衡,速度能达到 22-28 tokens/s,思考模式可以关闭,但无法通过洗车测试和长棍进门测试
  4. Gemopus-4-E4B-IT-PREVIEW-Q4_K_M.gguf 速度没有提高,默认没有打开思考模式,但是感觉整体降智严重

关于上下文窗口:

感谢 TurboQuant+,在模型权重量化的基础上,让 KV Cache 也显著缩小了体积。最终在 16 GB RAM M1 Pro MBP 上使用上面的模型,都能有 48K 的上下文,还有余裕。

64K 能启动 llama-server,但使用时会报错。

96K 无法启动 llama-server。

log snippet

太长了放不下,回复在内容里面了。