闲置 16GB M1 Pro MBP 跑大模型
ahdw
·
2026-04-08
·
via V2EX
最后的发现
关于量化:
- TurboQuant 的编解码都要消耗 M1 Pro 相对孱弱的 APU 性能
- 模型权重量化,比如 Q4_K_M 带来的总数据量减少,会被相应的编解码损耗抵消
- 最终的效果就是,在 KV Cache 的量化方式相同时,高精度权重,比如 Q8_0,速度会稍慢于 Q4_K_M;
3.1 对同一个权重文件来说,-ctk 用 q8_0,-ctv 用 turbo4 会比两个都用 turbo4 更快
3.2 M5 之前的机型不要轻易尝试 TQ4_1S 这样的量化,虽然 RAM 压力会小,但是编解码的计算开销没有 Tensor API 的加速,对这些老机型来说会导致 tokens/s 的惨烈降低
关于模型:
- Qwen3.5-9B-Q4_K_M.gguf 确实很强,质量很高,但是在这台机器上很慢,只有 15-18 tokens/s,而且思考模式关不掉,太啰嗦了,洗车问题和长杆进门问题能思考5分钟以上,甚至10分钟,消耗完 4K-8K 的上下文窗口,都到不了正式回答。但是质量很高,能通过洗车测试,概率通过长杆进门测试
- Qwopus3.5-9B-Q4_K_M.gguf 确实改善了原生 Qwen3.5 的一些问题,比如不那么啰嗦了,思考也简短了。但是感觉智力变低了,我无法接受。速度没有变化。
- Gemma-4-E4B-IT-Q4_K_M.gguf 很平衡,速度能达到 22-28 tokens/s,思考模式可以关闭,但无法通过洗车测试和长棍进门测试
- Gemopus-4-E4B-IT-PREVIEW-Q4_K_M.gguf 速度没有提高,默认没有打开思考模式,但是感觉整体降智严重
关于上下文窗口:
感谢 TurboQuant+,在模型权重量化的基础上,让 KV Cache 也显著缩小了体积。最终在 16 GB RAM M1 Pro MBP 上使用上面的模型,都能有 48K 的上下文,还有余裕。
64K 能启动 llama-server,但使用时会报错。
96K 无法启动 llama-server。
log snippet
太长了放不下,回复在内容里面了。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。