惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
A
About on SuperTechFans
博客园 - 【当耐特】
Microsoft Security Blog
Microsoft Security Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
The GitHub Blog
The GitHub Blog
雷峰网
雷峰网
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
IT之家
IT之家
博客园 - 叶小钗
Google DeepMind News
Google DeepMind News
aimingoo的专栏
aimingoo的专栏
博客园 - 聂微东
B
Blog RSS Feed
H
Help Net Security
Recent Announcements
Recent Announcements
阮一峰的网络日志
阮一峰的网络日志
D
DataBreaches.Net
L
LangChain Blog
Vercel News
Vercel News

Local LLM

跑本地大模型 电费要多少? 多机异构显卡组合推理 本地部署 GLM-5.2 的门槛太高了,根本玩不起! 开源了一个 LLM 推理服务监控面板 大模型小白推荐一下本地模型 GLM5.2 个人感觉有点被吹大了 有支持 6000 Ada 使用 deepseek v4 flash 推理 的框架吗 分享个自己在用的玩具 配置 kiro 的问题 买 macbook pro 笔记本,跑本地模型,怎么配置性价比比较高? lama.cpp 目前有重大性能 bug: checkpoint 的巡回逻辑对于混合模型(比如 qwen3.6-27B)无效,从而导致大概率每次对话都要 prefill 全文,严重拖慢速度 GPU 跑 LLM 也会超频吗? DiffusionGemma Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到 什么? Apple Watch 也能本地跑 Qwen 了? 关于低算力 gpu 推理时 prefill 在总时长中的占比问题 现在大模型主流都用哪些 nVidia GPU? 需要购买国产显卡本地部署大模型,哪家的比较好 mac mini 跑本地模型,需要什么配置? Gemma4 12B 如何跑在 16G 显存上? mac 64g 能部署哪个本地大模型 消费级显卡(16G A 卡)是不是不适合运行 vllm 和 sglang,好像使用 transformer 推理都比这两个框架快,并且占用显存低 本地大模型最佳 Mac 配置选择 关于 5070ti 模型推理的速度和本地部署思考 有没有能够兼容 Win7 的离线模型工具 想折腾一个 AI 主机,请行家出手 锤子找钉子的项目分享:假想企业本地部署后不用人工洗库接入 llm 的中间层。 gemma4:31b-coding-mtp-bf16 有适合本地跑训练 AI 的电脑配置吗? 都 2026 年了,为什么还有人觉得 AMD 比 Nvidia 更适合部署本地大模型?
Mac book air M5 32G+1TB 能跑本地大模型?
TGOcc · 2026-06-08 · via Local LLM

先说结论,能跑,但没办法长期跑,主要问题是散热,外挂风扇支架也不太能解决问题,高强度跑温度上升快,持续高温机器会降频。如果考虑便携+生产力,推荐上 mac book pro 吧。

装了两个平台,ollama 跟 olmx ,测试下来,olmx 平台会更快些,考虑到机器 32G 的内存,能跑的模型大小不要超 22GB

附上部分主流模型下载容量大小及 olmx 平台测试结果给大家做参考

Qwen3.5-4B-MLX-4bit 2.85GB

gemma-4-26b-a4b-it-4bit 14.57GB

Qwen3.6-35B-A3B-4bit 15.13GB

GLM-4.7-Flash-4bit 15.71GB

gpt-oss-20b-MXFP4-Q8 11.27GB

oMLX - LLM inference, optimized for your Mac

Benchmark Model: Qwen3.5-4B-MLX-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test             TTFT(ms)    TPOT(ms)        pp TPS        tg TPS    E2E(s)    Throughput    Peak Mem
pp1024/tg128       1001.6       22.74  1022.4 tok/s    44.3 tok/s     3.889   296.2 tok/s     3.29 GB
pp4096/tg128       3540.9       23.76  1156.8 tok/s    42.4 tok/s     6.558   644.1 tok/s     3.90 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch         tg TPS    Speedup          pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x        44.3 tok/s      1.00x    1022.4 tok/s  1022.4 tok/s      1001.6       3.889
2x        88.3 tok/s      1.99x     407.6 tok/s   203.8 tok/s      3040.1       7.924
4x       175.1 tok/s      3.95x     322.7 tok/s    80.7 tok/s      6833.9      15.617


Benchmark Model: gemma-4-26b-a4b-it-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test             TTFT(ms)    TPOT(ms)        pp TPS        tg TPS    E2E(s)    Throughput    Peak Mem
pp1024/tg128       1500.5       24.21   682.4 tok/s    41.6 tok/s     4.575   251.8 tok/s    14.23 GB
pp4096/tg128       4863.4       25.14   842.2 tok/s    40.1 tok/s     8.056   524.3 tok/s    14.91 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch         tg TPS    Speedup          pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x        41.6 tok/s      1.00x     682.4 tok/s   682.4 tok/s      1500.5       4.575
2x        82.5 tok/s      1.98x     361.6 tok/s   180.8 tok/s      3495.8       8.767
4x       166.1 tok/s      3.99x     283.4 tok/s    70.8 tok/s      7840.6      17.536


Benchmark Model: Qwen3.6-35B-A3B-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test             TTFT(ms)    TPOT(ms)        pp TPS        tg TPS    E2E(s)    Throughput    Peak Mem
pp1024/tg128       1676.1       17.20   610.9 tok/s    58.6 tok/s     3.860   298.4 tok/s    18.80 GB
pp4096/tg128       5046.3       17.93   811.7 tok/s    56.2 tok/s     7.323   576.8 tok/s    19.24 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch         tg TPS    Speedup          pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x        58.6 tok/s      1.00x     610.9 tok/s   610.9 tok/s      1676.1       3.860
2x       116.2 tok/s      1.98x     435.5 tok/s   217.8 tok/s      2973.7       6.907
4x       230.7 tok/s      3.94x     352.0 tok/s    88.0 tok/s      6445.2      13.855


Benchmark Model: GLM-4.7-Flash-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test             TTFT(ms)    TPOT(ms)        pp TPS        tg TPS    E2E(s)    Throughput    Peak Mem
pp1024/tg128       1985.0       21.78   515.9 tok/s    46.3 tok/s     4.752   242.4 tok/s    16.27 GB
pp4096/tg128       6839.2       27.31   598.9 tok/s    36.9 tok/s    10.307   409.8 tok/s    17.34 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch         tg TPS    Speedup          pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x        46.3 tok/s      1.00x     515.9 tok/s   515.9 tok/s      1985.0       4.752
2x        91.5 tok/s      1.98x     362.7 tok/s   181.3 tok/s      3549.9       8.445
4x       174.9 tok/s      3.78x     321.2 tok/s    80.3 tok/s      6393.9      15.679


Benchmark Model: gpt-oss-20b-MXFP4-Q8
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test             TTFT(ms)    TPOT(ms)        pp TPS        tg TPS    E2E(s)    Throughput    Peak Mem
pp1024/tg128       1687.6       24.70   606.8 tok/s    40.8 tok/s     4.824   238.8 tok/s    11.67 GB
pp4096/tg128       4088.8       26.44  1001.8 tok/s    38.1 tok/s     7.446   567.3 tok/s    11.75 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch         tg TPS    Speedup          pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x        40.8 tok/s      1.00x     606.8 tok/s   606.8 tok/s      1687.6       4.824
2x        82.1 tok/s      2.01x     359.0 tok/s   179.5 tok/s      3489.1       8.822
4x       159.5 tok/s      3.91x     293.2 tok/s    73.3 tok/s      7335.0      17.180