惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Privacy & Cybersecurity Law Blog
Engineering at Meta
Engineering at Meta
Forbes - Security
Forbes - Security
MongoDB | Blog
MongoDB | Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
A
About on SuperTechFans
量子位
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
雷峰网
雷峰网
腾讯CDC
P
Proofpoint News Feed
S
Schneier on Security
S
Secure Thoughts
V
Visual Studio Blog
Help Net Security
Help Net Security
The Hacker News
The Hacker News
C
Cyber Attacks, Cyber Crime and Cyber Security
P
Privacy International News Feed
SecWiki News
SecWiki News
S
SegmentFault 最新的问题
T
Threatpost
小众软件
小众软件
MyScale Blog
MyScale Blog
F
Fortinet All Blogs
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
P
Proofpoint News Feed
T
Tailwind CSS Blog
I
Intezer
C
CERT Recently Published Vulnerability Notes
U
Unit 42
V
V2EX
Cyberwarzone
Cyberwarzone
Recorded Future
Recorded Future
O
OpenAI News
Project Zero
Project Zero
有赞技术团队
有赞技术团队
Google DeepMind News
Google DeepMind News
Last Week in AI
Last Week in AI
Hugging Face - Blog
Hugging Face - Blog
Know Your Adversary
Know Your Adversary
C
Cybersecurity and Infrastructure Security Agency CISA
Scott Helme
Scott Helme
V2EX - 技术
V2EX - 技术
博客园 - 叶小钗
S
Securelist
A
Arctic Wolf
The Cloudflare Blog
W
WeLiveSecurity
T
Threat Research - Cisco Blogs
博客园 - Franky

博客园 - iTech

AI Agent 写完代码谁来测?这个开源沙箱把 CI/CD 和多 Agent 协作全包了 7万星的AI交易框架:让大模型模拟投行多空辩论,自动做交易决策 71000颗星的AI交易团队:让大模型模拟投行分工,自动做交易决策 13400颗星的开源项目:输入一句话,AI全自动帮你做短视频 102颗星的沙盒:当AI学会自己写代码、跑测试、做部署 AI 技术日报 - 2026-05-08 29k 星的 PageIndex:不用向量数据库,靠推理就能做 RAG 每天花两小时刷信息?这个开源项目帮你全自动搞定 读源码像读小说?试了 DeepWiki 和 Zread,我再也不想裸读 GitHub 了 Matt Pocock 开源的这套 .claude 技能,为什么让工程师集体上头? Cursor Team Kit:Cursor 官方团队在用的 17 个 AI 工作流 AI 技术日报 - 2026-05-07 AI 技术日报 - 2026-05-06 AI 技术日报 - 2026-05-05 Anthropic CEO 说 12 个月内程序员要失业,我扒完他的底牌,发现事情没那么简单 把工程师的肌肉记忆装进 Claude Code,这个 4300 Star 的项目我后悔没早用 AI 技术日报 - 2026-05-04 AI 技术日报 - 2026-05-03 AI 技术日报 - 2026-05-02 六大 Agent 框架横评:谁支持 Skills?谁能自动创建 Agent?MCP 呢? Wechatsync:一个 Chrome 插件,一键把文章同步到 31 个平台 LangChain 开源了 Open SWE:Stripe、Ramp、Coinbase 内部都在造的编程 Agent Cockpit:把 Claude Code 从终端里搬出来,装进浏览器 Cursor 把自家的 AI Agent 开放了:写几行 TypeScript 就能调 Cursor 干活 AI 技术日报 - 2026-05-01 AI 写代码每次结果都不一样?Archon 用 YAML 工作流把 AI 编程变成流水线 AI 写代码比你快了,但你还是得学编程——只不过学法得换 腾讯的龙虾特工队:4 个 AI Agent 同日更新,全家桶正式成型 Agno 不做更聪明的 Agent,它要把所有 Agent 框架包进同一个操作系统 Hermes Agent 终于有了像样的 Web 界面,而且还支持远程访问 Datawhale 出了一套 29 学科知识地图,把 AI 的底牌全掀了 Hermes Agent 在聊天框里就能用的 20 种高级功能 一份 AGENTS.md 能顶一次模型升级?Augment Code 用数据说了算 NVIDIA 开源了一个「AI 沙箱」,20K Star,让 Agent 跑代码不再裸奔 60ms 冷启动、5MB 内存:腾讯开源的这个沙箱让 Docker 安全隔离像笑话 AI 技术日报 - 2026-04-30 AI 技术日报 - 2026-04-29 AI 技术日报 - 2026-04-28 Goose:Linux 基金会亲儿子,能撼动 Claude Code 和 OpenCode 吗? AI 技术日报 - 2026-04-27 AI 技术日报 - 2026-04-26 Google 把价值20美元/月的东西免费了,102K人已经抢到了 OpenClaw 和 Claude Code 网络搜索配置指南 AI 技术日报 - 2026-04-25 Anthropic 为什么遥遥领先:从 Cat Wu 专访看AI霸主的底层逻辑 同样 70B 参数,为什么 MoE 只激活 13B 就能打平 Dense? DeepSeek-V4 技术报告里藏着一条线:华为昇腾 NPU 已完成推理验证 DeepSeek-V4 深夜炸场:1M 上下文、384K 输出、双模型,API 定价直接卷到底 MacBook Air 跑大模型实测:Ollama、llama.cpp、LM Studio 谁才是本地推理之王? AI 技术日报 - 2026-04-24 OpenCode:Claude Code 的最佳平替 2026 开源大模型五国杀:Qwen 3.6 vs Gemma 4 vs Llama 4 vs GLM-5.1 vs DeepSeek V4 MCP 与 Skills 的你死我活:Anthropic 的 Agent 生态野心与开发者的站队困境 给 AI Agent 配搜索,国内能用的搜索 API 实测对比 AI 技术日报 - 2026-04-23 CC Switch:49K Star 的 Claude Code 登录绕过神器,还能管 Codex 和 Gemini CLI NVIDIA 开出 32 万美元年薪招 AI Agent 工程师,JD 里藏着这些信号 fast-mirror-skill 技术拆解:一个小而完整的 Claude Skill 是怎么设计的 Cursor 值 600 亿美元?马斯克这次赌的不是技术,是入口 AI 技术日报 - 2026-04-22 别再问 AI 能不能赚钱了:3 个上班族亲测有效的副业方法(2026 最新版) 10 分钟从零搞定 Hermes Agent:飞书微信双通道丝滑上线 AI 技术日报 - 2026-04-21 Anthropic 实战总结:AI Agent 的 3 种工作流模式,选错代价很大 安装 openclaw,hermes 慢的想发疯,fast-mirror-skill 来救了 Claude Routines:你下班睡觉了,Agent 还在为你干活 微信飞书里敲一个斜杠就能干活:Hermes Quick Command 到底多省事 AI 正在疯狂吃电:算力尽头是电力,谁能解这道题? AI 技术日报 - 2026-04-20 3K 行代码造一个越用越聪明的 AI Agent:GenericAgent 登顶 GitHub Trending 高德途途封神机器人半马,背后的 ABot-Claw 到底是什么 人们希望 AI 能干啥?Anthropic 调查:第一名不是赚钱,是变强 AI 时代人们在担心什么?Anthropic 的 13 条焦虑排行榜 OpenAI 官方 Agent SDK 来了:22k Star,支持 100+ 模型,Python 10 行代码上手 AI 技术日报 - 2026-04-19 OpenAgents Workspace:让 Claude Code 和 Codex 在同一个群里干活 Claude 是要干掉整个软件行业吗? Claude 官方推荐多 Agents 设计模式 多 Agent 系统的 5 种协调模式:选错了模式,再强的 Agent 也白搭 AI 技术日报 - 2026-04-18 AI 技术日报 - 2026-04-17 Better-Harness:让AI Agent自己优化自己的革命性框架 OpenClaw Workspace 完全指南:我的AI编程工作流 DeepSeek内蒙草原高薪招聘:AI时代的数字牧民梦,还是营销噱头? 2 核 2G 的阿里云 ECS 能跑 OpenClaw 吗?能,但有点折腾 AI 技术日报 - 2026-04-16 OpenCLI:一个命令行搞定 16+ 内容平台的神器 从零到精通:OpenClaw CLI 命令完全指南 AI 技术日报 - 2026-04-15 AI Agent 如何自我进化?Hermes Agent Self-Evolution 深度解析 AI 技术日报 - 2026-04-14 为什么你的飞书 Bot 总是连不上?OpenClaw Gateway 架构深度解析 OpenClaw 连接飞书的原理:Gateway、Channel 与消息流转 国内安装 Hermes Agent 踩坑全记录:从 GitHub 超时到正常跑起来的每一步 35 万 Star 的 OpenClaw:5 分钟部署你的私人 AI 助手,直连飞书 AI 技术日报 - 2026-04-13 公司用 AI 筛简历,这个开源项目让候选人用 AI 反选公司 为什么 Google ADK 可能是你下一个 Agent 框架——7 个改变游戏规则的特性 Microsoft Agent Framework 深度解析:架构设计与实战落地 AI 技术日报 - 2026-04-11
Mac 本地跑大模型完全指南:你的苹果电脑就是 AI 工作站
iTech · 2026-04-24 · via 博客园 - iTech

每一台 Apple Silicon Mac 都能跑本地大模型。问题不是能不能,而是跑哪个、跑多快。一个"能装进去"但只有 3 tok/s 的模型根本没法用。一个更小但 40 tok/s 的模型才是正解。

本文按内存大小逐级推荐模型,附真实性能数据。不讲"看情况"——给你具体答案,装上就能跑。

文章目录

  • Mac 为什么不一样
  • 内存带宽比芯片代数更重要
  • 8GB Mac:入门级
  • 16GB Mac:甜点起步
  • 24GB Mac:14B 开启
  • 36-48GB Mac:32B 的快乐
  • 64-96GB Mac:70B 级别
  • 128GB+ Mac:没有限制
  • MLX vs Ollama vs LM Studio
  • 这些模型能跑但别跑
  • 2026 年最佳 Mac AI 配置
  • 一句话决策树

Mac 为什么不一样

统一内存改变了游戏规则

PC 上,GPU 有自己的显存(通常 8-24GB)。模型塞不进显存,要么跑不了,要么靠 offloading 跑出 2-3 tok/s 的龟速。

Mac 没有独立显存。你的全部内存——从 8GB 到 192GB——都在 CPU 和 GPU 之间共享。一台 48GB 的 Mac Mini 能加载 32B 模型,PC 上这需要一块 $700+ 的二手 RTX 3090。128GB 的 Mac Studio 跑 70B 模型,PC 上需要 $3,000+ 的双 GPU 方案。

代价是 Mac 的内存带宽比独立显卡低。RTX 3090 推 936 GB/s,M4 Pro 推 273 GB/s。Token 生成速度直接正比于内存带宽,所以对于能塞进 GPU 显存的模型,Mac 慢 30-60%。但对于塞不进 GPU 显存的模型——Mac 赢在"至少能跑"。

内存带宽比芯片代数更重要

这是反直觉的部分:M3 Max(400 GB/s)生成 token 比 M4 Pro(273 GB/s)更快,尽管 M4 Pro 更新。

芯片 内存带宽 相对速度
M1/M2/M3/M4(基础版) 68-120 GB/s 1x
M1 Pro/M2 Pro/M3 Pro/M4 Pro 150-273 GB/s 2-2.5x
M1 Max/M2 Max/M3 Max/M4 Max 300-546 GB/s 3-5x
M1 Ultra/M2 Ultra/M3 Ultra 400-800 GB/s 4-7x

买 Mac 之前:查你具体芯片的带宽,不只是看代数。$1,799 的 Mac Mini M4 Pro 48GB 在 token 速度上会慢于 $2,700 的 Mac Studio M4 Max 64GB,即使跑同一个模型。

8GB Mac:入门级(M1/M2/M3/M4 基础版)

macOS 自己要吃 2-3GB。给模型留 5-6GB。只能跑 3B 模型,或极限量化下的 7-8B。

模型 大小 速度 最适合
Llama 3.2 3B ~2 GB 25-35 tok/s 通用聊天、基础问答
Phi-4 Mini 3.8B ~2.3 GB 25-40 tok/s 推理密集型任务
Qwen 3 4B ~2.5 GB 20-35 tok/s 多语言、指令遵循好

推荐:Llama 3.2 3B——快、轻松装下、给上下文留足空间。

别跑: 7B+ 模型 Q4 或更高量化。技术上能加载,但只剩 1-2GB 给上下文,频繁崩溃,4K token 限制。

实话实说: 8GB Mac 只适合小模型轻度使用。认真做本地 AI,内存升级是值得的。2026 年买 Mac,16GB 起步。

16GB Mac:甜点起步

7-8B 模型的最佳内存。可用 ~12-13GB。

模型 大小 速度 最适合
Qwen 3 8B Q4 ~5 GB 20-40 tok/s 最佳全能选手
Llama 3.1 8B Q4 ~4.5 GB 25-40 tok/s 通用助手
DeepSeek-R1-Distill-Qwen-8B ~4.5 GB 20-35 tok/s 推理、思维链
Qwen 2.5 Coder 7B Q4 ~4.5 GB 25-40 tok/s 代码生成

推荐:Qwen 3 8B(Q4_K_M)。 2026 年初最好的 8B 模型——指令遵循强、编码好、推理稳,/think 模式给你思维链。

编程专用:Qwen 2.5 Coder 7B。 专职编码模型,在编程任务上超越通用 8B。

推理专用:DeepSeek-R1-Distill-Qwen-8B。 数学和逻辑上的答案质量明显更好。

24GB Mac:14B 开启(M2 Pro 24GB / M4 Pro 24GB)

从这一级开始,模型质量出现质的飞跃。

模型 大小 速度 最适合
Qwen 3 14B Q4 ~9 GB 15-30 tok/s 最佳通用模型
DeepSeek-R1-Distill-14B Q4 ~8.5 GB 15-25 tok/s 复杂推理、数学
Llama 3.1 8B Q8 ~8.5 GB 25-45 tok/s 8B 最高质量

推荐:Qwen 3 14B(Q4_K_M)。 从 8B 到 14B 的跳跃是显著的——推理更好、长文更连贯、幻觉更少。Mac Mini M4 Pro 24GB 的甜点配置。

别碰: Qwen 3 32B Q3。技术上能塞进 24GB,但只剩 ~6GB 给上下文和系统开销,Q3 量化质量降得厉害,不如 14B Q4。

36-48GB Mac:32B 的快乐(M3 Pro 36GB / M4 Pro 48GB)

从这里开始变得激动人心。32B 模型跑得舒服,质量跳跃巨大。

模型 大小 速度 最适合
Qwen 3 32B Q4 ~20 GB 12-22 tok/s 最佳全能,专家级质量
DeepSeek-R1-Distill-32B Q4 ~20 GB 12-22 tok/s 推理、数学、复杂分析
Qwen 2.5 Coder 32B Q4 ~20 GB 12-22 tok/s 最佳本地编码模型

推荐:Qwen 3 32B(Q4_K_M)。 这就是让 Mac 本地 AI 值得的那个模型。复杂话题的专家级回答、强大的编码能力、优秀的创意写作。/think 模式处理 14B 搞不定的多步推理。48GB 有空间跑 16K+ 上下文。

编程专用:Qwen 2.5 Coder 32B。 全天写代码的人用这个。理解复杂代码库、生成更好的函数、抓住更多 bug。

Mac Mini M4 Pro 48GB,$1,799。 这个价位的最佳本地 AI 方案。静音、低功耗、32B 模型全天跑。

64-96GB Mac:70B 级别(M3 Max 64-96GB / M4 Max 64GB)

70B 模型变得实用。你达到了云端 API 的质量水平。

模型 大小 速度 最适合
Llama 3.3 70B Q4 ~40 GB 8-15 tok/s 最佳大型通用模型
Qwen 2.5 72B Q4 ~42 GB 8-14 tok/s 中文/多语言任务强
Qwen 3 32B Q6 ~26 GB 15-28 tok/s 32B 近无损质量
DeepSeek-R1-Distill-70B Q4 ~40 GB 8-14 tok/s 大规模推理

推荐:Llama 3.3 70B(Q4_K_M)。 70B 是一个巨大飞跃。这些模型在很多任务上匹敌 GPT-3.5,逼近 GPT-4。M4 Max 上 8-15 tok/s,比阅读速度慢但完全可用于交互式聊天。

替代方案:Qwen 3 32B Q6/Q8。 如果你更看重速度而非模型大小,32B 高量化给你比 Q4 更好的质量 + 15-28 tok/s。日常任务你不会想念 70B。

128GB+ Mac:没有限制(M4 Max 128GB / M3 Ultra 192GB)

"不做妥协"级别。想跑什么跑什么。

模型 大小 速度 最适合
Llama 3.1 70B Q6 ~55 GB 8-15 tok/s 70B 最高质量
Qwen 2.5 72B Q8 ~75 GB 8-12 tok/s 72B 近无损
Qwen3 235B-A22B Q4 ~88 GB 5-10 tok/s 本地能跑的最强 MoE
DeepSeek V3 Q3 ~110 GB 3-5 tok/s 前沿模型,慢但震撼

192GB(M3 Ultra)的福利: Qwen3 235B-A22B 是你能本地跑的最强模型。MoE 架构(235B 总参数 / 22B 每次激活),前沿级质量。5-10 tok/s——慢,但本地没有其他模型能比。

MLX vs Ollama vs LM Studio

三款工具都能在 Apple Silicon 上跑。区别在速度、易用性和界面。

工具 后端 速度(8B Q4, M4 Max) 安装难度 最适合
MLX-LM Apple MLX ~95-110 tok/s Python CLI 极致速度
Ollama llama.cpp ~75-85 tok/s 一行命令 最简单,API 服务器
LM Studio llama.cpp + MLX ~75-95 tok/s GUI 应用 可视化界面

MLX:速度至上

Apple 原生 ML 框架,统一内存从底层优化。比 llama.cpp 快 20-30%。

pip install mlx-lm
mlx_lm.generate --model mlx-community/Qwen3-8B-4bit --prompt "你好"

HuggingFace 上的 mlx-community 组织维护了几百个预转换模型。GGUF 有的,MLX 格式大概率也有。

Ollama:最简方案

包装了 llama.cpp,模型管理极致简化:

# 安装
curl -fsSL https://ollama.com/install.sh | sh

# 跑模型
ollama run qwen3:8b

一行装好,一行跑起来。自带 API 服务器,可以给 Open WebUI、Continue 等应用提供后端。

LM Studio:可视化

ChatGPT 风格的 GUI,可以浏览和对比模型,调节温度、top-p 等参数。最新版本用 MLX 做后端,速度接近 MLX-LM。适合不想碰终端的人。

这些模型能跑但别跑

这是最常见的坑:模型能加载进内存,但慢到没法用。

场景 实际速度 问题
70B Q4 在 64GB M4 Pro 4-7 tok/s 模型加载了,但只有 4GB 给上下文
32B Q4 在 24GB 6-10 tok/s + 崩溃 20GB 模型 + 4GB 系统/上下文 = 内存压力
8B Q4 在 8GB M1 10-15 tok/s,swap 时降到 5 以下 上下文限制 ~2K token

经验法则:模型文件不超过总内存的 60-70%。 剩余给 macOS、KV 缓存和框架开销。20GB 模型在 48GB Mac 上很舒服。20GB 模型在 24GB Mac 上是刀尖跳舞。

如果卡在边缘,降量化或选更小的模型。一个流畅的 14B 模型比一个卡顿的 32B 有用得多。

2026 年最佳 Mac AI 配置

预算 买这个 最佳模型 为什么
$599 Mac Mini M4 16GB Qwen 3 8B 最便宜的可用入门
$1,399 Mac Mini M4 Pro 24GB Qwen 3 14B 成本与能力的最佳平衡
$1,799 Mac Mini M4 Pro 48GB Qwen 3 32B 本地 AI 最佳性价比
$2,700 Mac Studio M4 Max 64GB Llama 3.3 70B 大模型最快带宽
$3,500 Mac Studio M4 Max 128GB Llama 3.1 70B Q8 没有妥协

$1,799 的 Mac Mini M4 Pro 48GB 是甜点。 32B 模型跑得舒服,放在桌上完全静音,AI 满载功耗 30W,一年的电费比一个月的 ChatGPT Plus 还便宜。

一句话决策树

  • 8GB: Llama 3.2 3B via Ollama。接受限制。
  • 16GB: Qwen 3 8B via Ollama。从这里开始有用。
  • 24GB: Qwen 3 14B。Mac Mini M4 Pro 入门配置。
  • 48GB: Qwen 3 32B。甜点——消费级硬件上的专家级回答。
  • 64GB+: Llama 3.3 70B。云端 API 质量,跑在你的桌面上。
  • 128GB+: 随便跑。你赢了本地 AI 的硬件彩票。
# 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 跑你的模型
ollama run qwen3:8b

你的 Mac 已经是一台合格的 AI 工作站了。选对模型,开跑。


作者: itech001
来源: 公众号:AI人工智能时代
主页: https://www.theaiera.cn,每日分享最前沿的AI新闻和技术。

本文首发于 AI人工智能时代,转载请注明出处。