惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
爱范儿
爱范儿
J
Java Code Geeks
L
LangChain Blog
V
V2EX
大猫的无限游戏
大猫的无限游戏
S
SegmentFault 最新的问题
博客园 - Franky
Microsoft Azure Blog
Microsoft Azure Blog
Jina AI
Jina AI
Blog — PlanetScale
Blog — PlanetScale
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
The Cloudflare Blog
博客园 - 司徒正美
B
Blog
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
罗磊的独立博客
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Apple Machine Learning Research
Apple Machine Learning Research
Engineering at Meta
Engineering at Meta
MyScale Blog
MyScale Blog
有赞技术团队
有赞技术团队
Hugging Face - Blog
Hugging Face - Blog

王苏洋Blog

做个人站点不想花钱买域名?eu.cc免费域名,一个账号白拿3个 为什么你越努力,越焦虑? 单层粗砂双面神器|王苏洋Blog 简单折腾一下博客|王苏洋Blog 折腾了一圈,还是回来了|王苏洋Blog 在浙江找了七八天工作,今天终于入职了|王苏洋Blog 5个简单博客优化思路|王苏洋Blog 期待过年?已成过去|王苏洋Blog 现在都没人玩博客了|王苏洋Blog 新站第一篇|王苏洋Blog 拼多多运营干货|王苏洋Blog 拼多多运营干货|王苏洋Blog
在本地跑一个大模型,从0到能用 - 王苏洋Blog
王苏洋 · 2026-07-29 · via 王苏洋Blog

王苏洋 2 阅读 1 评论 教程随笔

为什么要在本地跑模型?

ChatGPT、Claude、Gemini 这些在线服务已经很强了,但总有一些场景让你想把模型放在自己机器上:

  • 隐私数据:公司内部文档、个人日记、未公开代码,不想上传云端。
  • 网络不稳定:出差、校园网、偏远地区,在线服务可能随时掉线。
  • 成本控制:高频调用时,本地显存一次性投入,长期更划算。
  • 折腾的乐趣:毕竟,能在自己电脑上跑一个 70B 的模型,本身就挺酷的。

当然,本地部署也有代价:显存、电源、散热、调参。它不是万能解,而是特定场景下的一个可选项。


选型:Ollama vs LM Studio

如果你刚入门,建议从这两个工具开始。

工具优点缺点适合人群
Ollama命令行极简,一条命令拉模型;生态插件多界面较弱,主要面向开发者喜欢终端、想快速集成到工作流
LM Studio图形界面友好,内置聊天、模型搜索相对重,部分功能付费不想折腾命令行的普通用户

我自己的路径是:先用 LM Studio 验证模型能不能跑,再用 Ollama 常驻服务,配合 Obsidian/Cursor 做日常调用。


快速开始:用 Ollama 跑 Qwen3

以目前性价比很高的 Qwen3 为例,8B 版本在 16G 显存上能流畅运行。

1. 安装 Ollama

macOS / Linux:

curl -fsSL https://ollama.com/install.sh | sh

Windows 直接去官网下载安装包即可。

2. 拉取并运行模型

ollama pull qwen3:8b
ollama run qwen3:8b

第一次会下载约 5GB 的模型文件,之后就可以直接对话了。

3. 用 API 调用

Ollama 默认监听 11434 端口,兼容 OpenAI 风格的 API:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3:8b",
    "messages": [{"role": "user", "content": "帮我写一段 Python 快速排序"}]
  }'

这意味着你可以把它接到 ChatGPT-Next-Web、OpenWebUI、Cherry Studio 等客户端里,获得接近 ChatGPT 的体验。


几点实际经验

  1. 显存不够,量化来凑
    同样的 8B 模型,q4_K_M 量化后体积和显存占用能少一半,质量损失通常不明显。别一味追求 fp16。

  2. 上下文长度要量力而行
    本地模型不是服务器,上下文拉到 32K 以上,显存占用和生成速度都会显著恶化。日常写代码、查资料,8K 通常够用。

  3. 别把本地模型当万能大脑
    8B 级别的模型在逻辑推理、数学、长上下文方面仍有明显短板。适合场景:文档摘要、代码补全、格式转换、头脑风暴;不适合:复杂数学证明、跨多份长文档的严谨分析。

  4. 善用系统提示词
    给模型一个明确的角色和输出格式,能显著提升可用性。比如:

    你是一名资深后端工程师。回答要简洁,优先给出可运行的代码示例,并说明关键注意事项。
    

写在最后

本地大模型已经不是「极客玩具」了。随着 Qwen、Llama、Gemma 等开源模型越来越小、越来越强,普通笔记本也能跑出有实用价值的模型。

如果你的数据敏感、调用频繁,或者只是想少依赖一点云端服务,不妨花一会功夫搭一套本地环境。大概率你会发现:很多简单任务,本地模型已经够用了。