惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
Martin Fowler
Martin Fowler
Vercel News
Vercel News
U
Unit 42
Engineering at Meta
Engineering at Meta
aimingoo的专栏
aimingoo的专栏
MyScale Blog
MyScale Blog
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
爱范儿
爱范儿
Apple Machine Learning Research
Apple Machine Learning Research
博客园_首页
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
B
Blog RSS Feed
N
Netflix TechBlog - Medium
GbyAI
GbyAI
F
Fortinet All Blogs
MongoDB | Blog
MongoDB | Blog
大猫的无限游戏
大猫的无限游戏
C
Check Point Blog
M
MIT News - Artificial intelligence
D
Docker
IT之家
IT之家
Stack Overflow Blog
Stack Overflow Blog

博客园 - VipSoft

FastAPI 全局 HTTP 异常处理器 + 统一响应封装 SpringBoot 心跳日志不记录 access.log Qdrant Linux 安装(非Docker) LangChain — RAG 知识库(实操) LangChain — RAG 构建知识库(理论) LangChain — RAG 构建知识库(实操) Python PyCharm 运行,取不到 .env 文件中的值 Qdrant 安装(Windows) LangChain — RAG 构建知识库 Python 项目简单部署(Linux) MinerU - 将非结构化文档(PDF、图片、Office 文件等)转换为机器可读的 Markdown 和 JSON LangChain 入门 服务端部署-FastAPI LangChain 入门 LangSmith LangChain 入门 实战 - 食谱推荐 LangChain 入门 Memory 会话记忆 LangChain 入门 Tools 工具 LangChain 入门 Tools 工具 LangChain 入门 Prompts 提示词 LangChain 入门 Message 消息 LangChain 入门 Model 的初始化和调用 LangChain 入门 Agent 的基本运行机制 AI 0基础学习,名词解析 LangChain 和 LangGraph AI大模型知识体系 Dify — Workflow - 数据可视化 Dify — 连接MySQL配置 Dify — Chatflow - 数据库智能查询 Dify — Chatflow - 文档知识库 Dify — Agent 智能体 高安全券码、注册码生成
Ollama Qwen — 安装测试
VipSoft · 2026-05-22 · via 博客园 - VipSoft

Windows 系统,内存32G、CPU Gen Intel(R) Core(TM) i7-12700 、集成显卡 Intel(R) HUD Graphics 770

语言内模型

  • Gemma
  • DeepSeek
  • Qwen

视频类的模型

  • llava
  • phi
  • minicpm-v

本地运行,不要,不要超过10G,不然跑了吃力

Qwen3-4B 是这台 32G 内存机器的“甜点级”选择。它比 1.7B 更聪明,比 7B 更轻快,非常适合处理复杂的合同章节逻辑。

一、上面的配置跑 Qwen3-4B 怎么样?

4B:表示 40亿的模型训练参数

结论:完全可行,是纯 CPU 环境下的“黄金尺寸”。

  • 内存占用:4-bit 量化后的 Qwen3-4B 权重约 2.5GB~3GB。加载模型加上推理时的 KV Cache,总内存占用通常在 8GB~12GB 左右。你的 32GB 内存绰绰有余,甚至可以同时跑 PaddleOCR 服务。
  • 速度体验:在 i7-12700 上,预计生成速度约 6~10 token/秒。处理一份 10 页的合同(约 3000 字),生成 JSON 结构大约需要 30~60 秒。这比 7B 模型快了一倍,属于“业务可接受”的延迟。
  • Ollama 支持:Ollama 官方已收录 qwen3:4b 标签,直接拉取即可,无需手动折腾 GGUF 文件。

二、Qwen3-4B 相比 1.7B 的优势

对于你的“合同章节识别”任务,4B 的提升是实质性的:

  1. 结构理解更强:4B 参数更多,在理解“1. 总则 -> 1.1 定义 -> 1.1.1 条款”这种多级嵌套章节时,准确率和稳定性显著高于 1.7B。
  2. 格式更稳:输出复杂的 JSON 结构时,4B 更少出现格式错误(如括号不匹配、字段遗漏),减少了后处理的工作量。
  3. 长上下文更稳:Qwen3-4B 拥有 32K 的上下文窗口,处理长合同时的表现比小模型更可靠。

三、最终选型建议(纯 CPU 环境)

模型 推荐度 适用场景
Qwen3-4B ★★★★★ 强烈推荐。在速度和能力上取得了完美平衡,是处理含复杂章节合同的性价比之王。
Qwen3-1.7B ★★★★☆ 适合合同结构简单(如只有一二级标题),且对速度要求极高的场景。
Qwen3-7B ★★☆☆☆ 在纯 CPU 下太慢(~3 token/s),仅适合极少量、高价值的深度解析。

建议:直接部署 Qwen3-4B。它既能满足你识别章节内容的需求,又不会像 7B 那样拖慢整个系统。

🚀 极简部署方案(Ollama for Windows)

1. 安装 Ollama
Ollama Windows 安装 & 指定安装目录:https://www.cnblogs.com/vipsoft/p/20120161

2. 拉取 Qwen3.5 模型(CPU 优化版)
访问 Ollama 官网模型库:https://ollama.com/library
打开 PowerShell 或 CMD,执行以下命令拉取适合你配置的模型:

# 运行 Qwen3.5:4b(最推荐,模型约3.4GB)
ollama run qwen3.5:4b

image

http://localhost:11434/

image

测试

image

接口调用

image

image

删除模型

ollama rm qwen3.5:4b