惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
S
Schneier on Security
A
Arctic Wolf
Scott Helme
Scott Helme
S
Securelist
Schneier on Security
Schneier on Security
W
WeLiveSecurity
Attack and Defense Labs
Attack and Defense Labs
Security Latest
Security Latest
Project Zero
Project Zero
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Know Your Adversary
Know Your Adversary
P
Palo Alto Networks Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Google DeepMind News
Google DeepMind News
P
Proofpoint News Feed
C
Check Point Blog
F
Full Disclosure
Stack Overflow Blog
Stack Overflow Blog
H
Hacker News: Front Page
T
The Blog of Author Tim Ferriss
TaoSecurity Blog
TaoSecurity Blog
Vercel News
Vercel News
A
About on SuperTechFans
N
News and Events Feed by Topic
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
The GitHub Blog
The GitHub Blog
S
Security Affairs
Y
Y Combinator Blog
T
The Exploit Database - CXSecurity.com
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Forbes - Security
Forbes - Security
IT之家
IT之家
WordPress大学
WordPress大学
Last Week in AI
Last Week in AI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
The Register - Security
The Register - Security
Jina AI
Jina AI
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog
K
Kaspersky official blog
Hacker News: Ask HN
Hacker News: Ask HN
C
Cisco Blogs
MyScale Blog
MyScale Blog
博客园 - 【当耐特】
T
Threat Research - Cisco Blogs
D
Docker
G
GRAHAM CLULEY

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
使用 CPU 推理 llama 结构的大模型
微信公众号 · 2023-09-16 · via 陈少文的网站

1. 本地容器运行

  • 启动 LLM
1
docker run --rm -p 8000:8000 shaowenchen/chinese-alpaca-2-7b-gguf:Q2_K

在 http://localhost:8000/docs 页面即可看到接口文档,如下图:

  • 部署一个简单的 Chat UI

这里需要注意的是 OPENAI_API_HOST 参数,需要设置为你的宿主机 IP 地址,而不是 localhost 127.0.0.1,否则无法访问。

1
docker run -e OPENAI_API_HOST=http://{YOUR_HOST_IP}:8000 -e OPENAI_API_KEY=random -p 3000:3000 ghcr.io/mckaywrigley/chatbot-ui:main

页面效果如下:

2. K8s 快速部署

  • 部署 LLM 应用
kubectl create deploy vicuna --image=shaowenchen/vicuna-33b-v1.3-gguf:full
kubectl expose deploy vicuna  --port 8000 --target-port=8000 --type=NodePort

这里也可以不暴露端口,只创建一个 service,然后在其他容器中使用 vicuna 作为域名访问。

  • 部署 Chat UI
1
2
3
kubectl create deployment chatgpt --image=ghcr.io/mckaywrigley/chatbot-ui:main
kubectl set env deployment/chatgpt OPENAI_API_HOST=http://vicuna:8000 OPENAI_API_KEY=random
kubectl expose deployment chatgpt --port=3000 --target-port=3000 --type=NodePort
  • 获取访问地址
1
2
3
4
NODE_PORT=$(kubectl get svc chatgpt -o jsonpath='{.spec.ports[0].nodePort}')
NODE_IP=$(kubectl get nodes -o jsonpath='{.items[0].status.addresses[0].address}')

echo "http://$NODE_IP:$NODE_PORT"

3. 测试与使用

提问:

请自我介绍下

回复:

你好,我是ChatGPT,一个基于OpenAI推理生成模型的大规模语言模型。借助 billions of words of internet text,我学习了很多关于语言、文化和知识的信息。我可以回答问题,提供建议或者与你进行对话。请随时向我提问,我会尽力为您提供有用的回答。

提问:

计算长为10厘米,宽为5厘米的矩形的面积。

回复:

为了计算这个矩形的面积,我们需要使用以下公式:面积 = 长 × 宽

在这个例子中,长度是10厘米,宽度是5厘米。所以,面积 = 10厘米 × 5厘米 = 50平方厘米。

提问:

给出三个保持健康的小贴士。

回复:

以下是三个建议,可以帮助您保持健康:

有氧运动:每周进行至少150分钟的中等强度有氧运动(如快走、慢跑、游泳或骑自行车),或75分钟高强度有氧运动(如跑步、山地单车或快速游泳)。
蔬菜和水果:每天摄入至少5份水果和蔬菜,包括深绿色蔬菜、莩大比尔类蔬菜和胡萝卜类蔬菜。这有助于摄入足够的纤维、维生素和矿物质,支持身体健康。
控制压力:学会应对生活中的压力,保持良好的心理和情绪状态。尝试瑜伽、深呼吸、散步或冥想等方法来降低紧张和焦虑。
这些建议可以帮助您保持健康,并为身体提供必要的营养和照顾。请根据您的年龄、性别、体重和健康状况进行调整。在开始新的生活方式之前,建议您咨询医生或其他健康专业人士。

看起来回答得还行,无论是 33b 的模型,还是 7b 的模型,都能给出合理的回答。当然,我只是使用了 HuggingFace 的 alpaca-data-gpt4-chinese 数据集进行了少量人工测试。

4. 性能问题

性能其实是我真正关心的一个问题,因为只有推理需要的资源与现有的资源相匹配,才能够在生产环境中快速部署与使用,否则将会面临高昂的采购成本。

4.1 CPU、IO 拉满,Mem 使用率低

直接看监控

  • IO 拉满

  • CPU 拉满

值得注意的是物理机器的 CPU 是 40 核的,但最多只能使用 20 核。在 Issues 中看到过调优的一个建议是,CPU 设置为机器的核心数的一半。目前观测到的情况,可能与这个建议有关。

在 40 核的机器上,推理使用的 CPU 维持在 20 核,无法继续提升。

  • Mem 使用率低

内存使用率让人很意外,CPU、IO、Mem 使用也太不均衡了,竟然只用了不到 3GB。

4.1 将内存挂载到文件系统

由于 IO 拉满,我猜测磁盘有瓶颈,约束了推理效率。于是将容器中的模型文件挂载到内存中,再次进行测试。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
spec:
  containers:
    - env:
        - name: MODEL
          value: /models/chinese-alpaca-2-7b-16k.Q4_K_S.gguf
      image: shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q4_K_S
      name: model
      volumeMounts:
        - mountPath: /mem
          name: mem
  dnsPolicy: ClusterFirst
  initContainers:
    - command:
        - sh
        - -c
        - cp /models/chinese-alpaca-2-7b-16k.Q4_K_S.gguf /mem
      image: shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q4_K_S
      imagePullPolicy: IfNotPresent
      volumeMounts:
        - mountPath: /mem
          name: mem
  nodeName: nodeX
  volumes:
    - emptyDir:
        medium: Memory
      name: mem

很可惜的是,推理效率并没有显著提升。那么,磁盘 IO 到底是在干什么呢?推理过程难道只要不到 3GB 的内存吗?如何加速推理过程,是我下一步需要关注的问题。

5. 一些已经打包好的模型镜像

  • chinese-alpaca-2-7b-16k
NameQuant methodSize
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q2_KQ2_K3.68 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q3_KQ3_K4.16 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q3_K_LQ3_K_L4.46 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q3_K_SQ3_K_S3.81 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q4_0Q4_04.7 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q4_KQ4_K4.95 GB
shaowenchen/chinese-alpaca-2-7b-16k-gguf:Q4_K_SQ4_K_S4.73 GB
  • vicuna-33b-v1.3
NameQuant methodCompressed Size
shaowenchen/vicuna-33b-v1.3-gguf:Q2_KQ2_K12.78 GB
shaowenchen/vicuna-33b-v1.3-gguf:Q3_KQ3_K14.81 GB
shaowenchen/vicuna-33b-v1.3-gguf:Q4_KQ4_K18.24 GB
shaowenchen/vicuna-33b-v1.3-gguf:Q5_KQ5_K21.72 GB
shaowenchen/vicuna-33b-v1.3-gguf:Q6_KQ6_K25.05 GB
shaowenchen/vicuna-33b-v1.3-gguf:Q8_0Q8_031.34 GB
shaowenchen/vicuna-33b-v1.3-gguf:fullfull56.07 GB
  • baichuan2-7b-chat
NameQuant methodSize
shaowenchen/baichuan2-7b-chat-gguf:Q2_KQ2_K7.59 GB
shaowenchen/baichuan2-7b-chat-gguf:Q3_KQ3_K8.61 GB
shaowenchen/baichuan2-7b-chat-gguf:Q3_K_LQ3_K_L9.23 GB
shaowenchen/baichuan2-7b-chat-gguf:Q3_K_SQ3_K_S7.93 GB
shaowenchen/baichuan2-7b-chat-gguf:Q4_0Q4_09.6 GB
  • llama-2-13b-langchain-chat
NameQuant methodSize
shaowenchen/llama-2-13b-langchain-chat-gguf:Q4_KQ4_K16.7 GB
shaowenchen/llama-2-13b-langchain-chat-gguf:Q5_KQ5_K19.5 GB

在这些模型中,除了 vicuna-33b,其他模型在 20 核 CPU 上都可以流畅推理,即使是 4 位量化也有不错的效果。如果需要量化精度更高的模型,可以去 HuggingFace 下载。

6. 总结

模型能力会逐步成为维持 IT 系统运作的基础能力。这件事正在发生,也在快速发生,重新构建上层应用迫在眉睫。本篇主要是研究如何在无 GPU 机器上推理大模型的部分笔记,主要内容如下:

  • 本地容器运行 LLM
  • K8s 快速部署 LLM
  • 测试与使用,Q4 量化就有不错的效果
  • 在推理过程中,IO 拉满,CPU 拉满,Mem 使用率低。Mem 的使用率低和请求并发数量有关。