惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
博客园 - 三生石上(FineUI控件)
V
V2EX
博客园 - 司徒正美
小众软件
小众软件
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
Last Week in AI
Last Week in AI
雷峰网
雷峰网
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Apple Machine Learning Research
Apple Machine Learning Research
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
S
SegmentFault 最新的问题
美团技术团队
Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
爱范儿
爱范儿
博客园 - 聂微东
量子位
J
Java Code Geeks
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Vercel News
Vercel News

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
使用 vLLM 应用验证推理节点
微信公众号 · 2025-01-16 · via 陈少文的网站

Please enable Javascript to view the contents

1. 制作镜像

为了方便测试,这里将模型文件打包到镜像中。

  • 下载模型
1
2
3
4
git clone https://huggingface.co/Qwen/Qwen1.5-1.8B-Chat
cd Qwen1.5-1.8B-Chat && git lfs pull
rm -rf .git
cd ..
  • 编写 Dockerfile
1
2
3
4
5
cat <<EOF > Dockerfile
FROM vllm/vllm-openai:latest
RUN mkdir -p /models/Qwen1.5-1.8B-Chat
COPY Qwen1.5-1.8B-Chat/* /models/Qwen1.5-1.8B-Chat
EOF
  • 编译镜像
1
nerdctl build --platform=amd64 -t registry-1.docker.io/shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64 .
  • 推送镜像
1
nerdctl push --platform=amd64 registry-1.docker.io/shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64

2. 主机上推理服务

  • 设置环境变量

国内

1
export IMAGE=shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64

国外

1
export IMAGE=registry-1.docker.io/shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64
  • 指定设备,运行服务
1
2
3
4
5
6
7
nerdctl run --gpus "device=1" \
    -p 8000:8000 \
    --name Qwen1.5-1.8B-Chat-allinone \
    --ipc=host \
    $IMAGE \
    --model /models/Qwen1.5-1.8B-Chat \
    --dtype=half
  • 测试推理接口
1
2
3
4
5
6
7
8
9
curl http://127.0.0.1:8000/v1/chat/completions \
     -H "Content-Type: application/json" \
     -d '{
         "model": "/models/Qwen1.5-1.8B-Chat",
         "messages": [
             {"role": "user", "content": "什么是大模型"}
         ],
         "max_tokens": 1024
     }'
  • 清理容器
1
nerdctl rm Qwen1.5-1.8B-Chat-allinone

3. 集群上推理服务

  • 设置环境变量

国内

1
export IMAGE=shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64

国外

1
export IMAGE=registry-1.docker.io/shaowenchen/demo:vllm-qwen-1.5-1.8b-chat-amd64

设置运行节点

  • 部署负载
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
kubectl apply -f - <<EOF
apiVersion: apps/v1
kind: Deployment
metadata:
  name: demo-vllm-qwen1.5-1.8b-chat
  namespace: default
spec:
  replicas: 1
  selector:
    matchLabels:
      app: demo-vllm-qwen1.5-1.8b-chat
  template:
    metadata:
      labels:
        app: demo-vllm-qwen1.5-1.8b-chat
    spec:
      nodeName: $NODE_NAME
      containers:
      - name: demo-vllm-qwen
        image: $IMAGE
        args:
            - "--dtype"
            - "half"
            - "--model"
            - "/models/Qwen1.5-1.8B-Chat"
EOF
  • 测试推理接口
1
kubectl exec -it deployment/demo-vllm-qwen1.5-1.8b-chat -- bash
1
2
3
4
5
6
7
8
9
curl http://127.0.0.1:8000/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
        "model": "/models/Qwen1.5-1.8B-Chat",
        "messages": [
            {"role": "user", "content": "什么是大模型"}
        ],
        "max_tokens": 1024
    }'
  • 清理负载
1
kubectl delete deployment demo-vllm-qwen1.5-1.8b-chat

微信公众号