惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
A
About on SuperTechFans
WordPress大学
WordPress大学
I
InfoQ
The GitHub Blog
The GitHub Blog
N
Netflix TechBlog - Medium
Hugging Face - Blog
Hugging Face - Blog
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
Recorded Future
Recorded Future
D
DataBreaches.Net
大猫的无限游戏
大猫的无限游戏
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
aimingoo的专栏
aimingoo的专栏
月光博客
月光博客
罗磊的独立博客
博客园 - 叶小钗
量子位
H
Hackread – Cybersecurity News, Data Breaches, AI and More
T
The Blog of Author Tim Ferriss
Vercel News
Vercel News
G
Google Developers Blog
F
Fortinet All Blogs
博客园 - 三生石上(FineUI控件)
Microsoft Security Blog
Microsoft Security Blog
Engineering at Meta
Engineering at Meta
IT之家
IT之家
S
SegmentFault 最新的问题
B
Blog RSS Feed
MyScale Blog
MyScale Blog
Jina AI
Jina AI
The Register - Security
The Register - Security
Stack Overflow Blog
Stack Overflow Blog
博客园 - Franky
Attack and Defense Labs
Attack and Defense Labs
Webroot Blog
Webroot Blog
H
Hacker News: Front Page
C
Check Point Blog
博客园_首页
云风的 BLOG
云风的 BLOG
Recent Announcements
Recent Announcements
Schneier on Security
Schneier on Security
T
Tailwind CSS Blog
The Last Watchdog
The Last Watchdog
宝玉的分享
宝玉的分享
B
Blog
O
OpenAI News
博客园 - 【当耐特】
有赞技术团队
有赞技术团队
D
Docker

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
NVIDIA RTX 5090 推理测试
微信公众号 · 2025-09-09 · via 陈少文的网站

Please enable Javascript to view the contents

1. 安装驱动

  • 下载驱动

访问 https://www.nvidia.com/en-us/drivers/ 选择对应的驱动版本下载

1
wget https://us.download.nvidia.com/XFree86/Linux-x86_64/580.76.05/NVIDIA-Linux-x86_64-580.76.05.run
  • 安装驱动
1
bash NVIDIA-Linux-x86_64-580.76.05.run
  • 查看显卡
1
2
3
GPU 0: NVIDIA GeForce RTX 5090 (UUID: GPU-92fcdc58-4754-73c7-af6c-56740936817d)
GPU 1: NVIDIA GeForce RTX 5090 (UUID: GPU-e05cb455-7dd3-0db5-ac39-70794aa19d4e)
...
  • 开启持久模式
  • 查看拓扑结构
1
2
3
4
5
6
7
8
9
        GPU0    GPU1    GPU2    GPU3    GPU4    GPU5    GPU6    GPU7    CPU Affinity    NUMA Affinity  GPU NUMA ID
GPU0     X      PIX     NODE    NODE    SYS     SYS     SYS     SYS     0-47,96-143     0     N/A
GPU1    PIX      X      NODE    NODE    SYS     SYS     SYS     SYS     0-47,96-143     0     N/A
GPU2    NODE    NODE     X      PIX     SYS     SYS     SYS     SYS     0-47,96-143     0     N/A
GPU3    NODE    NODE    PIX      X      SYS     SYS     SYS     SYS     0-47,96-143     0     N/A
GPU4    SYS     SYS     SYS     SYS      X      PIX     NODE    NODE    48-95,144-191   1     N/A
GPU5    SYS     SYS     SYS     SYS     PIX      X      NODE    NODE    48-95,144-191   1     N/A
GPU6    SYS     SYS     SYS     SYS     NODE    NODE     X      PIX     48-95,144-191   1     N/A
GPU7    SYS     SYS     SYS     SYS     NODE    NODE    PIX      X      48-95,144-191   1     N/A

2. TLLM

  • 启动环境
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
nerdctl run -it \
        -p 8001:8000 \
        --gpus all \
        --ipc=host \
        --ulimit memlock=-1 \
        --ulimit stack=67108864 \
        --name tllm \
        --volume /data/models:/data/models \
        --entrypoint /bin/bash \
        nvcr.io/nvidia/tensorrt-llm/release:0.21.0
  • Qwen2.5-7B-Instruct
1
2
3
4
5
6
7
8
export CUDA_VISIBLE_DEVICES=0
trtllm-serve /data/models/Qwen2.5-7B-Instruct \
        --host 0.0.0.0 \
        --port 8000 \
        --backend pytorch \
        --max_batch_size 128 \
        --max_num_tokens 16384 \
        --kv_cache_free_gpu_memory_fraction 0.95
  • Qwen2.5-VL-7B-Instruct

如果使用 nvcr.io/nvidia/tensorrt-llm-release:0.21.0 模型会报错:

1
ValueError: Inferred model format _ModelFormatKind.HF, but failed to load config.json: The given huggingface model architecture Qwen2_5_VLForConditionalGeneration is not supported in TRT-LLM yet
1
2
3
4
5
6
7
8
9
export CUDA_VISIBLE_DEVICES=0
trtllm-serve /data/models/Qwen2.5-VL-7B-Instruct \
        --host 0.0.0.0 \
        --port 8000 \
        --tp_size 1 \
        --backend pytorch \
        --max_batch_size 128 \
        --max_num_tokens 16384 \
        --kv_cache_free_gpu_memory_fraction 0.95

3. VLLM

  • 启动环境
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
nerdctl run -it \
        -p 8002:8000 \
        --gpus all \
        --ipc=host \
        --ulimit memlock=-1 \
        --ulimit stack=67108864 \
        --name vllm \
        --volume /data/models:/data/models \
        --entrypoint /bin/bash \
        nvcr.io/nvidia/tritonserver:25.03-vllm-python-py3

使用 vllm/vllm-openai:v0.10.1.1 镜像也是可以的,性能上差不多。

  • Qwen2.5-7B-Instruct
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
export CUDA_VISIBLE_DEVICES=1
vllm serve /data/models/Qwen2.5-7B-Instruct \
        --served-model-name /data/models/Qwen2.5-7B-Instruct \
        --port 8000 \
        --gpu_memory_utilization 0.90 \
        --max-model-len 4096 \
        --max-seq-len-to-capture 8192 \
        --max-num-seqs 128 \
        --disable-log-stats \
        --enforce-eager
  • Qwen2.5-VL-7B-Instruct

使用 nvcr.io/nvidia/tritonserver:25.01-vllm-python-py3 模型会报错:

1
ValueError: The checkpoint you are trying to load has model type qwen2_5_vl but Transformers does not recognize this architecture. This could be because of an issue with the checkpoint, or because your version of Transformers is out of date.

参考 https://github.com/vllm-project/vllm/issues/13446

太高的版本也会报错,找了个能支持 Qwen2.5-VL 最低的镜像版本,参考 https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/introduction/compatibility.htmlhttps://github.com/QwenLM/Qwen2.5-VL

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
export CUDA_VISIBLE_DEVICES=1
vllm serve /data/models/Qwen2.5-VL-7B-Instruct \
        --served-model-name Qwen2.5-VL-7B-Instruct \
        --port 8000 \
        --gpu_memory_utilization 0.90 \
        --max-model-len 4096 \
        --max-seq-len-to-capture 8192 \
        --max-num-seqs 128 \
        --disable-log-stats \
        --enforce-eager

4. SGLANG

  • 启动环境

SGLANG 针对 5090 提供了 blackwell 优化版本,参考 https://github.com/sgl-project/sglang/issues/5334

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
nerdctl run -it \
        -p 8003:8000 \
        --gpus all \
        --ipc=host \
        --ulimit memlock=-1 \
        --ulimit stack=67108864 \
        --name sglang \
        --volume /data/models:/data/models \
        --entrypoint /bin/bash \
        lmsysorg/sglang:blackwell
  • Qwen2.5-7B-Instruct
1
2
3
4
5
6
7
8
9
export CUDA_VISIBLE_DEVICES=2
python3 -m sglang.launch_server \
        --model /data/models/Qwen2.5-7B-Instruct \
        --tp 1 \
        --mem-fraction-static 0.8 \
        --trust-remote-code \
        --dtype bfloat16 \
        --host 0.0.0.0 \
        --port 8000
  • Qwen2.5-VL-7B-Instruct
1
2
3
4
5
6
7
8
9
export CUDA_VISIBLE_DEVICES=2
python3 -m sglang.launch_server \
        --model /data/models/Qwen2.5-VL-7B-Instruct \
        --tp 1 \
        --mem-fraction-static 0.8 \
        --trust-remote-code \
        --dtype bfloat16 \
        --host 0.0.0.0 \
        --port 8000

5. 框架显存占用

以 Qwen2.5-7B-Instruct 为例

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
nvidia-smi

+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.76.05              Driver Version: 580.76.05      CUDA Version: 13.0     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA GeForce RTX 5090        On  |   00000000:08:00.0 Off |                  N/A |
|  0%   34C    P8             24W /  575W |   31016MiB /  32607MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA GeForce RTX 5090        On  |   00000000:0C:00.0 Off |                  N/A |
|  0%   32C    P8             17W /  575W |   28477MiB /  32607MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA GeForce RTX 5090        On  |   00000000:7E:00.0 Off |                  N/A |
|  0%   33C    P8             15W /  575W |   27087MiB /  32607MiB |      0%      Default |
|                                         |                        |                  N/A |
...
+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|    0   N/A  N/A          124671      C   /usr/bin/python                         568MiB |
|    0   N/A  N/A          124905      C   /usr/bin/python                       30434MiB |
|    1   N/A  N/A          125873      C   /usr/bin/python3                      28454MiB |
|    2   N/A  N/A          127174      C   sglang::scheduler                     27078MiB |
+-----------------------------------------------------------------------------------------+
框架显存占用 (MiB)
tllm (/usr/bin/python)30,434+568=31,002
sglang (sglang::scheduler)27,078
vllm (/usr/bin/python3)28,454

6. 功能测试

  • 设置端口

为了方便快速切换,测试不同推理框架,这里设置了环境变量 PORT 。

  • 测试 Qwen2.5-7B-Instruct
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
curl -X POST "http://127.0.0.1:$PORT/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/Qwen2.5-7B-Instruct",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "请简单介绍一下量子计算。"}
    ],
    "temperature": 0.7,
    "max_tokens": 200
  }'
  • 测试 Qwen2.5-VL-7B-Instruct
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
curl -X POST "http://127.0.0.1:$PORT/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/Qwen2.5-VL-7B-Instruct",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "请描述这张图片的内容"},
          {"type": "image_url", "image_url": {"url": "https://www.gov.cn/xhtml/2019zhuanti/guoqiguohui20201217V1/images/202012251135.png"}}
        ]
      }
    ],
    "temperature": 0.7,
    "max_tokens": 200
  }'

7. 性能测试

  • Qwen2.5-7B-Instruct 性能测试
项目tllmsglangvllm
QPS242114
new tokens466941672647
token 流速15720139388880
  • Qwen2.5-VL-7B-Instruct 性能测试
项目tllmsglangvllm
QPS-3112
new tokens-2436983
token 流速-165816468

tllm 并发高就 Out of Memory 。


微信公众号