惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
G
GRAHAM CLULEY
WordPress大学
WordPress大学
人人都是产品经理
人人都是产品经理
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
大猫的无限游戏
大猫的无限游戏
MyScale Blog
MyScale Blog
Forbes - Security
Forbes - Security
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Last Watchdog
The Last Watchdog
N
News and Events Feed by Topic
TaoSecurity Blog
TaoSecurity Blog
SecWiki News
SecWiki News
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
小众软件
小众软件
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
L
LINUX DO - 最新话题
腾讯CDC
博客园 - 三生石上(FineUI控件)
Attack and Defense Labs
Attack and Defense Labs
S
Secure Thoughts
博客园 - 叶小钗
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Webroot Blog
Webroot Blog
Google Online Security Blog
Google Online Security Blog
S
Security @ Cisco Blogs
S
Schneier on Security
罗磊的独立博客
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
Hacker News: Ask HN
Hacker News: Ask HN
T
Tenable Blog
V
V2EX
J
Java Code Geeks
AWS News Blog
AWS News Blog
博客园 - 司徒正美
V
Visual Studio Blog
T
The Exploit Database - CXSecurity.com
H
Hacker News: Front Page
Security Latest
Security Latest
月光博客
月光博客
The Hacker News
The Hacker News
T
Tor Project blog
Project Zero
Project Zero
P
Privacy & Cybersecurity Law Blog
阮一峰的网络日志
阮一峰的网络日志

博客园 - yi-sheng

AMD Rademo RX 7900 48G显存 单卡环境部署Qwen3.6-35B-A3B AMD开发者中心Notebook开SSH与WEB外网访问 ROCm 环境多模态开发开源项目汇总 国产曦云C500双卡vllm框架本地部署qwen3.6-35B模型 国产曦云C500驱动安装 国产曦云C500双卡本地部署qwen3.6-35B模型 NVIDIA GeForce RTX 3080 魔改20G 运行大模型 FusionXpark_GB10救砖教程 ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B 推理服务 Rufus的4.4制作ubuntu-24.04.4安装U盘 常用办公终端NEC 莱斯双盘位桌面存储阵列2代-LaCie 2big v2设置RAID1 常用办公终端配置信息 H3C LinSeer MegaCube灵犀MegaCube工作站使用笔记 4090多卡使用sglang推理框架docker布署qwen3.6-35B 国产曦云C500双卡本地部署qwen3.5-35B模型 国产GPU沐曦GPU系统曦云C500体验笔记 ARM 架构NVIDIA GB10 Grace Blackwell 芯片环境下安装conda FusionXpark GB10盒子开箱笔记 Python 3.11.6 + Oracle 11g​开发环境配置 MCP开发技巧:静态参数作为行为提醒(Reminder Pattern) Teachable Machine安装 Qwen2.5-1.5B + LoRA 单张显卡 微调实战 Qwen2.5-1.5B + LoRA 微调实战 大模型基建实战:使用序列猴子数据集定制 BPE Tokenizer 老年小龙虾soul.md示例 低幻觉医疗大模型Baichuan-M2-32B本地部署笔记 MCP工具粒度的权衡 DELL XPS 13-7390 重装系统方法 搭建私有 Matrix 聊天服务器 OpenClaw小龙虾软件原理解析 小龙虾本地算力 RTX 4090 (24G) 四卡本地运行 Qwen2.5-27B​ 模型 OpenClaw 飞书平台配置指南 MacBook Air A1534 系统安装指南:从 macOS 到 Windows
小龙虾本地算力RTX 4090 (24G) 四卡本地SGLang框架跑qwen3.5-35B模型
yi-sheng · 2026-03-18 · via 博客园 - yi-sheng

SGLang与vLLM对比:

vLLM:大模型推理领域的行业标准。其核心优势在于基于 PagedAttention​ 实现极高的显存利用率,配合连续批处理(Continuous Batching),在通用单轮问答场景下吞吐量表现极强,且生态最为成熟。
与 SGLang 对比:虽然 vLLM 在单轮压测中占据优势,但在多轮对话及 Agent 场景下,SGLang 凭借 RadixAttention​ 技术,能够高效缓存并复用共享前缀(如 System Prompt),显著降低冗余计算。因此,当涉及长上下文交互时,SGLang 的实际吞吐量往往能反超 vLLM,更适合复杂交互式任务。

1. 显卡驱动和CUDA验证

# 验证NVIDIA驱动状态
nvidia-smi

# 实时监控GPU使用情况(新开终端执行)
watch -n 1 nvidia-smi

# 验证CUDA安装
nvcc -V

2. Conda环境管理

# 验证Conda版本
conda --version

# 列出所有已创建的Conda环境
conda env list
# 或
conda info --envs

3. PyTorch安装

根据CUDA版本安装对应的PyTorch:

# CUDA 12.1
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

# CUDA 12.2  
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu122

模型下载与部署

# 使用ModelScope下载模型前,先安装modelscope
pip3 install modelscope


#下载模型   #若不指定--local_dir,则默认下载到/home/admin1/.cache/modelscope/hub/models/

modelscope download --model Qwen/Qwen3.5-35B-A3B --local_dir /mnt/raid1/modelscope/qwen35b_202603


安装 SGLang前先装FlashInfer

我这本地环境配置(PyTorch 2.5.1+cu121, CUDA 12.1),准备使用 FlashInfer 官方提供的预编译索引进行安装,以避免首次运行时漫长的 JIT 编译。

pip3 install flashinfer-python -i https://flashinfer.ai/whl/cu121/torch2.5

安装完成后,运行以下命令验证是否成功:

python -c "import flashinfer; print(flashinfer.__version__)"

遇网络卡慢,用方案二:离线下载 + 本地安装(针对网络极差环境)
如果方案一仍慢,直接去 GitHub Releases 页面手动下载 .whl文件,然后本地安装。
下载文件:根据你的环境(CUDA 12.1 + Torch 2.5),直接访问链接:
https://github.com/flashinfer-ai/flashinfer/releases/download/v0.2.5/flashinfer_python-0.2.5%2Bcu121torch2.5-cp38-abi3-linux_x86_64.whl
(使用浏览器或 wget下载,通常浏览器下载速度更快)
或者跨克网盘下载:我用夸克网盘给你分享了「flashinfer_python-0.2.5+cu121torch2.5-cp38-abi3-linux_x86_64.whl」,/~f5d33MC9i3~:/   链接:https://pan.quark.cn/s/2ddd5946e20c?pwd=xMPh提取码:xMPh

本地安装:将下载的 .whl文件上传到服务器,执行:
pip3 install /mnt/raid1/python_pip_down/flashinfer_python-0.2.5+cu121torch2.5-cp38-abi3-linux_x86_64.whl


安装 SGLang (安装 [all]变体,包含 GPU 加速与完整依赖)

pip3 install "sglang[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple

 启动

CUDA_VISIBLE_DEVICES=4,5,6,7 python -m sglang.launch_server \
  --model-path /mnt/raid1/modelscope/qwen35b_202603 \
  --served-model-name Qwen3.5-35B-A3B-202603 \
  --host 0.0.0.0 \
  --port 8600 \
  --tp-size 4 \
  --mem-fraction-static 0.8 \
  --context-length 32768 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

 启动后接入小龙虾测试,推理速度很快。

关闭进程。批量杀进程

后台执行

# 1. 后台启动模型服务

nohup bash run_qwen35b_202603.sh > qwen35b.log 2>&1 &

# 2. 实时监控日志(新开一个终端窗口)

SGLang 对国产GPU的支持
SGLang 对 ROCm 的支持:SGLang 是一个开源的高性能推理框架,其官方版本(v0.4.4 及以后)已正式支持 ROCm 后端。这意味着它可以直接调用 AMD GPU 或兼容 ROCm 的国产 GPU 进行推理加速。


更多内容参考:

SGLang 中文网   https://sglang.org/zh/