























SGLang与vLLM对比:
vLLM:大模型推理领域的行业标准。其核心优势在于基于 PagedAttention 实现极高的显存利用率,配合连续批处理(Continuous Batching),在通用单轮问答场景下吞吐量表现极强,且生态最为成熟。
与 SGLang 对比:虽然 vLLM 在单轮压测中占据优势,但在多轮对话及 Agent 场景下,SGLang 凭借 RadixAttention 技术,能够高效缓存并复用共享前缀(如 System Prompt),显著降低冗余计算。因此,当涉及长上下文交互时,SGLang 的实际吞吐量往往能反超 vLLM,更适合复杂交互式任务。
# 验证NVIDIA驱动状态
nvidia-smi
# 实时监控GPU使用情况(新开终端执行)
watch -n 1 nvidia-smi
# 验证CUDA安装
nvcc -V
# 验证Conda版本
conda --version
# 列出所有已创建的Conda环境
conda env list
# 或
conda info --envs
根据CUDA版本安装对应的PyTorch:
# CUDA 12.1
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
# CUDA 12.2
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu122
# 使用ModelScope下载模型前,先安装modelscope pip3 install modelscope #下载模型 #若不指定--local_dir,则默认下载到/home/admin1/.cache/modelscope/hub/models/ modelscope download --model Qwen/Qwen3.5-35B-A3B --local_dir /mnt/raid1/modelscope/qwen35b_202603
安装 SGLang前先装FlashInfer
我这本地环境配置(PyTorch 2.5.1+cu121, CUDA 12.1),准备使用 FlashInfer 官方提供的预编译索引进行安装,以避免首次运行时漫长的 JIT 编译。
pip3 install flashinfer-python -i https://flashinfer.ai/whl/cu121/torch2.5
安装完成后,运行以下命令验证是否成功:
python -c "import flashinfer; print(flashinfer.__version__)"
遇网络卡慢,用方案二:离线下载 + 本地安装(针对网络极差环境)
如果方案一仍慢,直接去 GitHub Releases 页面手动下载 .whl文件,然后本地安装。
下载文件:根据你的环境(CUDA 12.1 + Torch 2.5),直接访问链接:
https://github.com/flashinfer-ai/flashinfer/releases/download/v0.2.5/flashinfer_python-0.2.5%2Bcu121torch2.5-cp38-abi3-linux_x86_64.whl
(使用浏览器或 wget下载,通常浏览器下载速度更快)
或者跨克网盘下载:我用夸克网盘给你分享了「flashinfer_python-0.2.5+cu121torch2.5-cp38-abi3-linux_x86_64.whl」,/~f5d33MC9i3~:/ 链接:https://pan.quark.cn/s/2ddd5946e20c?pwd=xMPh提取码:xMPh
本地安装:将下载的 .whl文件上传到服务器,执行:
pip3 install /mnt/raid1/python_pip_down/flashinfer_python-0.2.5+cu121torch2.5-cp38-abi3-linux_x86_64.whl
安装 SGLang (安装 [all]变体,包含 GPU 加速与完整依赖)
pip3 install "sglang[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple
启动
CUDA_VISIBLE_DEVICES=4,5,6,7 python -m sglang.launch_server \ --model-path /mnt/raid1/modelscope/qwen35b_202603 \ --served-model-name Qwen3.5-35B-A3B-202603 \ --host 0.0.0.0 \ --port 8600 \ --tp-size 4 \ --mem-fraction-static 0.8 \ --context-length 32768 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder
启动后接入小龙虾测试,推理速度很快。
关闭进程。批量杀进程
后台执行
# 1. 后台启动模型服务
nohup bash run_qwen35b_202603.sh > qwen35b.log 2>&1 &
# 2. 实时监控日志(新开一个终端窗口)
SGLang 对国产GPU的支持:
SGLang 对 ROCm 的支持:SGLang 是一个开源的高性能推理框架,其官方版本(v0.4.4 及以后)已正式支持 ROCm 后端。这意味着它可以直接调用 AMD GPU 或兼容 ROCm 的国产 GPU 进行推理加速。
更多内容参考:
SGLang 中文网 https://sglang.org/zh/
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。