




















下载镜像:
docker pull lmsysorg/sglang:v0.5.10
这里下载0.5.10版本。
若是运行 Qwen3.6,官网说sglang版本要>=0.5.10。
备选下载开发版镜像
docker pull lmsysorg/sglang:dev-cu13
检查容器环境:
确保系统已安装 Docker 并配置好 NVIDIA Container Toolkit,以便容器能识别 GPU。
验证NVIDIA Container Toolkit。可运行一个测试容器,检查是否能成功调用 GPU。如果配置成功,终端会输出与宿主机 nvidia-smi一致的 GPU 信息表格:
sudo docker run --rm --gpus all lmsysorg/sglang:v0.5.10 nvidia-smi
在容器内查看操作系统版本,内核版本,GPU信息。
docker run --rm --gpus all lmsysorg/sglang:v0.5.10 bash -c "nvidia-smi && echo '---' && cat /etc/os-release && echo '---' && uname -r"
下载Qwen3.6模型:
modelscope download --model Qwen/Qwen3.6-35B-A3B --local_dir /mnt/raid1/modelscope/qwen36b_20260416
下载Qwen3.5模型:
modelscope download --model Qwen/Qwen3.5-35B-A3B --local_dir /mnt/raid1/modelscope/qwen35b_20260302
下载安诊儿模型:
modelscope download --model MedAIBase/AntAngelMed-FP8 --local_dir /mnt/raid1/modelscope/AntAngelMed_FP8_2026001
运行容器
4090四卡 + sglang-v0.5.10 docker + qwen3.6
docker run -d \
--gpus '"device=0,1,2,3"' \
--shm-size 32g \
-p 8600:8600 \
-v /mnt/raid1/modelscope/:/mnt/raid1/modelscope/ \
--name sglang-qwen3.6-35b-tool \
lmsysorg/sglang:v0.5.10 \
python -m sglang.launch_server \
--model-path /mnt/raid1/modelscope/qwen36b_20260416 \
--served-model-name Qwen3.6-35B-A3B-202604 \
--host 0.0.0.0 \
--port 8600 \
--tp-size 4 \
--mem-fraction-static 0.8 \
--context-length 65536 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
docker run -d \ --gpus '"device=4,5,6,7"' \ --shm-size 32g \ -p 8601:8601 \ -v /mnt/raid1/modelscope/:/mnt/raid1/modelscope/ \ --name sglang-qwen3.6-35b-tool-gpu5-8 \ lmsysorg/sglang:v0.5.10 \ python -m sglang.launch_server \ --model-path /mnt/raid1/modelscope/qwen36b_20260416 \ --served-model-name Qwen3.6-35B-A3B-202604 \ --host 0.0.0.0 \ --port 8601 \ --tp-size 4 \ --mem-fraction-static 0.8 \ --context-length 65536 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder
服务启动后,通过发送一个简单的 POST 请求来测试 API 是否正常响应。
curl http://127.0.0.1:8600/generate \
-H "Content-Type: application/json" \
-d '{"text": "你是谁", "sampling_params": {"max_new_tokens": 100, "temperature": 0.7}}'
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。