惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Attack and Defense Labs
Attack and Defense Labs
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 聂微东
V
Visual Studio Blog
量子位
博客园 - 三生石上(FineUI控件)
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Jina AI
Jina AI
宝玉的分享
宝玉的分享
Hacker News: Ask HN
Hacker News: Ask HN
小众软件
小众软件
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Hacker News - Newest:
Hacker News - Newest: "LLM"
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
W
WeLiveSecurity
Google Online Security Blog
Google Online Security Blog
AI
AI
Schneier on Security
Schneier on Security
大猫的无限游戏
大猫的无限游戏
WordPress大学
WordPress大学
I
InfoQ
A
Arctic Wolf
月光博客
月光博客
Last Week in AI
Last Week in AI
Hugging Face - Blog
Hugging Face - Blog
Cloudbric
Cloudbric
Google DeepMind News
Google DeepMind News
Security Latest
Security Latest
GbyAI
GbyAI
N
Netflix TechBlog - Medium
TaoSecurity Blog
TaoSecurity Blog
Blog — PlanetScale
Blog — PlanetScale
Scott Helme
Scott Helme
www.infosecurity-magazine.com
www.infosecurity-magazine.com
T
The Exploit Database - CXSecurity.com
博客园 - 【当耐特】
博客园 - 司徒正美
The Hacker News
The Hacker News
Cisco Talos Blog
Cisco Talos Blog
I
Intezer
云风的 BLOG
云风的 BLOG
T
Threatpost
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
C
Cyber Attacks, Cyber Crime and Cyber Security
罗磊的独立博客
Security Archives - TechRepublic
Security Archives - TechRepublic
T
Tenable Blog

博客园 - yi-sheng

国产曦云C500双卡vllm框架本地部署qwen3.6-35B模型 国产曦云C500驱动安装 国产曦云C500双卡本地部署qwen3.6-35B模型 NVIDIA GeForce RTX 3080 魔改20G 运行大模型 FusionXpark_GB10救砖教程 ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B 推理服务 Rufus的4.4制作ubuntu-24.04.4安装U盘 常用办公终端NEC 莱斯双盘位桌面存储阵列2代-LaCie 2big v2设置RAID1 常用办公终端配置信息 H3C LinSeer MegaCube灵犀MegaCube工作站使用笔记 国产曦云C500双卡本地部署qwen3.5-35B模型 国产GPU沐曦GPU系统曦云C500体验笔记 ARM 架构NVIDIA GB10 Grace Blackwell 芯片环境下安装conda FusionXpark GB10盒子开箱笔记 Python 3.11.6 + Oracle 11g​开发环境配置 MCP开发技巧:静态参数作为行为提醒(Reminder Pattern) Teachable Machine安装 Qwen2.5-1.5B + LoRA 单张显卡 微调实战 Qwen2.5-1.5B + LoRA 微调实战 大模型基建实战:使用序列猴子数据集定制 BPE Tokenizer 老年小龙虾soul.md示例 低幻觉医疗大模型Baichuan-M2-32B本地部署笔记 小龙虾本地算力RTX 4090 (24G) 四卡本地SGLang框架跑qwen3.5-35B模型 MCP工具粒度的权衡 DELL XPS 13-7390 重装系统方法 搭建私有 Matrix 聊天服务器 OpenClaw小龙虾软件原理解析 小龙虾本地算力 RTX 4090 (24G) 四卡本地运行 Qwen2.5-27B​ 模型 OpenClaw 飞书平台配置指南 MacBook Air A1534 系统安装指南:从 macOS 到 Windows
4090多卡使用sglang推理框架docker布署qwen3.6-35B
yi-sheng · 2026-04-19 · via 博客园 - yi-sheng

下载镜像:

docker pull lmsysorg/sglang:v0.5.10

这里下载0.5.10版本。

若是运行 Qwen3.6,官网说sglang版本要>=0.5.10。

备选下载开发版镜像

docker pull lmsysorg/sglang:dev-cu13

检查容器环境:
确保系统已安装 Docker 并配置好 NVIDIA Container Toolkit,以便容器能识别 GPU。 

验证NVIDIA Container Toolkit。可运行一个测试容器,检查是否能成功调用 GPU。如果配置成功,终端会输出与宿主机 nvidia-smi一致的 GPU 信息表格

sudo docker run --rm --gpus all lmsysorg/sglang:v0.5.10 nvidia-smi

在容器内查看操作系统版本,内核版本,GPU信息。

docker run --rm --gpus all lmsysorg/sglang:v0.5.10 bash -c "nvidia-smi && echo '---' && cat /etc/os-release && echo '---' && uname -r"

下载Qwen3.6模型:

modelscope download --model Qwen/Qwen3.6-35B-A3B --local_dir /mnt/raid1/modelscope/qwen36b_20260416


下载Qwen3.5模型:

modelscope download --model Qwen/Qwen3.5-35B-A3B --local_dir /mnt/raid1/modelscope/qwen35b_20260302

 下载安诊儿模型:

modelscope download --model MedAIBase/AntAngelMed-FP8 --local_dir /mnt/raid1/modelscope/AntAngelMed_FP8_2026001

运行容器
4090四卡 +  sglang-v0.5.10  docker  +  qwen3.6

docker run -d \
--gpus '"device=0,1,2,3"' \
--shm-size 32g \
-p 8600:8600 \
-v /mnt/raid1/modelscope/:/mnt/raid1/modelscope/ \
--name sglang-qwen3.6-35b-tool \
lmsysorg/sglang:v0.5.10 \
python -m sglang.launch_server \
--model-path /mnt/raid1/modelscope/qwen36b_20260416 \
--served-model-name Qwen3.6-35B-A3B-202604 \
--host 0.0.0.0 \
--port 8600 \
--tp-size 4 \
--mem-fraction-static 0.8 \
--context-length 65536 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder

docker run -d \
  --gpus '"device=4,5,6,7"' \
  --shm-size 32g \
  -p 8601:8601 \
  -v /mnt/raid1/modelscope/:/mnt/raid1/modelscope/ \
  --name sglang-qwen3.6-35b-tool-gpu5-8 \
  lmsysorg/sglang:v0.5.10 \
  python -m sglang.launch_server \
  --model-path /mnt/raid1/modelscope/qwen36b_20260416 \
  --served-model-name Qwen3.6-35B-A3B-202604 \
  --host 0.0.0.0 \
  --port 8601 \
  --tp-size 4 \
  --mem-fraction-static 0.8 \
  --context-length 65536 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

服务启动后,通过发送一个简单的 POST 请求来测试 API 是否正常响应。

curl http://127.0.0.1:8600/generate \
-H "Content-Type: application/json" \
-d '{"text": "你是谁", "sampling_params": {"max_new_tokens": 100, "temperature": 0.7}}'