










ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B 推理服务
在 NVIDIA GB10 (Grace Blackwell) 上运行 SGLang 和 Qwen3.6-35B 教程
1. 环境准备
确保已安装 Docker 和 NVIDIA Container Toolkit:
# 验证 Docker
# 验证 NVIDIA Container Toolkit
# 验证 GPU 状态
2. 拉取华为云镜像
# 拉取华为云镜像(v0.5.12,CUDA 环境)
docker pull swr.cn-south-1.myhuaweicloud.com/gpustack/sglang:v0.5.12
3. 验证 GPU 访问
在部署前,先验证镜像能否正确识别 GB10 的 GPU:
# 运行一个临时容器,执行nvidia-smi后立即退出
docker run --rm --gpus all sglang:v0.5.12 nvidia-smi
注意:这个验证步骤很重要,可以确认镜像、Docker环境和NVIDIA Container Toolkit都配置正确。
4. 准备模型目录
假设您的 Qwen3.6-35B 模型在以下路径:
# 确认模型路径
ls -la /home/models/modelscope/qwen36b_20260423/
# 应该能看到配置文件如 config.json, model.safetensors 等
5. 启动 SGLang 服务
运行以下命令启动 Qwen3.6-35B 推理服务:
docker run -d --gpus all --shm-size 32g \ -p 8600:8600 \ -v /home/models/modelscope/:/home/models/modelscope/ \ --name sglang-qwen3-tool \ sglang:v0.5.12 \ python -m sglang.launch_server \ --model-path /home/models/modelscope/qwen36b_20260423 \ --served-model-name Qwen3.6-35B-A3B-20260423 \ --host 0.0.0.0 \ --port 8600 \ --mem-fraction-static 0.8 \ --context-length 32768 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder
6. 验证服务状态
# 查看容器日志
docker logs -f sglang-qwen3-tool
# 检查容器状态
docker ps | grep sglang-qwen3-tool
#检查容易sglang版本
docker exec sglang-qwen3-tool python -c "import sglang; print(sglang.__version__)"
# 测试 API 接口
curl http://localhost:8600/v1/models
7. 使用示例
curl http://localhost:8600/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen3.6-35B-A3B-20260423", "messages": [ {"role": "user", "content": "你好,请介绍一下自己"} ], "max_tokens": 100 }'
注意事项
1. 端口冲突:确保 8600 端口未被占用
2. 模型路径:确保 /home/models/modelscope/qwen36b_20260423 存在且包含完整模型文件
3. GPU 内存:--mem-fraction-static 0.8 设置了 80% 的 GPU 内存使用,可根据需要调整
4. 容器名称:如果已存在同名容器,需要先删除或使用不同名称
5. ARM 架构:已验证华为云镜像可在 GB10 ARM 架构上运行
按照这个教程,在 NVIDIA GB10 环境中部署 Qwen3.6-35B 推理服务。
后记
快速下载一个小模型测试
conda activate conda_modelscope_down modelscope download --model Qwen/Qwen2.5-0.5B --local_dir /home/models/modelscope/qwen25_05b 针对 0.5B 小模型,大幅降低了资源需求(显存、内存),启动速度极快: docker run -d --gpus all --shm-size 2g \ -p 8600:8600 \ -v /home/models/modelscope/:/home/models/modelscope/ \ --name sglang-qwen25-05b \ sglang:v0.5.12 \ python -m sglang.launch_server \ --model-path /home/models/modelscope/qwen25_05b \ --served-model-name Qwen2.5-0.5B \ --host 0.0.0.0 \ --port 8600 \ --mem-fraction-static 0.2 \ --context-length 32768 curl http://localhost:8600/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen2.5-0.5B", "messages": [{"role": "user", "content": "你好"}], "max_tokens": 50 }'
安诊儿模型
docker run -d --gpus all --shm-size 32g \ -e SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \ -p 8600:8600 \ -v /home/models/modelscope/:/home/models/modelscope/ \ --name sglang-ant-angel-med \ sglang:v0.5.12 \ python -m sglang.launch_server \ --model-path /home/models/modelscope/ant-angel-med-20260605 \ --served-model-name AntAngelMed-20260605 \ --host 0.0.0.0 \ --port 8600 \ --mem-fraction-static 0.8 \ --context-length 32768 \ --trust-remote-code curl http://localhost:8600/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "AntAngelMed-20260605", "messages": [ {"role": "user", "content": "你好,请简单介绍一下你自己"} ], "max_tokens": 128 }'
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。