惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

GbyAI
GbyAI
Martin Fowler
Martin Fowler
I
InfoQ
腾讯CDC
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
爱范儿
爱范儿
Microsoft Security Blog
Microsoft Security Blog
Google DeepMind News
Google DeepMind News
D
DataBreaches.Net
云风的 BLOG
云风的 BLOG
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
D
Docker
博客园 - 三生石上(FineUI控件)
Y
Y Combinator Blog
博客园 - Franky
Engineering at Meta
Engineering at Meta
B
Blog
罗磊的独立博客
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
V
Visual Studio Blog

博客园 - yi-sheng

[2026年9月]国产曦云C500双卡vllm框架本地部署qwen3.6-35B模型 [部署失败]国产曦云C500双卡sglang框架本地部署qwen3.6-35B模型 4090多卡使用sglang:v0.5.16在docker环境部署Qwen3.5-35B-A3B-20260807 短剧及算力租用平台 AMD Rademo RX 7900 48G显存 单卡环境部署Qwen3.6-35B-A3B AMD开发者中心Notebook开SSH与WEB外网访问 ROCm 环境多模态开发开源项目汇总 国产曦云C500双卡vllm框架本地部署qwen3.6-35B模型 国产曦云C500驱动安装 国产曦云C500双卡本地部署qwen3.6-35B模型 NVIDIA GeForce RTX 3080 魔改20G 运行大模型 FusionXpark_GB10救砖教程 Rufus的4.4制作ubuntu-24.04.4安装U盘 常用办公终端NEC 莱斯双盘位桌面存储阵列2代-LaCie 2big v2设置RAID1 常用办公终端配置信息 H3C LinSeer MegaCube灵犀MegaCube工作站使用笔记 4090多卡使用sglang推理框架docker布署qwen3.6-35B 国产曦云C500双卡本地部署qwen3.5-35B模型 国产GPU沐曦GPU系统曦云C500体验笔记 ARM 架构NVIDIA GB10 Grace Blackwell 芯片环境下安装conda FusionXpark GB10盒子开箱笔记 Python 3.11.6 + Oracle 11g​开发环境配置 MCP开发技巧:静态参数作为行为提醒(Reminder Pattern) Teachable Machine安装 Qwen2.5-1.5B + LoRA 单张显卡 微调实战 Qwen2.5-1.5B + LoRA 微调实战 大模型基建实战:使用序列猴子数据集定制 BPE Tokenizer 老年小龙虾soul.md示例 低幻觉医疗大模型Baichuan-M2-32B本地部署笔记
ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B...
yi-sheng · 2026-06-02 · via 博客园 - yi-sheng

ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B 推理服务

在 NVIDIA GB10 (Grace Blackwell) 上运行 SGLang 和 Qwen3.6-35B 教程

1. 环境准备

确保已安装 Docker 和 NVIDIA Container Toolkit:
# 验证 Docker

# 验证 NVIDIA Container Toolkit

# 验证 GPU 状态


2. 拉取华为云镜像

# 拉取华为云镜像(v0.5.12,CUDA 环境)

docker pull swr.cn-south-1.myhuaweicloud.com/gpustack/sglang:v0.5.12


3. 验证 GPU 访问

在部署前,先验证镜像能否正确识别 GB10 的 GPU:
# 运行一个临时容器,执行nvidia-smi后立即退出

docker run --rm --gpus all sglang:v0.5.12 nvidia-smi

注意:这个验证步骤很重要,可以确认镜像、Docker环境和NVIDIA Container Toolkit都配置正确。

4. 准备模型目录

假设您的 Qwen3.6-35B 模型在以下路径:
# 确认模型路径

ls -la /home/models/modelscope/qwen36b_20260423/


# 应该能看到配置文件如 config.json, model.safetensors 等


5. 启动 SGLang 服务

运行以下命令启动 Qwen3.6-35B 推理服务:

docker run -d --gpus all --shm-size 32g \
  -p 8600:8600 \
  -v /home/models/modelscope/:/home/models/modelscope/ \
  --name sglang-qwen3-tool \
  sglang:v0.5.12 \
  python -m sglang.launch_server \
    --model-path /home/models/modelscope/qwen36b_20260423 \
    --served-model-name Qwen3.6-35B-A3B-20260423 \
    --host 0.0.0.0 \
    --port 8600 \
    --mem-fraction-static 0.8 \
    --context-length 32768 \
    --reasoning-parser qwen3 \
    --tool-call-parser qwen3_coder

6. 验证服务状态

# 查看容器日志

docker logs -f sglang-qwen3-tool

# 检查容器状态

docker ps | grep sglang-qwen3-tool

#检查容易sglang版本

docker exec sglang-qwen3-tool python -c "import sglang; print(sglang.__version__)"

# 测试 API 接口

curl http://localhost:8600/v1/models


7. 使用示例

curl http://localhost:8600/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.6-35B-A3B-20260423",
    "messages": [
      {"role": "user", "content": "你好,请介绍一下自己"}
    ],
    "max_tokens": 100
  }'


注意事项

1. 端口冲突:确保 8600 端口未被占用
2. 模型路径:确保 /home/models/modelscope/qwen36b_20260423 存在且包含完整模型文件
3. GPU 内存:--mem-fraction-static 0.8 设置了 80% 的 GPU 内存使用,可根据需要调整
4. 容器名称:如果已存在同名容器,需要先删除或使用不同名称
5. ARM 架构:已验证华为云镜像可在 GB10 ARM 架构上运行

按照这个教程,在 NVIDIA GB10 环境中部署 Qwen3.6-35B 推理服务。

后记

快速下载一个小模型测试

conda activate conda_modelscope_down
modelscope download --model Qwen/Qwen2.5-0.5B --local_dir /home/models/modelscope/qwen25_05b

针对 0.5B 小模型,大幅降低了资源需求(显存、内存),启动速度极快:

docker run -d --gpus all --shm-size 2g \
  -p 8600:8600 \
  -v /home/models/modelscope/:/home/models/modelscope/ \
  --name sglang-qwen25-05b \
  sglang:v0.5.12 \
  python -m sglang.launch_server \
    --model-path /home/models/modelscope/qwen25_05b \
    --served-model-name Qwen2.5-0.5B \
    --host 0.0.0.0 \
    --port 8600 \
    --mem-fraction-static 0.2 \
    --context-length 32768


curl http://localhost:8600/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen2.5-0.5B",
    "messages": [{"role": "user", "content": "你好"}],
    "max_tokens": 50
  }'

 安诊儿模型

docker run -d --gpus all --shm-size 32g \
  -e SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \
  -p 8600:8600 \
  -v /home/models/modelscope/:/home/models/modelscope/ \
  --name sglang-ant-angel-med \
  sglang:v0.5.12 \
  python -m sglang.launch_server \
    --model-path /home/models/modelscope/ant-angel-med-20260605 \
    --served-model-name AntAngelMed-20260605 \
    --host 0.0.0.0 \
    --port 8600 \
    --mem-fraction-static 0.8 \
    --context-length 32768 \
    --trust-remote-code



curl http://localhost:8600/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "AntAngelMed-20260605",
    "messages": [
      {"role": "user", "content": "你好,请简单介绍一下你自己"}
    ],
    "max_tokens": 128
  }'