惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
SecWiki News
SecWiki News
博客园_首页
人人都是产品经理
人人都是产品经理
博客园 - 聂微东
P
Palo Alto Networks Blog
V
Vulnerabilities – Threatpost
Project Zero
Project Zero
WordPress大学
WordPress大学
NISL@THU
NISL@THU
酷 壳 – CoolShell
酷 壳 – CoolShell
P
Privacy & Cybersecurity Law Blog
Jina AI
Jina AI
AWS News Blog
AWS News Blog
Scott Helme
Scott Helme
Martin Fowler
Martin Fowler
C
Cybersecurity and Infrastructure Security Agency CISA
Forbes - Security
Forbes - Security
H
Heimdal Security Blog
小众软件
小众软件
I
Intezer
A
Arctic Wolf
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
O
OpenAI News
S
Security Affairs
阮一峰的网络日志
阮一峰的网络日志
Latest news
Latest news
G
GRAHAM CLULEY
Blog — PlanetScale
Blog — PlanetScale
J
Java Code Geeks
N
News and Events Feed by Topic
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
V2EX - 技术
V2EX - 技术
Stack Overflow Blog
Stack Overflow Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
L
LINUX DO - 最新话题
博客园 - Franky
P
Proofpoint News Feed
aimingoo的专栏
aimingoo的专栏
博客园 - 司徒正美
P
Proofpoint News Feed
S
Secure Thoughts
Google DeepMind News
Google DeepMind News
Microsoft Security Blog
Microsoft Security Blog
T
The Exploit Database - CXSecurity.com
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
C
CXSECURITY Database RSS Feed - CXSecurity.com
F
Full Disclosure
Security Latest
Security Latest

博客园 - yi-sheng

AMD Rademo RX 7900 48G显存 单卡环境部署Qwen3.6-35B-A3B AMD开发者中心Notebook开SSH与WEB外网访问 ROCm 环境多模态开发开源项目汇总 国产曦云C500双卡vllm框架本地部署qwen3.6-35B模型 国产曦云C500驱动安装 国产曦云C500双卡本地部署qwen3.6-35B模型 NVIDIA GeForce RTX 3080 魔改20G 运行大模型 FusionXpark_GB10救砖教程 ARM 架构NVIDIA GB10 Grace Blackwell环境中部署 Qwen3.6-35B 推理服务 Rufus的4.4制作ubuntu-24.04.4安装U盘 常用办公终端NEC 莱斯双盘位桌面存储阵列2代-LaCie 2big v2设置RAID1 常用办公终端配置信息 H3C LinSeer MegaCube灵犀MegaCube工作站使用笔记 4090多卡使用sglang推理框架docker布署qwen3.6-35B 国产GPU沐曦GPU系统曦云C500体验笔记 ARM 架构NVIDIA GB10 Grace Blackwell 芯片环境下安装conda FusionXpark GB10盒子开箱笔记 Python 3.11.6 + Oracle 11g​开发环境配置 MCP开发技巧:静态参数作为行为提醒(Reminder Pattern) Teachable Machine安装 Qwen2.5-1.5B + LoRA 单张显卡 微调实战 Qwen2.5-1.5B + LoRA 微调实战 大模型基建实战:使用序列猴子数据集定制 BPE Tokenizer 老年小龙虾soul.md示例 低幻觉医疗大模型Baichuan-M2-32B本地部署笔记 小龙虾本地算力RTX 4090 (24G) 四卡本地SGLang框架跑qwen3.5-35B模型 MCP工具粒度的权衡 DELL XPS 13-7390 重装系统方法 搭建私有 Matrix 聊天服务器 OpenClaw小龙虾软件原理解析 小龙虾本地算力 RTX 4090 (24G) 四卡本地运行 Qwen2.5-27B​ 模型 OpenClaw 飞书平台配置指南 MacBook Air A1534 系统安装指南:从 macOS 到 Windows
国产曦云C500双卡本地部署qwen3.5-35B模型
yi-sheng · 2026-04-17 · via 博客园 - yi-sheng

检查容器环境:

确保系统已安装 Docker,测试容器能识别 GPU。

可运行一个测试容器,检查是否能成功调用 GPU。如果配置成功,终端会输出与宿主机mx-smi 一致的 GPU 信息表格:

docker run -it \
--restart always \
--device=/dev/dri \
--device=/dev/mxcd \
--group-add 44 \
--name test-mx-smi \
--device=/dev/mem \
cr.metax-tech.com/public-library/maca-c500:2.23.0.5-ubuntu22.04-x86_64 mx-smi

测试结果

image

下载docker镜像
到沐曦开发者社区,镜像资源中心  https://developer.metax-tech.com/softnova/docker 下载docker镜像。

2c63bf64-203c-43cb-b08f-f6d068d820e0


拉取镜像,下载的是专用的sglang推理框架镜像。

docker login --username=cr_temp_user --password=pwd1 && docker pull cr.metax-tech.com/public-ai-release/maca/sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64
 

docker inspect命令,通过格式化输出来快速提取镜像的关键信息,不需要进入容器内部。

docker inspect cr.metax-tech.com/public-ai-release/maca/sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 | jq -r '
.[0] | 
"基础系统: \(.Os)/\(.Architecture) | 创建: \(.Created[0:19])",
"",
"版本信息:",
"  Python: 3.10 (标签py310)",
"  PyTorch: 2.8 (标签torch2.8)", 
"  sglang: 0.5.9",
"  maca.ai: 3.5.3.208",
"",
"镜像: \(.RepoTags[0])"
'

image

先运行一个小模型qwen3.5-4b测试 

docker run -it \
  --restart always \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --group-add 44 \
  --name qwen3.5-4b \
  --device=/dev/mem \
  -p 18000:8000 \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  --shm-size '100gb' \
  --ulimit memlock=-1 \
  -v /home/models/modelscope/:/home/models/modelscope/ \
  -v /etc/localtime:/etc/localtime \
  sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
  /opt/conda/bin/python -m sglang.launch_server \
  --model-path /home/models/modelscope/qwen35_4b \
  --port 8000 \
  --host 0.0.0.0 \
  --tensor-parallel-size 1 \
  --context-length 32768 \
  --trust-remote-code \
  --served-model-name qwen3.5-4b

 测试api

curl http://localhost:18000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5-4b",
    "messages": [
      {"role": "user", "content": "你是谁"}
    ],
    "temperature": 0.7
  }'

测试成功。

qwen3.6-35B,增加2个GPU并行。

docker run -it \
--restart always \
--device=/dev/dri \
--device=/dev/mxcd \
--group-add 44 \
--name qwen36b-20260416-chat \
--device=/dev/mem \
-p 18000:8000 \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
--shm-size '32gb' \
--ulimit memlock=-1 \
-v /data1/models/modelscope/:/data1/models/modelscope/ \
-v /etc/localtime:/etc/localtime \
-e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \
sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
/opt/conda/bin/python -m sglang.launch_server \
--model-path /data1/models/modelscope/qwen36b_20260416 \
--port 8000 \
--host 0.0.0.0 \
--tensor-parallel-size 2 \
--context-length 32768 \
--trust-remote-code \
--served-model-name qwen3.6-35b-20260416

 测试:

curl -X POST http://localhost:18000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-20260416",
    "messages": [
      {"role": "user", "content": "你是谁"}
    ],
    "temperature": 0.7
  }'

 布署qwen3.6-35B时,增加两个参数 

--reasoning-parser qwen3
--tool-call-parser qwen3_coder
这样开启工具功能,适配小龙虾这样的智能体。

docker run -it \
--restart always \
--device=/dev/dri \
--device=/dev/mxcd \
--group-add 44 \
--name qwen36b-20260416-tool \
--device=/dev/mem \
-p 18000:8000 \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
--shm-size '32gb' \
--ulimit memlock=-1 \
-v /data1/models/modelscope/:/data1/models/modelscope/ \
-v /etc/localtime:/etc/localtime \
-e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \
sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
/opt/conda/bin/python -m sglang.launch_server \
--model-path /data1/models/modelscope/qwen36b_20260416 \
--port 8000 \
--host 0.0.0.0 \
--tensor-parallel-size 2 \
--context-length 32768 \
--trust-remote-code \
--served-model-name qwen3.6-35b-tool-20260416-metax \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder

部署qwen3.5-35B-20260302

docker run -it \
--restart always \
--device=/dev/dri \
--device=/dev/mxcd \
--group-add 44 \
--name qwen3.5-35b-tool-metax \
--device=/dev/mem \
-p 18000:8000 \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
--shm-size '32gb' \
--ulimit memlock=-1 \
-v /data1/models/modelscope/:/data1/models/modelscope/ \
-v /etc/localtime:/etc/localtime \
-e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \
sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
/opt/conda/bin/python -m sglang.launch_server \
--model-path /data1/models/modelscope/qwen35b_20260302 \
--port 8000 \
--host 0.0.0.0 \
--tensor-parallel-size 2 \
--context-length 32768 \
--trust-remote-code \
--served-model-name qwen3.5-35b-tool-20260302-metax \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder

安诊儿,运行失败

docker run -it \
  --restart always \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --group-add 44 \
  --name ant-angel-med-int4-20260122-chat \
  --device=/dev/mem \
  -p 18000:8000 \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  --shm-size '32gb' \
  --ulimit memlock=-1 \
  -v /home/models/modelscope/:/home/models/modelscope/ \
  -v /etc/localtime:/etc/localtime \
  sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
  /opt/conda/bin/python -m sglang.launch_server \
  --model-path /home/models/modelscope/ant-angel-med-int4-20260122 \
  --port 8000 \
  --host 0.0.0.0 \
  --tensor-parallel-size 2 \
  --context-length 32768 \
  --trust-remote-code \
  --served-model-name ant-angel-med-int4-20260122