
























检查容器环境:
确保系统已安装 Docker,测试容器能识别 GPU。
可运行一个测试容器,检查是否能成功调用 GPU。如果配置成功,终端会输出与宿主机mx-smi 一致的 GPU 信息表格:
docker run -it \ --restart always \ --device=/dev/dri \ --device=/dev/mxcd \ --group-add 44 \ --name test-mx-smi \ --device=/dev/mem \ cr.metax-tech.com/public-library/maca-c500:2.23.0.5-ubuntu22.04-x86_64 mx-smi
测试结果

下载docker镜像
到沐曦开发者社区,镜像资源中心 https://developer.metax-tech.com/softnova/docker 下载docker镜像。

拉取镜像,下载的是专用的sglang推理框架镜像。
docker login --username=cr_temp_user --password=pwd1 && docker pull cr.metax-tech.com/public-ai-release/maca/sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64
用 docker inspect命令,通过格式化输出来快速提取镜像的关键信息,不需要进入容器内部。
docker inspect cr.metax-tech.com/public-ai-release/maca/sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 | jq -r ' .[0] | "基础系统: \(.Os)/\(.Architecture) | 创建: \(.Created[0:19])", "", "版本信息:", " Python: 3.10 (标签py310)", " PyTorch: 2.8 (标签torch2.8)", " sglang: 0.5.9", " maca.ai: 3.5.3.208", "", "镜像: \(.RepoTags[0])" '

先运行一个小模型qwen3.5-4b测试
docker run -it \ --restart always \ --device=/dev/dri \ --device=/dev/mxcd \ --group-add 44 \ --name qwen3.5-4b \ --device=/dev/mem \ -p 18000:8000 \ --security-opt seccomp=unconfined \ --security-opt apparmor=unconfined \ --shm-size '100gb' \ --ulimit memlock=-1 \ -v /home/models/modelscope/:/home/models/modelscope/ \ -v /etc/localtime:/etc/localtime \ sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \ /opt/conda/bin/python -m sglang.launch_server \ --model-path /home/models/modelscope/qwen35_4b \ --port 8000 \ --host 0.0.0.0 \ --tensor-parallel-size 1 \ --context-length 32768 \ --trust-remote-code \ --served-model-name qwen3.5-4b
测试api
curl http://localhost:18000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "qwen3.5-4b", "messages": [ {"role": "user", "content": "你是谁"} ], "temperature": 0.7 }'
测试成功。
qwen3.6-35B,增加2个GPU并行。
docker run -it \
--restart always \
--device=/dev/dri \
--device=/dev/mxcd \
--group-add 44 \
--name qwen36b-20260416-chat \
--device=/dev/mem \
-p 18000:8000 \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
--shm-size '32gb' \
--ulimit memlock=-1 \
-v /data1/models/modelscope/:/data1/models/modelscope/ \
-v /etc/localtime:/etc/localtime \
-e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \
sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \
/opt/conda/bin/python -m sglang.launch_server \
--model-path /data1/models/modelscope/qwen36b_20260416 \
--port 8000 \
--host 0.0.0.0 \
--tensor-parallel-size 2 \
--context-length 32768 \
--trust-remote-code \
--served-model-name qwen3.6-35b-20260416
测试:
curl -X POST http://localhost:18000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "qwen3.6-35b-20260416", "messages": [ {"role": "user", "content": "你是谁"} ], "temperature": 0.7 }'
布署qwen3.6-35B时,增加两个参数
--reasoning-parser qwen3
--tool-call-parser qwen3_coder
这样开启工具功能,适配小龙虾这样的智能体。
docker run -it \ --restart always \ --device=/dev/dri \ --device=/dev/mxcd \ --group-add 44 \ --name qwen36b-20260416-tool \ --device=/dev/mem \ -p 18000:8000 \ --security-opt seccomp=unconfined \ --security-opt apparmor=unconfined \ --shm-size '32gb' \ --ulimit memlock=-1 \ -v /data1/models/modelscope/:/data1/models/modelscope/ \ -v /etc/localtime:/etc/localtime \ -e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \ sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \ /opt/conda/bin/python -m sglang.launch_server \ --model-path /data1/models/modelscope/qwen36b_20260416 \ --port 8000 \ --host 0.0.0.0 \ --tensor-parallel-size 2 \ --context-length 32768 \ --trust-remote-code \ --served-model-name qwen3.6-35b-tool-20260416-metax \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder
部署qwen3.5-35B-20260302
docker run -it \ --restart always \ --device=/dev/dri \ --device=/dev/mxcd \ --group-add 44 \ --name qwen3.5-35b-tool-metax \ --device=/dev/mem \ -p 18000:8000 \ --security-opt seccomp=unconfined \ --security-opt apparmor=unconfined \ --shm-size '32gb' \ --ulimit memlock=-1 \ -v /data1/models/modelscope/:/data1/models/modelscope/ \ -v /etc/localtime:/etc/localtime \ -e PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,max_split_size_mb:256" \ sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \ /opt/conda/bin/python -m sglang.launch_server \ --model-path /data1/models/modelscope/qwen35b_20260302 \ --port 8000 \ --host 0.0.0.0 \ --tensor-parallel-size 2 \ --context-length 32768 \ --trust-remote-code \ --served-model-name qwen3.5-35b-tool-20260302-metax \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder
安诊儿,运行失败
docker run -it \ --restart always \ --device=/dev/dri \ --device=/dev/mxcd \ --group-add 44 \ --name ant-angel-med-int4-20260122-chat \ --device=/dev/mem \ -p 18000:8000 \ --security-opt seccomp=unconfined \ --security-opt apparmor=unconfined \ --shm-size '32gb' \ --ulimit memlock=-1 \ -v /home/models/modelscope/:/home/models/modelscope/ \ -v /etc/localtime:/etc/localtime \ sglang:0.5.9-maca.ai3.5.3.208-torch2.8-py310-ubuntu22.04-amd64 \ /opt/conda/bin/python -m sglang.launch_server \ --model-path /home/models/modelscope/ant-angel-med-int4-20260122 \ --port 8000 \ --host 0.0.0.0 \ --tensor-parallel-size 2 \ --context-length 32768 \ --trust-remote-code \ --served-model-name ant-angel-med-int4-20260122
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。