
























AMD Rademo RX 7900 48G显存 单卡环境部署Qwen3.6-35B-A3B
AMD-Rademo-RX7900-48G-env
Git 克隆报 SSL 证书错误
git config --global http.sslVerify false
#创建继承系统的虚拟环境,解决PyTorch 找不到显卡
python3 -m venv env --system-site-packages
#激活环境
source env/bin/activate
#手动安装 ROCm 版 PyTorch(注意:一定要装 rocm 版本!)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/rocm6.2.4
#验证GPU识别
python -c "import torch; print(torch.cuda.is_available(), torch.version.hip, torch.cuda.get_device_name(0))"
python -c "
import torch
print('HIP可用:', torch.cuda.is_available())
print('HIP版本:', torch.version.hip)
print('GPU名称:', torch.cuda.get_device_name(0))
"
#从之前备份的数据集恢复。
重新安装 Git LFS 并配置
apt-get update && apt-get install -y git-lfs
git lfs install
git config --global http.sslVerify false
克隆数据集(自动拉取大文件)
cd /workspace
git clone https://oauth2:YOUR_ACCESS_TOKEN@www.modelscope.cn/datasets/YOUR_USERNAME/my-vllm-env-backup.git
cd my-vllm-env-backup
# 确保当前在 /workspace/my-vllm-env-backup 目录下
# 将压缩包移动回 /workspace 根目录
mv env_backup.tar.gz /workspace/
# 回到 /workspace
cd /workspace
# 解压 (解压后会直接生成 /workspace/env 目录)
tar -xzvf env_backup.tar.gz
# 清理临时下载目录
rm -rf my-vllm-env-backup
激活并验证
source env/bin/activate
# 验证 Python 版本
python --version
# 验证Torch
python -c "import torch; print('CUDA Available:', torch.cuda.is_available()); print('Device:', torch.cuda.get_device_name(0))"
安装vllm
cd /mnt/workspace
git clone https://github.com/vllm-project/vllm.git
cd vllm
pip install -r requirements/rocm.txt
pip install -r requirements/build.txt
pip install fastapi uvicorn pydantic starlette
源码编译安装
pip install --no-build-isolation -e .
安装依融注意
pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple
#直接 pip install -r requirements.txt 会把刚装好的 ROCm 版 PyTorch 覆盖成 N 卡版,显卡直接罢工。所以用sed命令过滤
sed -i '/^torch$/d' requirements.txt
sed -i '/^torchvision$/d' requirements.txt
sed -i '/^torchaudio$/d' requirements.txt
pip install -r requirements.txt
#验证编译结果
python -c "
import torch, triton, vllm
print('Python:', __import__('sys').version_info[:3])
print('Torch :', torch.__version__)
print('HIP :', torch.version.hip)
print('CUDA avail:', torch.cuda.is_available())
print('Triton :', triton.__version__)
print('vLLM :', vllm.__version__)
from vllm import LLM
print('✅ GOLDEN ENV: vLLM + ROCm 7.2 + Python 3.11 OK')
"
下载模型
modelscope download --model Qwen/Qwen3.6-35B-A3B --local_dir /home/admin/workspace/modelscope/models/qwen36b_20260423
运行
vllm serve /home/admin/workspace/modelscope/models/qwen36b_20260423 \
--tensor-parallel-size 1 \
--dtype bfloat16 \
--gpu-memory-utilization 0.93 \
--max-model-len 32768 \
--trust-remote-code \
--enable-moe-opt \
--served-model-name qwen3.6-35b-a3b \
--host 0.0.0.0 \
--port 8000
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model":"qwen3.6-35b-a3b",
"messages": [{"role":"user","content":"你是谁"}]
}'
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。