










英伟达部署简单多了,没有多机(钱不够),就是vllm框架,单卡或多卡。
docker run -itd --shm-size 32g --privileged --runtime=nvidia --restart always -e NVIDIA_VISIBLE_DEVICES=0,1,2,3 --name qwen2-14b -w /app -v /app1:/app -p 8006:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name Qwen2.5-14B-Instruct --model /app/model/Qwen2.5-14B-Instruct --tensor-parallel-size 4 --max-model-len 32768 --max-num-seqs 256 --enable_chunked_prefill --trust_remote_code
docker run -itd --shm-size 32g --privileged --runtime=nvidia -e NVIDIA_VISIBLE_DEVICES=4,5,6,7 -e CUDA_VISIBLE_DEVICES=4,5,6,7 --name qwen3-14b --restart always -w /app -v /app2:/app -p 8007:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-14b --model /app/model/Qwen3-14B --gpu-memory-utilization 0.9 --tensor-parallel-size 4 --max-model-len 32768 --enable_chunked_prefill --trust_remote_code --enable-auto-tool-choice --tool-call-parser hermes
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。