惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

爱范儿
爱范儿
T
The Blog of Author Tim Ferriss
G
Google Developers Blog
博客园_首页
博客园 - 【当耐特】
量子位
S
SegmentFault 最新的问题
B
Blog RSS Feed
酷 壳 – CoolShell
酷 壳 – CoolShell
V
Visual Studio Blog
T
Tailwind CSS Blog
阮一峰的网络日志
阮一峰的网络日志
V
V2EX
Y
Y Combinator Blog
博客园 - 聂微东
The Cloudflare Blog
小众软件
小众软件
J
Java Code Geeks
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
月光博客
月光博客
H
Help Net Security
Jina AI
Jina AI
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
宝玉的分享
宝玉的分享

博客园 - badwood

iptables规则笔记 secueCRT脚本再试牛刀 主机基线脚本 大模型部署手册-昇腾服务器 ssl自签证书+nginx 备忘 Claude Code私有化使用 mindie推理框架及工程化 minio-2.使用 minio-1.搭建 旧源消失的rpm包安装-devtoolset-9 vllm-ascend 2/2 -双机推理 MCP-1.hello world vllm-ascend 1/2 -单机推理 ESP32-S3玩具1-使用Arduino evalscope使用2-使用自定义数据集压测 设置fdfs自动启动 FunASR mindie开启DeepSeek的128K xinference推理embedding等小模型 离线安装docker 昇腾910b服务器初始化 evalscope使用1-基础压测 大模型围栏-nginx+lua 大模型私有化部署-deepseek671-mindie dify-2:问题分类器调整
大模型部署手册-英伟达
badwood · 2026-07-31 · via 博客园 - badwood

  英伟达部署简单多了,没有多机(钱不够),就是vllm框架,单卡或多卡。

  • 4*A40推千问2.5-14b,使用0~3卡
    docker run -itd --shm-size 32g --privileged --runtime=nvidia  --restart always -e NVIDIA_VISIBLE_DEVICES=0,1,2,3   --name qwen2-14b   -w /app   -v /app1:/app   -p 8006:8000   --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0   -m vllm.entrypoints.openai.api_server   --served-model-name Qwen2.5-14B-Instruct   --model /app/model/Qwen2.5-14B-Instruct   --tensor-parallel-size 4   --max-model-len 32768   --max-num-seqs 256   --enable_chunked_prefill   --trust_remote_code
  • 4*A40推千问3-14b,使用4~7卡。开启工具调用。--gpu-memory-utilization 如果设置到0.95会OOM
    docker run -itd --shm-size 32g  --privileged --runtime=nvidia -e NVIDIA_VISIBLE_DEVICES=4,5,6,7 -e CUDA_VISIBLE_DEVICES=4,5,6,7 --name qwen3-14b --restart always -w /app -v /app2:/app -p 8007:8000 --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server   --served-model-name qwen3-14b   --model /app/model/Qwen3-14B --gpu-memory-utilization 0.9 --tensor-parallel-size 4   --max-model-len 32768 --enable_chunked_prefill   --trust_remote_code   --enable-auto-tool-choice   --tool-call-parser hermes