惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
大猫的无限游戏
大猫的无限游戏
博客园 - 聂微东
Jina AI
Jina AI
The Cloudflare Blog
V
Visual Studio Blog
博客园_首页
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 【当耐特】
爱范儿
爱范儿
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
博客园 - 司徒正美
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
V
V2EX
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 叶小钗
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
T
Tailwind CSS Blog
博客园 - Franky

博客园 - badwood

iptables规则笔记 secueCRT脚本再试牛刀 主机基线脚本 大模型部署手册-昇腾服务器 ssl自签证书+nginx 备忘 Claude Code私有化使用 mindie推理框架及工程化 minio-2.使用 minio-1.搭建 旧源消失的rpm包安装-devtoolset-9 vllm-ascend 2/2 -双机推理 MCP-1.hello world vllm-ascend 1/2 -单机推理 ESP32-S3玩具1-使用Arduino evalscope使用2-使用自定义数据集压测 设置fdfs自动启动 FunASR mindie开启DeepSeek的128K xinference推理embedding等小模型 离线安装docker 昇腾910b服务器初始化 evalscope使用1-基础压测 大模型围栏-nginx+lua 大模型私有化部署-deepseek671-mindie dify-2:问题分类器调整
大模型部署手册-英伟达
badwood · 2026-07-31 · via 博客园 - badwood

  英伟达部署简单多了,没有多机(钱不够),就是vllm框架,单卡或多卡。

  • 4*A40推千问2.5-14b,使用0~3卡
    docker run -itd --shm-size 32g --privileged --runtime=nvidia  --restart always -e NVIDIA_VISIBLE_DEVICES=0,1,2,3   --name qwen2-14b   -w /app   -v /app1:/app   -p 8006:8000   --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0   -m vllm.entrypoints.openai.api_server   --served-model-name Qwen2.5-14B-Instruct   --model /app/model/Qwen2.5-14B-Instruct   --tensor-parallel-size 4   --max-model-len 32768   --max-num-seqs 256   --enable_chunked_prefill   --trust_remote_code
  • 4*A40推千问3-14b,使用4~7卡。开启工具调用。--gpu-memory-utilization 如果设置到0.95会OOM
    docker run -itd --shm-size 32g  --privileged --runtime=nvidia -e NVIDIA_VISIBLE_DEVICES=4,5,6,7 -e CUDA_VISIBLE_DEVICES=4,5,6,7 --name qwen3-14b --restart always -w /app -v /app2:/app -p 8007:8000 --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server   --served-model-name qwen3-14b   --model /app/model/Qwen3-14B --gpu-memory-utilization 0.9 --tensor-parallel-size 4   --max-model-len 32768 --enable_chunked_prefill   --trust_remote_code   --enable-auto-tool-choice   --tool-call-parser hermes