惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
Jina AI
Jina AI
雷峰网
雷峰网
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
美团技术团队
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
小众软件
小众软件
博客园 - Franky
博客园 - 三生石上(FineUI控件)
月光博客
月光博客
博客园 - 叶小钗
大猫的无限游戏
大猫的无限游戏
爱范儿
爱范儿
Hugging Face - Blog
Hugging Face - Blog
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
Apple Machine Learning Research
Apple Machine Learning Research
量子位
IT之家
IT之家
人人都是产品经理
人人都是产品经理
博客园_首页
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

博客园 - ejiyuan

vLLM + MTP + DFlash 部署测试 ChatGPT(codex) 第三方LLM配置 AI Search By PostgreSQL linux 系统相关工具和命令 arduino首选项 ESXi安装openwrt idea 如何使用Let's Encrypt和Nginx为您的网站提供免费的SSL/TLS证书 docker 安装 onlyoffice docker使用alpine构建jdk21镜像 Minio服务搭建与应用 frp内网穿透 基于Docker 的redis cluster部署 docker 部署mongoDB集群与读写分离 MariaDB MaxScale实现mysql8读写分离 ESP8266引脚的说明 Arduino uno r3 使用 ESP8266 UART-WiFi 透传模块 ESP8266 超声波测距模块HC-SR04 树莓派PICO Wifi 无线网卡 esp82666接线图 树莓派PICO读取温度传感器 树莓派使用python+继电器控制220V灯泡 docker的/var/lib/docker目录迁移
Jetson Orin Nano 刷机、Docker GPU 环境与大语言模型部署实...
ejiyuan · 2026-03-09 · via 博客园 - ejiyuan

Jetson Orin Nano 虽然只有 8GB 内存,但仍然可以运行一些 7B 以下的大语言模型。虽然性能无法满足生产需求,但对于学习 LLM 推理原理、GPU推理框架、模型部署方式 非常有帮助。

本文记录 Jetson Orin Nano 从 刷机 → 环境配置 → Docker GPU → LLM部署(Ollama / vLLM) 的完整实践流程。


一、Jetson Orin Nano 刷机

1 进入 Recovery 模式

Jetson Orin Nano 刷机需要进入 Force Recovery Mode

步骤:

  1. 短接 2号和3号针脚

  2. 使用 USB 数据线连接电脑

  3. 给 Jetson Orin Nano 上电

此时设备进入 Recovery模式,可以被电脑识别。


2 安装 SDK Manager

下载:

https://developer.nvidia.com/sdk-manager

SDK Manager 2.4.0 开始:

  • 支持 Windows 直接刷机

  • 不再必须使用 Ubuntu 主机


3 选择刷写组件

SDK Manager 会显示三个组件:

组件 作用
Jetson Linux Jetson 操作系统
Jetson Runtime Components AI运行库,运行 AI 推理程序
Jetson SDK Components 开发工具

如果只是运行模型通常只选择:Jetson Linux Jetson、Runtime Components即可。


4 刷机过程中两个提示

第一次弹窗

配置:

  • Ubuntu 用户名

  • 密码

  • 安装位置

推荐:NVMe 性能最好。

随后会提示 此时 SDK Manager 会提示连接中断,这是正常现象。此时需要重新给 Jetson 上电(重启设备),注意不是重新插 USB


第二次弹窗

选择网络连接方式:

推荐:USB SDK Manager 会通过 USB 虚拟网卡连接设备。


二、GPU 驱动检查

执行:


三、安装 jtop(Jetson 监控工具)

jtop 是 Jetson 平台非常常用的监控工具。

可以实时查看:

  • CPU

  • GPU

  • 内存

  • 温度

  • 功耗

  • GPU频率

安装:

启动服务:

重启系统:

运行:


四、安装 NVIDIA Docker GPU 支持

Docker 默认 无法使用 GPU,需要安装:nvidia-container-toolkit 它的作用是允许 Docker容器访问 GPU、CUDA、驱动设备

安装:

重启 docker:

加入 docker 用户组:


配置默认 GPU Runtime

编辑:/etc/docker/daemon.json,加入"default-runtime": "nvidia"

{
  "runtimes": {
    "nvidia": {
      "args": [],
      "path": "nvidia-container-runtime"
    }
  },
  "default-runtime": "nvidia"
}

检查 runtime 是否生效:

docker info | grep -i runtime

五、安装 JetPack AI 软件栈

JetPack 是 NVIDIA 为 Jetson 平台提供的 官方 AI 软件栈,可以理解为 Jetson 上运行 AI 应用的完整基础环境。

JetPack 中主要包含以下核心组件:

组件 作用
CUDA GPU 并行计算框架
cuDNN 深度学习加速库
TensorRT 深度学习推理优化引擎
VPI 视觉处理库
Multimedia API 视频编解码与图像处理

这些组件共同构成 Jetson 的 AI 推理运行环境
在运行 PyTorch、TensorRT、vLLM、Ollama 等 AI 推理程序时,都需要依赖 JetPack 中提供的 GPU 计算库。

在本文的环境中,安装 JetPack 的主要作用是:

  • 提供 CUDA GPU 计算能力

  • 提供 深度学习推理加速库

  • 为后续 Docker GPU 容器、LLM 推理框架 提供底层支持

简单理解:JetPack = Jetson 的 AI 运行环境

安装:

sudo apt update
sudo apt install nvidia-jetpack

六、安装 jetson-containers


七、Ollama 部署大语言模型

参考:https://www.jetson-ai-lab.com/tutorials/ollama/


八、vLLM 部署大模型

官方支持:https://www.jetson-ai-lab.com/models/

Jetson 官方更推荐vLLM而不是 Ollama。

原因:

  • 推理性能更高

  • 支持 OpenAI API

  • 支持更多模型

拉取镜像

这个镜像:

  • 专门为 Jetson 编译

  • CUDA 已适配

  • 支持最新 vLLM

启动 vLLM并运行模型

启动容器后运行模型

vllm serve Qwen/Qwen3-4B-AWQ --port 8000 \
  --quantization awq \
  --gpu-memory-utilization 0.55 \
  --enforce-eager \
  --max-model-len 4096

调用:

curl http://localhost:8000/v1/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-4B-AWQ",
    "prompt": "你好,请介绍一下自己",
    "max_tokens": 128,
    "temperature": 0.7
  }'

常见参数:

参数 作用
--runtime nvidia 启用 GPU
--network host 使用宿主机网络
--shm-size 共享内存
--rm 退出删除容器
-it 交互模式
-v 挂载目录
-e 设置环境变量
--ulimit 系统资源限制

例如:--shm-size=8g 用于:增加共享内存,防止模型加载失败。

vLLM 启动参数说明

参数说明:

参数 作用
--port API端口
--tp-size tensor parallel数量
--mem-fraction-static GPU显存使用比例
--context-length 最大上下文长度

高级参数:

参数 作用
--reasoning-parser 推理模型解析
--speculative-algo speculative decoding
--speculative-num-steps 推测步数

这些参数主要用于:提高推理速度

HuggingFace 模型管理

安装 CLI:

登录:

常用命令:


九、Open WebUI

Open WebUI 是 Ollama 的 Web 界面。

vLLM 默认只有 API,可以使用 Open WebUI

为Ollama启动

访问:http:即可使用 Web UI。


十、Jetson Orin Nano 运行模型建议

推荐模型:

模型 推荐
Qwen2.5-1.5B 流畅
Qwen2.5-3B 可用
Qwen2.5-7B 勉强

量化版本:Q4 Q5 更适合 8GB 设备。


总结

Jetson Orin Nano 运行 LLM 的软件架构:

Jetson Linux
     ↓
JetPack (CUDA + TensorRT)
     ↓
NVIDIA Container Toolkit
     ↓
Docker
     ↓
LLM Runtime
 ├── Ollama
 └── vLLM
工具 特点
Ollama 简单易用
vLLM 推理性能更强