















Jetson Orin Nano 虽然只有 8GB 内存,但仍然可以运行一些 7B 以下的大语言模型。虽然性能无法满足生产需求,但对于学习 LLM 推理原理、GPU推理框架、模型部署方式 非常有帮助。
本文记录 Jetson Orin Nano 从 刷机 → 环境配置 → Docker GPU → LLM部署(Ollama / vLLM) 的完整实践流程。
Jetson Orin Nano 刷机需要进入 Force Recovery Mode。
步骤:
短接 2号和3号针脚
使用 USB 数据线连接电脑
给 Jetson Orin Nano 上电
此时设备进入 Recovery模式,可以被电脑识别。
下载:
https://developer.nvidia.com/sdk-manager
从 SDK Manager 2.4.0 开始:
支持 Windows 直接刷机
不再必须使用 Ubuntu 主机
SDK Manager 会显示三个组件:
| 组件 | 作用 |
|---|---|
| Jetson Linux | Jetson 操作系统 |
| Jetson Runtime Components | AI运行库,运行 AI 推理程序 |
| Jetson SDK Components | 开发工具 |
如果只是运行模型通常只选择:Jetson Linux Jetson、Runtime Components即可。
配置:
Ubuntu 用户名
密码
安装位置
推荐:NVMe 性能最好。
随后会提示 此时 SDK Manager 会提示连接中断,这是正常现象。此时需要重新给 Jetson 上电(重启设备),注意不是重新插 USB
选择网络连接方式:
推荐:USB SDK Manager 会通过 USB 虚拟网卡连接设备。
执行:
jtop 是 Jetson 平台非常常用的监控工具。
可以实时查看:
CPU
GPU
内存
温度
功耗
GPU频率
安装:
启动服务:
重启系统:
运行:
Docker 默认 无法使用 GPU,需要安装:nvidia-container-toolkit 它的作用是允许 Docker容器访问 GPU、CUDA、驱动设备。
安装:
重启 docker:
加入 docker 用户组:
配置默认 GPU Runtime
编辑:/etc/docker/daemon.json,加入"default-runtime": "nvidia"
{
"runtimes": {
"nvidia": {
"args": [],
"path": "nvidia-container-runtime"
}
},
"default-runtime": "nvidia"
}
检查 runtime 是否生效:
docker info | grep -i runtime
JetPack 是 NVIDIA 为 Jetson 平台提供的 官方 AI 软件栈,可以理解为 Jetson 上运行 AI 应用的完整基础环境。
JetPack 中主要包含以下核心组件:
| 组件 | 作用 |
|---|---|
| CUDA | GPU 并行计算框架 |
| cuDNN | 深度学习加速库 |
| TensorRT | 深度学习推理优化引擎 |
| VPI | 视觉处理库 |
| Multimedia API | 视频编解码与图像处理 |
这些组件共同构成 Jetson 的 AI 推理运行环境。
在运行 PyTorch、TensorRT、vLLM、Ollama 等 AI 推理程序时,都需要依赖 JetPack 中提供的 GPU 计算库。
在本文的环境中,安装 JetPack 的主要作用是:
提供 CUDA GPU 计算能力
提供 深度学习推理加速库
为后续 Docker GPU 容器、LLM 推理框架 提供底层支持
简单理解:JetPack = Jetson 的 AI 运行环境
安装:
sudo apt update
sudo apt install nvidia-jetpack
参考:https://www.jetson-ai-lab.com/tutorials/ollama/
官方支持:https://www.jetson-ai-lab.com/models/
Jetson 官方更推荐vLLM而不是 Ollama。
原因:
推理性能更高
支持 OpenAI API
支持更多模型
这个镜像:
专门为 Jetson 编译
CUDA 已适配
支持最新 vLLM
vllm serve Qwen/Qwen3-4B-AWQ --port 8000 \
--quantization awq \
--gpu-memory-utilization 0.55 \
--enforce-eager \
--max-model-len 4096
调用:
curl http://localhost:8000/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-4B-AWQ",
"prompt": "你好,请介绍一下自己",
"max_tokens": 128,
"temperature": 0.7
}'
常见参数:
| 参数 | 作用 |
|---|---|
| --runtime nvidia | 启用 GPU |
| --network host | 使用宿主机网络 |
| --shm-size | 共享内存 |
| --rm | 退出删除容器 |
| -it | 交互模式 |
| -v | 挂载目录 |
| -e | 设置环境变量 |
| --ulimit | 系统资源限制 |
例如:--shm-size=8g 用于:增加共享内存,防止模型加载失败。
参数说明:
| 参数 | 作用 |
|---|---|
| --port | API端口 |
| --tp-size | tensor parallel数量 |
| --mem-fraction-static | GPU显存使用比例 |
| --context-length | 最大上下文长度 |
高级参数:
| 参数 | 作用 |
|---|---|
| --reasoning-parser | 推理模型解析 |
| --speculative-algo | speculative decoding |
| --speculative-num-steps | 推测步数 |
这些参数主要用于:提高推理速度
安装 CLI:
登录:
常用命令:
Open WebUI 是 Ollama 的 Web 界面。
vLLM 默认只有 API,可以使用 Open WebUI。
为Ollama启动
访问:http:即可使用 Web UI。
推荐模型:
| 模型 | 推荐 |
|---|---|
| Qwen2.5-1.5B | 流畅 |
| Qwen2.5-3B | 可用 |
| Qwen2.5-7B | 勉强 |
量化版本:Q4 Q5 更适合 8GB 设备。
Jetson Orin Nano 运行 LLM 的软件架构:
Jetson Linux
↓
JetPack (CUDA + TensorRT)
↓
NVIDIA Container Toolkit
↓
Docker
↓
LLM Runtime
├── Ollama
└── vLLM
| 工具 | 特点 |
|---|---|
| Ollama | 简单易用 |
| vLLM | 推理性能更强 |
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。