惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog
Y
Y Combinator Blog
N
Netflix TechBlog - Medium
M
MIT News - Artificial intelligence
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
B
Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
C
Check Point Blog
The GitHub Blog
The GitHub Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
P
Proofpoint News Feed
Martin Fowler
Martin Fowler
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
博客园_首页
A
About on SuperTechFans
Blog — PlanetScale
Blog — PlanetScale
人人都是产品经理
人人都是产品经理
T
Tailwind CSS Blog
aimingoo的专栏
aimingoo的专栏
T
The Blog of Author Tim Ferriss
The Cloudflare Blog

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
常用 AI 基础镜像及启动命令
微信公众号 · 2024-03-28 · via 陈少文的网站

Please enable Javascript to view the contents

1. 镜像 Tag 标识的含义

  • base/cuda: 包括 CUDA 运行时

  • runtime: 在 base 的基础上,新增了 CUDA math 库和 NCCL、cuDNN 运行时

  • devel: 在 runtime 的基础上,新增了头文件和用于构建 CUDA 镜像的开发工具,对于多阶段构建特别有用

  • cuddn: 在上面基础上,新增了 cuDNN 神经网络加速库

  • py3: Python 3 环境

2. CUDA 镜像

镜像AMD64 镜像大小ARM64 镜像大小
nvidia/cuda:12.3.2-base-ubuntu22.0487.01 MB30.82 MB
nvidia/cuda:12.3.2-runtime-ubuntu22.041.28 GB1.23 GB
nvidia/cuda:12.3.2-devel-ubuntu22.043.68 GB3.14 GB
nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.041.91 GB1.86 GB
nvidia/cuda:12.3.2-cudnn9-devel-ubuntu22.044.31 GB3.77 GB
nvidia/cuda:12.3.2-base-ubuntu20.0488.25 MB32.56 MB
nvidia/cuda:12.3.2-runtime-ubuntu20.041.28 GB1.23 GB
nvidia/cuda:12.3.2-devel-ubuntu20.043.66 GB3.12 GB
nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu20.041.91 GB1.86 GB
nvidia/cuda:12.3.2-cudnn9-devel-ubuntu20.044.29 GB3.75 GB

3. Pytorch 镜像

Pytorch 官方提供的 Pytorch 镜像。

镜像AMD64 镜像大小
pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime3.44 GB
pytorch/pytorch:2.2.2-cuda12.1-cudnn8-devel8.47 GB

4. NVIDIA Pytorch 镜像

Nvidia 打包的 Pytorch 镜像,包含 cuda、cuBlas、cuDNN、OpenMPI、TensorRT 等包。

镜像pytorch 版本OScuda驱动要求AMD64 镜像大小相关链接
nvcr.io/nvidia/pytorch:24.03-py32.3.0Ubuntu 22.0412.4545+8.59 GBhttps://docs.nvidia.com/deeplearning/frameworks/pytorch-release-notes/rel-24-03.html
nvcr.io/nvidia/pytorch:23.10-py32.1.0Ubuntu 22.0412.2535+9.87 GBhttps://docs.nvidia.com/deeplearning/frameworks/pytorch-release-notes/rel-23-10.html

5. 运行镜像

  • 挂载全部 GPU 卡
1
2
3
docker run --gpus all \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 指定 GPU 数量
1
2
3
docker run --gpus 3 \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 挂载指定 GPU 卡
1
2
3
docker run --gpus '"device=0,1"' \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash

除了使用 GPU 的编号,还可以使用 UUID。UUID 可以通过 nvidia-smi -L 查询。

  • 设置共享内存 shm
1
2
3
4
docker run --gpus all \
           --shm-size=64g \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 设置系统资源限制
1
2
3
4
docker run --gpus all \
           --ulimit memlock=-1 --ulimit stack=67108864 \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 使用 Host IPC
1
2
3
4
docker run --gpus all \
           --ipc=host \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 挂载当前目录到容器的 /workspace
1
2
3
4
docker run --gpus all \
           -v "$PWD":/workspace \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 设置 CPU、Memory 限制
1
2
3
4
docker run --gpus all \
           --cpus=2 --memory=4g \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash
  • 以特权模式运行
1
2
3
4
docker run --gpus all \
           --privileged \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash

值得注意的是,Docker 特权模式启动的容器,能使用所有 GPU 资源,导致 --gpus 指定的设备列表无效。

  • 最大化资源启动
1
2
3
4
5
6
7
docker run --gpus all \
           --ulimit memlock=-1 --ulimit stack=67108864 \
           -v "$PWD":/workspace \
           --privileged \
           --shm-size=64g \
           -it --rm \
           pytorch/pytorch:2.2.2-cuda12.1-cudnn8-runtime bash

微信公众号