惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
美团技术团队
Last Week in AI
Last Week in AI
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
雷峰网
雷峰网
阮一峰的网络日志
阮一峰的网络日志
博客园 - 叶小钗
IT之家
IT之家
Google DeepMind News
Google DeepMind News
D
Docker
J
Java Code Geeks
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 【当耐特】
V
V2EX
Hugging Face - Blog
Hugging Face - Blog
博客园 - Franky
月光博客
月光博客
宝玉的分享
宝玉的分享
酷 壳 – CoolShell
酷 壳 – CoolShell
aimingoo的专栏
aimingoo的专栏
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
NVIDIA 环境变量配置
微信公众号 · 2025-01-20 · via 陈少文的网站

Please enable Javascript to view the contents

NVIDIA_VISIBLE_DEVICES

指定程序可见的 GPU 设备

1
CUDA_VISIBLE_DEVICES=0,1

可用值:

  • 1,2,以逗号分隔的 GPU UUID 或索引列表
  • all,所有 GPU
  • none,加载驱动,但无法访问 GPU
  • void,不加载驱动

NVIDIA_DRIVER_CAPABILITIES

控制哪些驱动程序库/二进制文件将被安装在容器内

1
NVIDIA_DRIVER_CAPABILITIES=compute,utility

可用值:

  • compute,CUDA 和 OpenCL 应用程序所需。
  • compat32,运行 32 位应用程序所需。
  • graphics,运行 OpenGL 和 Vulkan 应用程序所需。
  • utility,nvidia-smi 使用和 NVML 所需。
  • video,使用视频编解码器 SDK 所必需的。
  • display,利用 X11 显示所需。

NVIDIA_REQUIRE_CUDA

用于指定所需的 CUDA 版本和驱动程序版本

1
NVIDIA_REQUIRE_CUDA="cuda>=11.0 driver>=450"
1
NVIDIA_REQUIRE_CUDA="cuda>=11.7"

NVIDIA_REQUIRE_DRIVER

用于指定所需的驱动程序版本

1
NVIDIA_REQUIRE_DRIVER="driver>=470"

NVIDIA_REQUIRE_BRAND

用于指定所需的 GPU 品牌

1
2
NVIDIA_REQUIRE_BRAND="tesla"
NVIDIA_REQUIRE_BRAND="geforce"

NVIDIA_REQUIRE_ARCH

用于指定所需的 GPU 架构

1
NVIDIA_REQUIRE_ARCH "maxwell pascal volta turing ampere"

CUDA_DEVICE_ORDER

按照 PCI_BUS_ID 顺序从 0 开始排列 GPU 设备。

1
export CUDA_VISIBLE_DEVICES='PCI_BUS_ID'

只使用前两个 GPU

LD_LIBRARY_PATH

指定动态链接库的路径,确保运行时可以找到 CUDA 库文件。

1
LD_LIBRARY_PATH=/usr/local/cuda/lib64:/usr/lib/x86_64-linux-gnu:/usr/local/nvidia/lib

CUDNN_PATH

指定 cuDNN 库的安装路径

1
CUDNN_PATH=/usr/local/cuda

CUDA_HOME

构建 CUDA 应用时,搜索 CUDA 库文件和工具的路径

1
CUDA_HOME=/usr/local/cuda

CUDA_PATH

NVIDIA 自己的开发工具搜索 CUDA 库文件和工具的路径

1
CUDA_PATH=/usr/local/cuda

NCCL_IB_HCA

用于指定要用于通信的 RDMA 接口

1
NCCL_IB_HCA=mlx5_0,mlx5_1

NCCL_PXN_DISABLE

禁用使用非本地 NIC 的节点间通信

NCCL_IB_TIMEOUT

控制 InfiniBand 超时,取值范围 1-22

设置较大的值以避免 NCCL 超时

NCCL_IB_RETRY_CNT

控制 InfiniBand 的重试次数

NCCL_DEBUG

启用 NCCL 调试日志

NCCL_DEBUG_FILE

指定 NCCL 调试日志文件的路径,方便调试

1
NCCL_DEBUG_FILE=/tmp/nccl.log

NCCL_IB_PCI_RELAXED_ORDERING

可以提高虚拟化环境下 InfiniBand 网络的性能

1
NCCL_IB_PCI_RELAXED_ORDERING=1

0 表示禁用,1 表示启用,2 表示自动,默认值为 2。

NCCL_SOCKET_IFNAME

指定用于通信的网络接口

1
NCCL_SOCKET_IFNAME=eth0

NCCL_IB_DISABLE

禁用 InfiniBand 网络

NCCL_IB_GID_INDEX

指定要使用的 GID 索引

0、1 表示使用 ipv5,2、3 表示 ipv4。

其中,2 表示 RoCE v1 协议,3 表示 RoCE v2 协议。


微信公众号