惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
Google DeepMind News
Google DeepMind News
爱范儿
爱范儿
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
NISL@THU
NISL@THU
T
Threat Research - Cisco Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
L
Lohrmann on Cybersecurity
V
Visual Studio Blog
Cyberwarzone
Cyberwarzone
D
Docker
The Hacker News
The Hacker News
C
CERT Recently Published Vulnerability Notes
Vercel News
Vercel News
Project Zero
Project Zero
S
Schneier on Security
aimingoo的专栏
aimingoo的专栏
I
Intezer
腾讯CDC
M
MIT News - Artificial intelligence
Hugging Face - Blog
Hugging Face - Blog
P
Palo Alto Networks Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
AWS News Blog
AWS News Blog
GbyAI
GbyAI
MongoDB | Blog
MongoDB | Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
V
Vulnerabilities – Threatpost
G
Google Developers Blog
N
Netflix TechBlog - Medium
The Cloudflare Blog
Microsoft Security Blog
Microsoft Security Blog
Y
Y Combinator Blog
A
Arctic Wolf
S
Securelist
酷 壳 – CoolShell
酷 壳 – CoolShell
Cisco Talos Blog
Cisco Talos Blog
Recent Announcements
Recent Announcements
C
Cyber Attacks, Cyber Crime and Cyber Security
L
LINUX DO - 热门话题
T
Threatpost
Latest news
Latest news
Blog — PlanetScale
Blog — PlanetScale
Security Latest
Security Latest
Engineering at Meta
Engineering at Meta
大猫的无限游戏
大猫的无限游戏
H
Help Net Security
The GitHub Blog
The GitHub Blog
T
Tor Project blog
P
Proofpoint News Feed

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12) Snack JSONPath 项目架构分析 Claude Code Buddy 小析:一个非核心功能,如何体现产品的细节完成度 AI新时代下的图床管理方案-Cloudflare图床+MCP+Skills方案指南 化繁为简:顺丰速运App如何通过 HarmonyOS SDK实现专业级空间测量 从零实现富文本编辑器#13-React非编辑节点的内容渲染 AI开发-python-langchain框架(3-23-OpenAI Functions风格Tool Calling智能助手) .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut PbootCMS 网站内容数量多导致访问慢?这些实用优化方案帮你提速! - 家兴网络技术工作室 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 网站漏洞怎么发现并修复?一篇实用指南(附完整流程) - 家兴网络技术工作室 开了 TUN 模式还是直连?90% 的人都踩过这个坑 Github日报|2026年04月12日 - AI一族 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术 Etsy 把 1000 个 MySQL 分片迁进 Vitess:425TB 数据背后的真正问题不是性能,而是运维规模 MicroPython LVGL基础知识和概念:底层渲染与性能优化 - FreakStudio 数据库草图算法 Python 潮流周刊#146:CPython 引入 Rust 的进展 - 豌豆花下猫 最小生成树 - mofei1116 红日靶场七:从外网入口、容器逃逸到 AD 接管的完整利用链复盘 - YouDiscovered1t 分享四款开源且实用的 Kafka 管理工具 - 追逐时光者 vLLM 权重加载机制全解析:从挑战到理想架构 LCT 学习笔记 - ACehomoxue Avalonia UI 12.0.0 正式发布:架构演进和性能飞跃 - 张善友 当 AI Agent 把调用链拉长,延迟开始成为一门生意 conhost.exe 无法显示 U+2717 - 145a 太秀了,我把自己蒸馏成了 Skill!已开源 - 程序员鱼皮 ASP.NET Core 内存缓存实战:一篇搞懂该怎么配、怎么避坑 基于 Ghostty 带有分割标签页和为 Claude 编程设计的通知终端 - BugShare AI 焊死入口:教育的“操作系统级”重塑 - 郝hai 初级Java开发工程师使用sql脚本编写代码的过程是简单而且不糊涂 - CoderOilStation Claude Code通关手册(六):MCP协议完全指南 - 暮色之狐 边框灯光环绕动画特效实现指南 - Newbe36524 开源:子木蒸馏版的 SEO 审计工具 seo-audit-skill v1.0 我所理解的Python元模型 【从0到1构建一个ClaudeAgent】规划与协调-TodoWrite - 程序员Seven Claude 和 Codex 在审计 Skill 上性能差异探究 - ACai_sec AScript如何实现中文脚本引擎 - rockey627 【渗透测试】HTB Season10 Garfield 全过程wp - dynasty_chenzi Android 开发者为什么必须掌握 AI 能力?端侧视角下的技术变革 树状数组正确性证明 - AC-wyr 你的 AI 焦虑,可能比 AI 本身更危险——ATM 机没有消灭银行柜员,但恐慌消灭了你的判断力 - 我没有三颗心脏 一个拉胯的分库分表方案有多绝望?整个部门都在救火! - 冰河团队 动态规划入门必学之走方格问题 - Ofnoname PostgREST 与 PostgreSQL 角色权限配置全解析(生产级实践) - SheepDog1998 使用 UEFI 图形输出协议 GOP 在屏幕上显示图像的方法 - 阿源- Claude Code通关手册(五):组建你的AI专家团队,子代理系统 - 暮色之狐 一个程序员到架构师的催婚路之感悟(整整10年后的催婚相亲感悟) - MisterLip 用 Agent Skill 自动生成工作周报 - 赵康
H200 安装驱动并使用sglang启动模型
追巨 · 2026-04-17 · via 博客园_首页

机器信息
系统:rocklinux 9.4
架构:x86
前置操作:关闭防火墙和selinux

如果没有互联网环境,可以使用iso文件搭建本地镜像仓库,这两个包的版本一定要和当前系统的内核版本一致

dnf install -y kernel-devel-$(uname -r) kernel-headers-$(uname -r)

二、安装dkms

dnf install -y dkms

三、安装驱动

rocklinux兼容rhel
可以使用rhel的rpm包:https://www.nvidia.cn/drivers/details/266455/
下载后安装

rpm -ivh nvidia-driver-local-repo-rhel9-590.48.01-1.0-1.x86_64.rpm

安装驱动
nvidia-driver可能会被过滤,导致dnf list | grep nvidia-driver,不显示驱动包,可以直接手动rpm安装

cd /var/nvidia-driver-local-repo-rhel9-590.48.01

rpm -ivh nvidia-kmod-common-590.48.01-1.el9.noarch.rpm \
         kmod-nvidia-latest-dkms-590.48.01-1.el9.x86_64.rpm \
         nvidia-driver-590.48.01-1.el9.x86_64.rpm \
         nvidia-driver-libs-590.48.01-1.el9.x86_64.rpm \
         nvidia-driver-cuda-590.48.01-1.el9.x86_64.rpm \
         nvidia-driver-cuda-libs-590.48.01-1.el9.x86_64.rpm \
         libnvidia-ml-590.48.01-1.el9.x86_64.rpm \
         libnvidia-cfg-590.48.01-1.el9.x86_64.rpm \
         nvidia-modprobe-590.48.01-1.el9.x86_64.rpm \
         nvidia-persistenced-590.48.01-1.el9.x86_64.rpm \
         nvidia-fabricmanager-590.48.01-1.el9.x86_64.rpm \
         --nodeps --force

检查驱动是否编译完成

dkms install nvidia/590.48.01

执行结果

[root@localhost nvidia-driver-local-repo-rhel9-590.48.01]# dkms install nvidia/590.48.01    
Module nvidia/590.48.01 already installed on kernel 5.14.0-427.13.1.el9_4.x86_64 (x86_64), skip. You may override by specifying --force.
[root@localhost nvidia-driver-local-repo-rhel9-590.48.01]#

加载模块

modprobe nvidia
modprobe nvidia-uvm

启动SXM 专属服务用于显卡间通信

systemctl enable --now nvidia-persistenced
systemctl enable --now nvidia-fabricmanager

查看显卡状态

nvidia-smi

执行结果,正常显示显卡信息则成功安装了驱动

[root@h200-new ~]# nvidia-smi 
Thu Apr 16 14:02:07 2026       
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 590.48.01              Driver Version: 590.48.01      CUDA Version: 13.1     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA H200                    On  |   00000000:19:00.0 Off |                    0 |
| N/A   37C    P0             78W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA H200                    On  |   00000000:3B:00.0 Off |                    0 |
| N/A   32C    P0             80W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA H200                    On  |   00000000:4C:00.0 Off |                    0 |
| N/A   31C    P0             76W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   3  NVIDIA H200                    On  |   00000000:5D:00.0 Off |                    0 |
| N/A   35C    P0             78W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   4  NVIDIA H200                    On  |   00000000:9B:00.0 Off |                    0 |
| N/A   37C    P0             77W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   5  NVIDIA H200                    On  |   00000000:BB:00.0 Off |                    0 |
| N/A   33C    P0             79W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   6  NVIDIA H200                    On  |   00000000:CB:00.0 Off |                    0 |
| N/A   36C    P0             78W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   7  NVIDIA H200                    On  |   00000000:DB:00.0 Off |                    0 |
| N/A   32C    P0             77W /  700W |       0MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|  No running processes found                                                             |
+-----------------------------------------------------------------------------------------+
[root@h200-new ~]#

四、安装docker和libnvidia-container

docker二进制包下载:https://download.docker.com/linux/static/stable/x86_64/
解压压缩包,将二进制文件移动至/usr/local/bin/下
新建service文件内容如下
/usr/lib/systemd/system/docker.service

[Unit]
Description=Docker Application Container Engine
Documentation=http://docs.docker.io

[Service]
Environment="PATH=/usr/local/bin:/bin:/sbin:/usr/bin:/usr/sbin"
ExecStart=/usr/local/bin/dockerd --log-level=error $DOCKER_NETWORK_OPTIONS \
--data-root=/data/docker/data
ExecReload=/bin/kill -s HUP $MAINPID
Restart=on-failure
RestartSec=5
LimitNOFILE=infinity
LimitNPROC=infinity
LimitCORE=infinity
Delegate=yes
KillMode=process

[Install]
WantedBy=multi-user.target

启动docker

systemctl daemon-reload
systemctl enable docker --now

安装libnvidia-container
下载地址:https://github.com/NVIDIA/libnvidia-container/tree/gh-pages/stable
安装

[root@h200-new containerd-tools]# ls
libnvidia-container-tools-1.17.4-1.x86_64.rpm  nvidia-container-toolkit-1.17.4-1.x86_64.rpm
libnvidia-container1-1.17.4-1.x86_64.rpm       nvidia-container-toolkit-base-1.17.4-1.x86_64.rpm
[root@h200-new containerd-tools]# rpm -ivh *rpm
warning: libnvidia-container-tools-1.17.4-1.x86_64.rpm: Header V4 RSA/SHA512 Signature, key ID f796ecb0: NOKEY
Verifying...                          ################################# [100%]
Preparing...                          ################################# [100%]
Updating / installing...
   1:nvidia-container-toolkit-base-1.1################################# [ 25%]
   2:libnvidia-container1-1.17.4-1    ################################# [ 50%]
   3:libnvidia-container-tools-1.17.4-################################# [ 75%]
   4:nvidia-container-toolkit-1.17.4-1################################# [100%]
[root@h200-new containerd-tools]#

配置生效

nvidia-ctk runtime configure --runtime=docker
systemctl restart docker

模型下载至:/data/llm/glm5.1-fp8
sglang镜像版本:lmsysorg/sglang:v0.5.10
启动sglang

docker run -d \
--name sglang-glm5 \
--gpus all \
--ipc=host \
--ulimit memlock=-1 \
--ulimit stack=67108864 \
-p 30000:30000 \
-e SGLANG_ENABLE_SPEC_V2=1 \
-e CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
-e TORCHINDUCTOR_CACHE_DIR=/data/glmcache5.1 \
-v /data/llm/:/data/models \
--shm-size=32g \
--restart=always \
lmsysorg/sglang:v0.5.10 \
sglang serve \
--model-path /data/models/glm5.1-fp8 \
--served-model-name glm-5.1-fp8 \
--api-key xxxxxx \
--host 0.0.0.0 \
--tp 8 \
--reasoning-parser glm45 \
--tool-call-parser glm47 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--mem-fraction-static 0.9 \
--context-length=184320 \
--max-running-requests=10 \
--max-prefill-tokens=8192

使用docker logs -f sglang-glm5 查看模型加载进度,等待模型加载完成
查看显卡使用情况

[root@h200-new data]# nvidia-smi 
Thu Apr 16 18:00:27 2026       
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 590.48.01              Driver Version: 590.48.01      CUDA Version: 13.1     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA H200                    On  |   00000000:19:00.0 Off |                    0 |
| N/A   55C    P0            136W /  700W |  141572MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA H200                    On  |   00000000:3B:00.0 Off |                    0 |
| N/A   42C    P0            126W /  700W |  141622MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA H200                    On  |   00000000:4C:00.0 Off |                    0 |
| N/A   40C    P0            122W /  700W |  141622MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   3  NVIDIA H200                    On  |   00000000:5D:00.0 Off |                    0 |
| N/A   54C    P0            135W /  700W |  141622MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   4  NVIDIA H200                    On  |   00000000:9B:00.0 Off |                    0 |
| N/A   54C    P0            132W /  700W |  141622MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   5  NVIDIA H200                    On  |   00000000:BB:00.0 Off |                    0 |
| N/A   42C    P0            123W /  700W |  141622MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   6  NVIDIA H200                    On  |   00000000:CB:00.0 Off |                    0 |
| N/A   55C    P0            135W /  700W |  141624MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   7  NVIDIA H200                    On  |   00000000:DB:00.0 Off |                    0 |
| N/A   41C    P0            123W /  700W |  140658MiB / 143771MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|    0   N/A  N/A          161448      C   sglang::scheduler_TP0                 14156... |
|    1   N/A  N/A          161449      C   sglang::scheduler_TP1                 14161... |
|    2   N/A  N/A          161450      C   sglang::scheduler_TP2                 14161... |
|    3   N/A  N/A          161451      C   sglang::scheduler_TP3                 14161... |
|    4   N/A  N/A          161452      C   sglang::scheduler_TP4                 14161... |
|    5   N/A  N/A          161453      C   sglang::scheduler_TP5                 14161... |
|    6   N/A  N/A          161454      C   sglang::scheduler_TP6                 14161... |
|    7   N/A  N/A          161455      C   sglang::scheduler_TP7                 14064... |
+-----------------------------------------------------------------------------------------+
[root@h200-new data]# 

测试

[root@h200-new llm]# curl http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer xxxxxxx" \
  -d '{
    "model": "glm-5.1-fp8",
    "messages": [
      {"role": "system", "content": "你是一个人工智能助手。"},
      {"role": "user", "content": "你好,请确认你的模型版本,并简单介绍下 H100 GPU 的优势。"}
    ],
    "temperature": 0.7
  }'
{"id":"3dd2d8cbf57546bd926b30e35559dd8d","object":"chat.completion","created":1776325869,"model":"glm-5.1-fp8","choices":[{"index":0,"message":{"role":"assistant","content":"你好!我是一个由 Z.ai 开发的人工智能助手(基于 GLM 大语言模型)。\n\n关于 NVIDIA H100 GPU,它是基于 Hopper 架构的旗舰级数据中心 GPU,专为加速人工智能和高性能计算而设计。它的主要优势包括:\n\n1. **Transformer 引擎**:这是 H100 最大的亮点之一。它专门针对当前大语言模型(LLM)的基础——Transformer 架构进行了优化,能够动态分配 FP8 和 FP16 精度,在保持模型精度的同时,将大模型的训练和推理速度提升至前所未有的水平。\n2. **极高的性能飞跃**:相比上一代 A100,H100 在 AI 训练上最高可提供 9 倍的提升,在 AI 推理上最高可提供 30 倍的提升(特别是在结合 FP8 和 Transformer 引擎时)。\n3. **HBM3 高带宽内存**:H100 采用了更先进的 HBM3 内存,最高提供 80GB 容量和超过 3TB/s 的惊人带宽,极大缓解了大规模 AI 模型的“内存墙”问题。\n4. **第四代 NVLink 与 PCIe 5.0**:NVLink 互联带宽提升至 900GB/s,是 PCIe 5.0 的 7 倍,使得成千上万张 H100 组成的集群能够高效协同工作,构建超大规模计算集群。\n5. **原生 FP8 支持**:H100 是首批原生支持 FP8(8位浮点)数据格式的 GPU 之一,这不仅能将内存占用减半,还能大幅提高吞吐量,对 AI 推理极其有利。\n6. **DPX 指令集**:专门用于加速动态规划算法,在基因组学测序、物流路线优化等科学计算领域,速度比 A100 提升高达 7 倍。\n\n总的来说,H100 是目前大模型时代最重要的算力基础设施,凭借其针对 Transformer 的特化设计和极高的带宽,成为了训练和部署下一代 AI 的首选硬件。","reasoning_content":"1.  **分析请求:**\n    *   任务 1:确认我的模型版本。\n    *   任务 2:简单介绍 H100 GPU 的优势。\n    *   语言:中文。\n\n2.  **处理任务 1:确认模型版本:**\n    *   *自我认知:* 我是一个人工智能助手。我的具体底层模型版本通常不作为硬编码字符串公开,但我是由 Z.ai 开发的大语言模型(GLM 系列)。我应该清楚地说明我是一个人工智能助手,并提及我的开发者/模型系列(GLM),而不必捏造特定的版本号(除非我绝对确定,但通常“由 Z.ai 开发的 GLM 大语言模型”是最准确和安全的回答)。\n    *   *起草:* 你好!我是一个由 Z.ai 训练的大语言模型(基于 GLM 架构)。\n\n3.  **处理任务 2:介绍 H100 GPU 的优势:**\n    *   *主题:* NVIDIA H100 Hopper GPU。\n    *   *需要涵盖的关键优势:*\n        *   架构:Hopper 架构(继 Ampere/A100 之后)。\n        *   性能:AI 训练和推理的巨大飞跃。Transformer 引擎(对大语言模型至关重要)。\n        *   内存/带宽:HBM3 内存(与 A100 的 HBM2e 相比,带宽大幅提升)。\n        *   互连:NVLink 4.0(比第 3 代更快)、PCIe Gen 5。\n        *   安全/可靠性:机密计算、原生 FP8 支持。\n        *   DPX 指令集:用于动态规划。\n    *   *构建介绍结构:* 使用项目符号以提高可读性。保持简洁但全面。\n    *   *起草要点:*\n        1.  **Hopper 架构与 Transformer 引擎**:专门针对大语言模型(LLM)优化,自动分配 FP8/FP16 精度,大幅提升推理和训练速度。\n        2.  **极致的性能提升**:相比上一代 A100,AI 训练速度提升数倍,推理速度最高提升 30 倍。\n        3.  **更快的 HBM3 内存**:提供更高的内存带宽(最高可达 3TB/s),解决大规模模型的内存瓶颈。\n        4.  **第四代 NVLink 与 PCIe 5.0**:多卡互联带宽翻倍,支持构建更大规模的计算集群。\n        5.  **FP8 数据格式支持**:在保持精度的同时,大幅减少内存占用和计算时间。\n        6.  **DPX 指令集**:加速动态规划算法,适用于基因组学、物流优化等领域。\n\n4.  **审查与润色:**\n    *   将两个回答流畅地结合起来。\n    *   确保语气乐于助人且专业。\n    *   *起草时的自我纠正:* 确保不要声称自己是 GPT-4 或 Claude 3,因为那是不正确的。坚持 Z.ai/GLM 的身份。\n\n5.  **最终输出生成(中文):**\n    你好!我是一个由 Z.ai 开发的人工智能助手(基于 GLM 大语言模型)。\n\n    关于 NVIDIA H100 GPU,它是基于 Hopper 架构的旗舰级数据中心 GPU,专为加速 AI 和高性能计算(HPC)而设计。它的主要优势包括:\n\n    1. **Transformer 引擎**:这是 H100 最大的亮点之一。它专门针对当前大语言模型(LLM)的基础——Transformer 架构进行了优化,能够动态分配 FP8 和 FP16 精度,在保持模型精度的同时,将大模型的训练和推理速度提升至前所未有的水平。\n    2. **极高的性能飞跃**:相比上一代 A100,H100 在 AI 训练上最高可提供 9 倍的提升,在 AI 推理上最高可提供 30 倍的提升(特别是在结合 FP8 和 Transformer 引擎时)。\n    3. **HBM3 高带宽内存**:H100 采用了更先进的 HBM3 内存,最高提供 80GB 容量和超过 3TB/s 的惊人带宽,极大缓解了大规模 AI 模型的“内存墙”问题。\n    4. **第四代 NVLink 与 PCIe 5.0**:NVLink 互联带宽提升至 900GB/s,是 PCIe 5.0 的 7 倍,使得成千上万张 H100 组成的集群能够高效协同工作,构建超大规模计算集群。\n    5. **原生 FP8 支持**:H100 是首批原生支持 FP8(8位浮点)数据格式的 GPU 之一,这不仅能将内存占用减半,还能大幅提高吞吐量,对 AI 推理极其有利。\n    6. **DPX 指令集**:专门用于加速动态规划算法,在基因组学测序、物流路线优化等科学计算领域,速度比 A100 提升高达 7 倍。\n\n    总的来说,H100 是目前大模型时代最重要的算力基础设施,凭借其针对 Transformer 的特化设计和极高的带宽,成为了训练和部署下一代 AI 的首选硬件。","tool_calls":null},"logprobs":null,"finish_reason":"stop","matched_stop":154827}],"usage":{"prompt_tokens":29,"total_tokens":1576,"completion_tokens":1547,"prompt_tokens_details":null,"reasoning_tokens":1119},"metadata":{"weight_version":"default"}}[root@h200-new llm]# 
[root@h200-new llm]#