惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Privacy & Cybersecurity Law Blog
Engineering at Meta
Engineering at Meta
Forbes - Security
Forbes - Security
MongoDB | Blog
MongoDB | Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
A
About on SuperTechFans
量子位
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
雷峰网
雷峰网
腾讯CDC
P
Proofpoint News Feed
S
Schneier on Security
S
Secure Thoughts
V
Visual Studio Blog
Help Net Security
Help Net Security
The Hacker News
The Hacker News
C
Cyber Attacks, Cyber Crime and Cyber Security
P
Privacy International News Feed
SecWiki News
SecWiki News
S
SegmentFault 最新的问题
T
Threatpost
小众软件
小众软件
MyScale Blog
MyScale Blog
F
Fortinet All Blogs
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
P
Proofpoint News Feed
T
Tailwind CSS Blog
I
Intezer
C
CERT Recently Published Vulnerability Notes
U
Unit 42
V
V2EX
Cyberwarzone
Cyberwarzone
Recorded Future
Recorded Future
O
OpenAI News
Project Zero
Project Zero
有赞技术团队
有赞技术团队
Google DeepMind News
Google DeepMind News
Last Week in AI
Last Week in AI
Hugging Face - Blog
Hugging Face - Blog
Know Your Adversary
Know Your Adversary
C
Cybersecurity and Infrastructure Security Agency CISA
Scott Helme
Scott Helme
V2EX - 技术
V2EX - 技术
博客园 - 叶小钗
S
Securelist
A
Arctic Wolf
The Cloudflare Blog
W
WeLiveSecurity
T
Threat Research - Cisco Blogs
博客园 - Franky

V2EX - 技术

Local-first 软件收录站 从 X 上搬运来的白嫖 GPT Plus 教程 阿里云百炼 Coding Plan Pro 套餐 新增当日 token 限制 大家的 Claude 弹了 kyc 嘛 现在 Google 的 Gemini 和 AI 模式降智的厉害啊 用的 TAG 家的 T, ip 跳变是否影响使用 claude 同一 apple 账户能给不同 claude 账号充值么 做了个 Go 的 MCP Server 框架,一行代码把 Gin API 接入 AI - V2EX 请教各位,想回归技术,如何系统学习 Agent? OpenAI GPT-IMAGE-2 提示词合集 你是说, claude opus4.6 写代码的能力不如 gpt5.4? 关于智谱 Max 套餐要不要升级续费呢? App → CLI → App ? Github 账号被 404 了,现在没法恢复,求各位大佬指点 cursor 的次数套餐以后应该都用不了新模型了 - V2EX openrouter 使用国外模型 买了咸鱼低价 Gemini pro,账号差点被盗。突然发现国内诈骗成本为零 - V2EX Gemini 手机版客户端登陆总是在此国家/地区无法使用 gemini 感觉 gpt 这些低价渠道要爆了 claude code 和 codex 在 vibe coding 还有质的区别吗? 阿里 Coding Plan 一天三变, Lite 版本到期不能续费了 RAG 难以让人满意啊 2026 年了,这个世界还存在互联网精神🥹 两个账号阵亡,尼区 Claude Pro 订阅 分享下最近低价 GPT Codex 的来源(源头) OpenAI 发布 Codex 重大更新:支持自动操作电脑与长期任务自动化 使用 claude 从 0 开始开发一个校友会系统可行吗 同一个 appleid 可以给不同 chatGPT 账号订阅 plus 吗? 自动驾驶项目开发建议 终于, 降智几天之后, opus4.7 出来了 自己开发了个 VSCODE 扩展,可以接入自定义的模型,并且可以导出 Copilot 的聊天列表到其它设备上导入 - V2EX Claude 这对吗 某鱼上 codex 的价格这么便宜是否有猫腻? 🎉 Claude Opus 4.7 来啦~ 大家体验下来如何? 让 ai 重写了整个 git 的历史,强迫症被拯救了 [分享创造] 写了个自托管的 Chrome 同步服务器,书签密码再也不经过 Google 快讯, Claude Opus 4.7 已经可以使用。 Opus4.7 来了,网页版先上,桌面版本客户端暂时未看到 各位想本地部署大模型的看过来, 有台电脑想转让, 具体请查看截图, 价格请自己开价 这样用 ClaudeCode 怎么样? 我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux - V2EX [调研] 各位在公司都用什么 ide 和 agent 写代码? 丹麦国别域名(.dk)政策变更 - V2EX 目前付费订阅 chatgpt Plus 的最佳方式是什么? 老运维 share 一个运维平台 新电脑 brew install node 之后,一个小设置可以提升对供应链投毒的防御 - V2EX 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? - V2EX 现在还有什么渠道可以稳定安全地使用 Claude 吗? Chatgpt Pro 用量用不完的可以开这些设置 字节为啥不出个国内版 Vercel? 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 - V2EX Claude Web 端貌似 claude-opus-4-7 偷偷上了? 现在 Apple 开发者帳號應該是用哪个地区会更好? - V2EX ChatGPT Pro 5x 套餐 量真的很足! chrome 最新的 147 版直接卡爆炸了 - V2EX 为什么厂家不在 skill/mcp 这类的工具中塞广告呢?这样不是可以大赚嘛? minimax 真是脸都不要了,工作日下午 14:00 定时开启 529,脸都不要了。训练模型居然占用用户使用时间 iTad 标签 扩展 加小动作 ? - V2EX 去年 H200 能买,不让买是代替快出来了? - V2EX AI 赛事通 - 2026 年 4 月中国区新增 AI 竞赛和黑客松汇总 - V2EX 现在安卓开发都在做啥 - V2EX 浏览器插件 沉浸式翻译 是不支持自定义模型了吗? - V2EX Codex 里的 GPT5.4 也能降智?上午让它改两个问题,改了一个小时了, plus 额度用了一半了还是没改好,和前几天用的体感完全不一样。要它改的问题也不复杂。服了。 目前有使用 claude code 的收到人脸认证的吗 - V2EX 分享一个自己做的 Nginx 管理工具,实时请求动态预览!(无奈市面上实在找不到好用的,自己撸了个) - V2EX claude code 崩了么? 今天在反重力上用 claude 一点都不丝滑,有同样的感受吗? opencode 消息周知插件 今天 claude opus 和前两天比,质的飞跃 - V2EX 999 包月价? - V2EX 一个版本, 50 项更新:我们几乎重做了整个播放页 本地大模型多大显存够用? GOGDNS 一款简易的私人 DNS 服务器 - V2EX API key (GLM) 怎么使用 claude code desktop ? Claude 这样订阅有问题吗 - V2EX 帮我爸找回了一篇赛博兰亭集序 求推荐稳定、高性价比使用 Claude Opus 4.6 的渠道/平台 搞个云端 claude code 防止 封号 - V2EX 用 Claude 要实名了,内地用户怎么办? OpenAI Plus 和 Team 都缩水了吗 海外 Android 手机有什么好用的国内第三方应用市场推荐吗 - V2EX 把电脑伪装成电视,用 DLNA 投屏拿到视频号直播流地址 - V2EX claude 认证莫慌 北京互联网法院有什么攻略么?起诉北京智谱华章科技股份有限公司退款可行么? - V2EX Claude 开始引入身份验证 求 vscode 做笔记软件的插件推荐 - V2EX 讯飞星辰的 Coding Plan 如何? Anthropic 宣布在 Claude 平台推行身份验证机制 科普一下低价 gpt 是怎么来的 有没有长期关注 Claude 的朋友,我建了一个 Channel 自动抓取 Claude Team 的推文 啃了那篇 54 页的 Agent Harness 综述, 给大伙讲个省流版 现在那家的 coding plan 还能买到 是不是最近会有什么更聪明的大模型要发布了呀? 用多了 AI 后,有没有觉得 AI 生成的文章有很强的既视感? 如何 实践 Harness 工程? 今日份 GPT 5.4 笑话 如何建一个自己的号池,让 cursor 真正实现 token 自由 写了三个月 Agent Harness,我终于敢让 Claude Code 全自动写代码了 感叹一下 GLM 5.1 真的强
多台 GPU 之间怎么组网互联?
mingtdlb · 2026-04-21 · via V2EX - 技术

这是一个创建于 53 天前的主题,其中的信息可能已经有所发展或是发生改变。

比如要部署 deepseek 满血版,总不能用一台跑对吧,那比如有三台 SXM 版的 8 卡 A100 的 GPU 服务器

好奇问一下,想学习学习

第 1 条附言  ·  4 月 21 日

为什么想了解这个,GPU太贵了,单节点可能都要几十上百万,集群才考虑组网,实践的机会更少了。

现在招人都要求有经验的,不像以前能从初级开始干,有机会从实践中学习。

  • GPU
  • 互联
  • 部署

    30 条回复    2026-04-26 17:26:19 +08:00

    makictos

    1

    makictos      4 月 21 日   ❤️ 3

    每台机器插八个 cx7 400g 网卡,然后三台机器走 48 口交换机做互联

    minami

    2

    minami      4 月 21 日 via Android

    关键字:NvLink 、NvSwitch 、InfiniBand

    ptstone

    3

    ptstone      4 月 21 日

    网卡互联根本行不通,pcie5 的速度都不够,至少 1Tb/s 这种才能考虑

    geekvcn

    7

    geekvcn      4 月 21 日

    目前都是 IB 网卡或者雷电网桥,总之带宽越高越好,以太网也行但是效率堪忧

    thevita

    8

    thevita      4 月 21 日

    单台机内 nvlink
    跨机器 RDMA 呗

    网络并不是对等的, nvlink 带宽和延迟肯定都要好于网络, 所以尽量把 all-to-all 的通信放单个 node 内(比如 TP )
    跨 node 通信也需要深度的优化,通过各种 pipeline overlapped 来隐藏延迟

    不是搞这个的,仅仅是个人粗浅的理解

    mingtdlb

    9

    mingtdlb      4 月 21 日

    @ptstone #3 gpu 是 smx 的,单节点内 nvlink 没问题,但集群的话,按 1 楼哥 @makictos 说的那样 那个是专用卡?然后走 rdma ( ib 或 rocev2 )。

    刚问了下 Gemini ,大概意思服务器安装网卡驱动
    ib 的话:需要在一个节点上运行 Subnet Manager (OpenSM) 来管理网络拓扑和分配 LID ,就没了
    RoCEv2 的话:配上 ip ,还要优化网络,然后是主机这边 rdma 相关的配置

    这么看下来,加上现在有 AI 的辅助,gpu 服务器的集群的部署也没很难?😂

    roygong

    10

    roygong      4 月 21 日 via iPhone

    Infiniband 是一个专门的硬件,有了就可以跨机跑模型

    geekvcn

    11

    geekvcn      4 月 21 日

    @mingtdlb 连接不要用光缆,用铜缆直通,有专门的直连铜缆,缺点是长度受限仅适用于机器都在单机柜里。不用光缆是因为光电转换会引入额外的开销和延时

    neteroster

    12

    neteroster      4 月 21 日

    除了硬件还要考虑并行,dp, ep, tp 啥的,各种调优,infra 没那么简单的

    COOOOOOde

    16

    COOOOOOde      4 月 21 日

    未来的方案都是上光信号 铜缆都不行了, 你炒股的话 就知道现在的 CPO 题材有多火了

    mingtdlb

    17

    mingtdlb      4 月 21 日

    @stoneabc #14 搜了一些文章,比较同意,用 roce ,ib 成本太高了。但具体怎么组网还没搜到。。。想看具体的方案细节

    coefu

    18

    coefu      4 月 22 日

    LLM 多机多卡分布式并行推理的话,infra 上的优化总是有限度的,还得是 架构优化,kvcache 量化,pd 分离,虽然都是老生常谈,但是真的必须得用。

    要是 pipeline 串行推理,那非常简单明了,10G 以太网都能搞。

    coefu

    19

    coefu      4 月 22 日

    glm5.1 Q8-k-xl,811G ,2 个 m3 mac studio ultra 512G 通过 雷电口串起来跑 pipeline ,也是能跑的。就是慢罢了。

    amd 2023 年出的 mi300x,单卡都 192G hbm3 ,一机 8 卡,也有 1.5T ,现在开源的量化都能单机塞进去。
    就不用说 2024 年出的 mi325x ,单卡 256G hbm3e ,一机 8 卡,2T ,开源的 BF16 都能塞进去,还有 context 空间。

    所以,多机多卡分布式并行推理,在这些大船靠岸的时候,都是过去时了。只是,当下,对于市面上的穷人来说,还是有用的。或许,工程学术上还能水一点文章。

    makictos

    20

    makictos      4 月 22 日

    @coefu 多机器组全局 nvl 不是为了推理的,如果你需要强推理,有很多其他高性价比选择,比如说你说的 mi325x ,或者 intel 的 gaudi3 。全局 nvl 的核心主要在于多集群的训练,这个是 nv 独有的优势。

    makictos

    21

    makictos      4 月 22 日

    @mingtdlb 你想看哪些技术细节?目前想要做多机组网,对于小规模客户来说,其实 ib 就是成本最低的。因为有集群组网经验的技术年薪。。大概率高于一台 H200 整机。而且就算集群组网,也无法实现你把模型拖进去就能用,程序并不是原生就能做 nvl 多卡拆分的。

    coefu

    22

    coefu      4 月 23 日

    @makictos #20 训练多大参数的模型呢?有这个训练需求的,单卡早超过了 128G 。全世界不会超过 10 家,这 10 家的 infra 技术,和,你,我,他,有什么关系?你,我,他,会不会,懂不懂,又有什么关系?

    你的观点是工程学术理论极限,但是学界也没有条件搞这个级别的集群的工程技术创新,普罗大众也接触不到。能研究这个极限的,也就大厂的那些个有条件接触超大集群 infra 的工程师。理论极限,我当然懂。我每天都看最新研究论文。

    我的观点是,多机多卡分布式并行推理,就算是攒了一些低端卡,凑个 40G 网络的普通玩家来说,也是个鸡肋技术。不要说训练,多机多卡分布式并行训练,虽然起码理论上来说,我懂,但是我也没实践过,没条件。但是,并不是说,每个人从理论上都懂的。

    makictos

    23

    makictos      4 月 25 日

    @coefu 无意冒犯,我目前就职于你所说的大厂,也确实是 v2 少数能完整直接控制超大集群的工程师。回复此贴只是做技术解答。

    makictos

    24

    makictos      4 月 25 日

    @coefu 其次,懂这些是相当有必要的,在目前 tesla v100 sxm2 这种入门级卡片只要 600 元的市场下,如果个人购买百卡组小规模集群进行学习实践,可以有效提高你进入大厂的可能性。在目前的组内需求中,我们仍缺乏有经验的百卡/千卡工程师。

    mingtdlb

    25

    mingtdlb      4 月 25 日

    @makictos #21 你讲的对我来说有点高深,什么 nvl ,什么多卡拆分,我不太了解这些,我知道你有东西,第一条回复就能看出来😁

    这么说吧,比如我想在企业内网跑一个大模型,供内部使用,要企业级的方案,最开始肯定是确认需求算力、并发、吞吐量、显存大小,再选型 GPU ,硬件到货了再给他组起来。

    假设吧,比如是有 8 台 SXM 版的 GPU 服务器,每台是 8 卡 H200 ,那首先要把硬件连接起来,怎么连呢,然后再部署 ds v4 的大模型,提供 api 接口给业务用。

    我想了解下怎么开展这项工作,有没有文章可以看的,想学习了解一下,我个人是做云计算方面的,未来 GPU 价格如果下来了,企业内网有需求的都会这么玩吧

    软件层面可能企业中有 GPU 云平台这种东西,能直接纳管 GPU 服务器,然后平台能直接部署大模型,还带监控、运维管理啥的(我按云计算的的思想,猜的,就像 esxi 这种厂家,到时部署大模型给业务用就像发个虚拟机一样简单),先不考虑这种的

    coefu

    26

    coefu      4 月 25 日

    @makictos #24 味儿太浓,你要是能不这么端着交流,我还能高看你一眼。但是你这装的,处处感觉自己屌人一筹。讲真,LLM 这波还能走多远都是个问题,行家都知道 LLM 根本没有什么搞头。你也就是在这波泡沫里游荡一回罢了。底层这点工程技术,早就没什么新鲜东西。而且我都没问你,你解答个什么?你给 OP 回复就行了,并且你回复的也不是我不懂的东西嘛。讲了和没讲一样,谁不知道 nvlink?

    一开始是无所谓冒犯不冒犯的,但是你后面这两个回复,确实味儿太冲,熏到哥们儿了。但是我理解你孤芳自赏的内心,我原谅你。

    makictos

    30

    makictos      4 月 26 日

    @coefu 多远不重要,但是对普通人来说,这是目前来钱最快的一条路之一。我也只是赚点钱的普通人。