惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
V
V2EX
Jina AI
Jina AI
爱范儿
爱范儿
M
MIT News - Artificial intelligence
量子位
L
LangChain Blog
Google DeepMind News
Google DeepMind News
酷 壳 – CoolShell
酷 壳 – CoolShell
罗磊的独立博客
腾讯CDC
MongoDB | Blog
MongoDB | Blog
P
Proofpoint News Feed
宝玉的分享
宝玉的分享
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
H
Hackread – Cybersecurity News, Data Breaches, AI and More
F
Fortinet All Blogs
The GitHub Blog
The GitHub Blog
Engineering at Meta
Engineering at Meta
博客园 - 聂微东
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Vercel News
Vercel News
T
The Blog of Author Tim Ferriss

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch Framework 12 值不值:可维修 Linux 机对上 Apple Silicon 低价 MacBook 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模 ktx:面向 data agents 的开源可执行上下文层,自动生成语义层与业务 wiki
8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议
2026-05-29 · via News Hacker | 极客洞察

🎯 讨论背景

这篇讨论围绕 Kog 发布的 LLM inference engine 技术预览展开,声称在 8× NVIDIA H200(数据中心 GPU)上把单请求吞吐做到约 3k tokens/s。标题里的“Standard GPUs”引发大量误解,很多人以为是消费级显卡,随后作者澄清并更新为“standard datacenter GPUs”。评论里反复提到 Monokernel(单内核优化)和 Delayed Tensor Parallelism(DTP,延迟张量并行)这两条路线:前者通过手写 CUDA/HIP/assembly 压榨推理路径,后者则面向更激进的 10k+ tok/s 目标。争论焦点不只是速度本身,而是这套方法能否从 2B 的预览模型外推到 GPT-OSS-120B、DeepSeek V4 Pro/Flash 这类更有用的 MoE(Mixture of Experts,混合专家)模型,以及在 consumer GPU、PCIe 和多节点环境下会遇到什么带宽上限。

📌 讨论焦点

标题与硬件口径争议

评论区首先争论的是“Standard GPUs”这个说法是否成立。很多人以为指的是消费级显卡,比如 4090、3090 或至少能接显示器的“普通 GPU”,但文章实际用的是 8× NVIDIA H200 这类数据中心加速卡。作者随后澄清并把文章标题改成了“standard datacenter GPUs”,但不少人仍认为原标题带有误导性,甚至接近 clickbait。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13] [来源14]

2B 预览不足以证明大模型可扩展

不少评论认为,拿 2B dense model 做 3k tok/s 展示,无法说明这套方案对真正有用的大模型也成立。有人直接把这种外推类比成“1 到 4 核线性提升就假设 256 核也一样”,或者“缓存内优化就假设多机问题也能同样优化”,并要求看到 27B、30B 甚至更大的实测。作者回应说,文章最后给了 scaling math:按 active params 和显存占用估算,GPT-OSS-120B、DeepSeek V4 Pro/Flash 这类 MoE 模型理论上可以继续扩展,但真正难点在于保持速度、处理更复杂的 routing 和 attention 逻辑。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13]

高 tok/s 的应用价值

支持者强调,token/s 并不只是“跑分”,而是直接影响 agentic workflow 的体验。比如软件工程、vibe coding、代码重构、测试循环都需要大量连续推理,如果每秒只能几十个 token,整个交互会被模型速度拖垮。也有人提到实时 video、shader generation、worldbuilding,甚至并行生成多个方案、做 Monte Carlo search 这类场景,认为 400–500 tok/s 可能只是起步,真正高吞吐才会打开新的工作流。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

工程实现:Monokernel、TP 与带宽瓶颈

技术讨论集中在这套推理引擎到底怎么做到这么快。作者说明他们会为不同 GPU 类型手写 CUDA/HIP 和 assembly,把模型逻辑重写到非常底层,以压缩 launch、sync、CPU sampling 等微秒级开销。评论和回复还解释了 Monokernel(单内核优化)和 TP(tensor parallelism,张量并行)的关系:当前 1k–5k tok/s 主要靠把 all-reduce 压到 3µs 以下,而 DTP(Delayed Tensor Parallelism,延迟张量并行)是面向 10k+ tok/s 的更激进路线。即便如此,consumer GPU 仍会受限于带宽和 PCIe 等互连性能,开源与否则被认为还要权衡 startup 的 IP 价值。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8]

📚 术语解释

Monokernel: 把推理流程尽量压缩到少量 GPU kernel 的优化思路,用来减少 launch 和同步开销。

DTP(Delayed Tensor Parallelism): 一种把张量并行中的通信尽量延后或隐藏的设计,目标是进一步提高 tokens/s。

TP(Tensor Parallelism): 把模型张量切分到多块 GPU 上并行计算的常见方法。

all-reduce: 多 GPU 间同步归并数据的通信操作,常常是性能瓶颈。

MoE(Mixture of Experts): 混合专家模型,只激活部分专家参数,以较少 active params 支撑更大的总参数量。