惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
IT之家
IT之家
博客园_首页
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
美团技术团队
小众软件
小众软件
博客园 - 叶小钗
WordPress大学
WordPress大学
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
罗磊的独立博客
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Last Week in AI
Last Week in AI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
有赞技术团队
有赞技术团队
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
博客园 - 【当耐特】
月光博客
月光博客
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
酷 壳 – CoolShell
酷 壳 – CoolShell
人人都是产品经理
人人都是产品经理

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch Framework 12 值不值:可维修 Linux 机对上 Apple Silicon 低价 MacBook 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模
GPU 矩阵乘法会因数据可预测而提速
2026-05-28 · via News Hacker | 极客洞察

🎯 讨论背景

这篇文章讨论 GPU matrix multiplication 在输入矩阵更“可预测”或更规律时会跑得更快,作者把原因指向内部 transistor switching / bit flip 数量变化带来的功耗差异。评论把它放到数据中心 GPU(server cards)和 HBM2e(高带宽显存)的语境下理解,并讨论 nvidia-smi 与 NVML(NVIDIA 的监控工具/库)是否会影响测量结果。讨论还牵涉到 thermal throttling、power cap(功耗上限)、branch prediction(CPU 预测分支的机制)以及 side channel attack(利用时序或功耗泄露信息的攻击)等背景。有人提到 SC24 的 workshop paper 可能做过更多实验,但这类结果目前仍带有“机理解释 vs. 实验验证”的争议。

📌 讨论焦点

数据分布改变功耗与降频

评论里最核心的解读是:矩阵乘法不是单纯因为“算得少”而变快,而是输入越规律,GPU 内部的 transistor state changes / bit flips 越少,功耗和发热也越低,clock throttling 就更轻。有人明确说,这比 branch prediction 的类比更贴切,因为这里影响的是能量和热预算,不是 speculative execution。还有人提到,显存里有大模型时即使“空闲”功耗也会上升,像是 DRAM refresh 和 HBM2e 频率在起作用。也有人说 SC24 的 workshop paper 可能做过更多实验,说明这个现象值得继续量化。

[来源1] [来源2] [来源3] [来源4]

服务器卡空闲功耗与监控噪声

有人先被 88W 的“空闲功耗”惊到,但很快指出这在 server card 上并不罕见,因为数据中心 GPU 不是为最低 idle power 优化的,而是为满负载和稳定延迟设计。GeForce 卡则可以通过 Prefer maximum performance 关闭部分低功耗状态。还有人提醒,nvidia-smi 本身可能会把 GPU 唤醒,所以真正看状态更该用 NVML。另一些补充把差异归因到显存内容:内存空着时和模型占满显存时,功耗曲线会很不一样。

[来源1] [来源2] [来源3] [来源4] [来源5]

不是 branch prediction

一开始不少人把它联想到 branch prediction,但讨论很快指出 GPU 的执行方式和 CPU 不同,GPU 更依赖大量并发线程,而不是靠复杂的 speculative execution。也有人说,文章里的 bit-flip / 功耗解释其实比“CPU 预测未来失败”这类比喻更直接。与此同时,也有质疑声认为“随机数据必然更多 bit flips”这点并没有被充分证明。还有人期待看到的是 torch 或编译器层面把矩阵乘法里的某些零初始化路径直接特判掉,但文章并没有走这个方向。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6]

0/1 特判在硬件里不划算

不少人直觉上会想到把 multiply-by-0 和 multiply-by-1 特判成快速路径,尤其是在 neural network 里这看起来很合理。硬件工程视角的回复则强调:在 silicon 里加这些特判不是免费午餐,需要额外的 OR reduction、multiplexer、die area 和 leakage power,还可能拖慢 critical path timing。也就是说,软件里的“多写几条 if”在硬件里会变成真实的面积和功耗成本。另有人补充,weights 不一定常是 0/1,但 ReLU activation 常为 0,所以是否值得做取决于 workload。

[来源1] [来源2] [来源3] [来源4]

功耗上限与热限制

评论把这个现象和 local LLM inference、power limiting 联系起来,认为降低功耗上限有时会带来更好的能效,甚至接近原始性能。反对者则指出,省电不等于更快;如果卡更凉,确实可能在 boost 规则下顶到更高频率,但本质还是在躲避 thermal throttling。还有人把讨论扩展到“约束会逼出优化”,但也担心这种约束会不会变成大厂继续把用户锁进自己的 infra 的工具。整体看,大家在争论的是性能、效率和热限制之间到底谁在主导。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

侧信道与数据遮蔽

有人直接把这种数据依赖性能视为 side channel attack 的潜在来源,因为攻击者可能通过时间或功耗差异推断矩阵内容。回复里提到可以对矩阵做随机旋转,或者用 random Hadamard 这类变换来打散结构,让输入统计特征不那么明显。相关讨论还顺带提到 TurboQuant 和 llama.cpp 里已经采用的类似技巧。这个分支把原本的性能话题拉到了安全与隐私层面。

[来源1] [来源2] [来源3] [来源4]

AI 递归优化与分布塑形

还有人把这件事想象成一个更“递归”的优化链:既然数据分布会影响 matmul 性能,那能否再用 ML 去选择更快的 matmul path,甚至调整 weight 更新,让权重更接近有利分布。评论里给出一个例子,说 uniform distribution 的权重在 TFLOPS 上略高于 normal distribution。另一个补充是,data center 早就在用 AI 做 cooling 预测和任务重调度,所以“AI 优化 AI”并不是完全离谱的想法。

[来源1] [来源2] [来源3]

可预测执行流是硬件卖点

另一个角度来自 Tenstorrent,这类 AI 加速器硬件强调 predictable execution flow 本身就是优势。这个观点和整篇讨论呼应:不是只追求峰值 FLOPS,而是追求可预测、可控、容易维持的实际吞吐。也就是说,数据越规整,硬件越容易把性能稳定地跑出来。

[来源1]

📚 术语解释

nvidia-smi: NVIDIA 的命令行监控工具,用来查看 GPU 温度、功耗和利用率;有评论指出它本身可能会唤醒 GPU。

NVML: NVIDIA Management Library,常用于读取 GPU 状态而尽量不干扰设备运行。

HBM2e: 一种高带宽显存,常见于数据中心 GPU,评论里提到它可能一直维持较高频率。

thermal throttling: GPU 因温度或功耗压力自动降频,以保持在安全范围内。

power cap: 给 GPU 设置的功耗上限,会影响 boost 频率、温度和整体效率。

branch prediction: CPU 通过预测条件分支来减少停顿的机制,这里被拿来和 GPU 的数据依赖性能作类比。