惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

有赞技术团队
有赞技术团队
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
IT之家
IT之家
博客园 - 【当耐特】
罗磊的独立博客
Stack Overflow Blog
Stack Overflow Blog
MyScale Blog
MyScale Blog
WordPress大学
WordPress大学
The GitHub Blog
The GitHub Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Hugging Face - Blog
Hugging Face - Blog
I
InfoQ
B
Blog RSS Feed
腾讯CDC
云风的 BLOG
云风的 BLOG
N
Netflix TechBlog - Medium
Apple Machine Learning Research
Apple Machine Learning Research
GbyAI
GbyAI
雷峰网
雷峰网
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
D
DataBreaches.Net
The Cloudflare Blog
V
V2EX
S
SegmentFault 最新的问题

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch Framework 12 值不值:可维修 Linux 机对上 Apple Silicon 低价 MacBook 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模
Qwen3.7-Max 35小时优化未知硬件kernel获10×提速,引发真实性...
2026-05-28 · via News Hacker | 极客洞察

🎯 讨论背景

这篇帖子讨论的是一篇声称 Qwen3.7-Max 在未知硬件上连续跑了 35 小时、通过 432 轮“写代码—编译—运行—看 profile—再修改”的闭环,把某个 attention 相关 kernel 的吞吐提升到 10× 的文章。评论里提到的 perf(Linux 性能分析工具)、disassembly(反汇编)和 SIMD(单指令多数据并行指令集)都是做底层性能调优时常见的工具和手段。争议核心是横向比较是否公平:GLM 5.1、Kimi K2.6、DeepSeek V4 Pro 等模型在同类任务上的倍率更低,但部分模型因为连续 5 轮没有 tool calls 就提前停止,而 Qwen3.7-Max 没停。讨论也顺带把这种反复生成候选 kernel、测试并择优的流程,类比成 genetic algorithm(遗传算法)或更广义的 agentic coding。

📌 讨论焦点

质疑文章与作者真实性

不少人直接怀疑这篇文章本身就是 LLM 写的,或者至少经过了很重的 AI 润色。理由包括作者在 X 上的英文水平看起来比较基础,以及全文措辞像生成式营销稿。还有人提到原始来源似乎之前已经在 HN 出现过,进一步削弱了“新鲜发现”的可信度。

[来源1] [来源2] [来源3]

LLM 辅助底层优化的实际价值

也有人分享了自己用 LLM 做低层优化的正面经历。一个例子里,模型先完成架构重构,再把热点收敛到数学 kernel,并通过 branching、cache、vectorization、反汇编和 perf 计数器不断迭代,效果明显。另一个例子描述了 35 小时、432 轮 kernel evaluation 的闭环:写代码、编译、运行、看 profile,再改写 kernel 架构,说明这类工具在局部性能调优上确实可能比人工更快。

[来源1] [来源2]

担心结果更难维护

怀疑者并不一定否认速度提升,但担心最终产物会变得臃肿、难维护。有人直言 AI 修问题时经常是“多加代码”,短期 throughput 上去了,长期却可能埋下技术债。也有反驳说人类其实也常这么做,说明争论焦点不只是 AI,而是这种性能优化路径本身是否会把代码推向更复杂的形态。

[来源1] [来源2] [来源3]

基准比较是否公平、是否被任务规则放大

另一条主线是质疑 benchmark 的比较方式。评论指出 GLM 5.1、Kimi K2.6、DeepSeek V4 Pro 都在同一任务上跑出了不同倍率,但前几者是因为连续 5 轮没有 tool calls 就提前停止,而 Qwen3.7-Max 没有停,因此“10× 对 7.3×/5×/3.3×”未必是同一标准下的结果。还有人补充说,大家优化的其实是同一个 Extend Attention operator(attention 相关算子)在 triton 里的实现,但如果只挑一个狭窄算子、再加上停止规则差异,就很容易把分数做大。

[来源1] [来源2] [来源3]

像遗传算法式搜索,而非神奇智能

有人把这种“反复生成 kernel 变体、测试、择优”的过程类比为 genetic algorithm(遗传算法)和其他 non-differentiable optimization(不可导优化)方法。支持这种类比的人认为,本质上都是在大空间里做启发式搜索,而不是靠一次性写出完美代码。也有人反驳说,LLM 不是随机变异器,它会根据 profile、disassembly 和运行反馈做更有针对性的选择,因此比传统遗传算法更像被指导的搜索。

[来源1] [来源2] [来源3] [来源4] [来源5]

对 native agents 和 open weights 的乐观

还有少数评论把这类结果看成 native agents(原生能调用工具的模型)路线的信号,认为真正强的会是能自己做规划、编译、运行和回看的模型。有人顺手拿 Anthropic 的 Claude 开玩笑,暗示现在“模型写代码”已经不是离谱设想。另一句“open weights 会 show the real deal”则表达出一种期待:开放权重模型最后会在这种 agentic workflow 里证明自己。

[来源1] [来源2]

📚 术语解释

kernel: 在高性能计算/编译器语境里,被反复调优的核心代码块,常是性能瓶颈所在。

genetic algorithm: 通过变异、选择和迭代搜索解空间的优化方法,常用于不可导问题。