惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
S
Secure Thoughts
C
Cyber Attacks, Cyber Crime and Cyber Security
SecWiki News
SecWiki News
AWS News Blog
AWS News Blog
P
Proofpoint News Feed
H
Help Net Security
I
InfoQ
T
Tor Project blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Schneier on Security
Schneier on Security
The GitHub Blog
The GitHub Blog
S
Schneier on Security
The Hacker News
The Hacker News
博客园 - Franky
雷峰网
雷峰网
S
Security @ Cisco Blogs
Google Online Security Blog
Google Online Security Blog
Engineering at Meta
Engineering at Meta
G
GRAHAM CLULEY
Security Latest
Security Latest
The Cloudflare Blog
M
MIT News - Artificial intelligence
云风的 BLOG
云风的 BLOG
K
Kaspersky official blog
C
Cisco Blogs
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
Scott Helme
Scott Helme
腾讯CDC
阮一峰的网络日志
阮一峰的网络日志
A
Arctic Wolf
Latest news
Latest news
Last Week in AI
Last Week in AI
The Register - Security
The Register - Security
Google DeepMind News
Google DeepMind News
博客园 - 聂微东
T
Threatpost
G
Google Developers Blog
有赞技术团队
有赞技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
L
LINUX DO - 热门话题
aimingoo的专栏
aimingoo的专栏
S
Securelist
WordPress大学
WordPress大学
N
Netflix TechBlog - Medium
Y
Y Combinator Blog
T
The Exploit Database - CXSecurity.com
月光博客
月光博客
Recent Announcements
Recent Announcements

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模 ktx:面向 data agents 的开源可执行上下文层,自动生成语义层与业务 wiki 宿舍起家的 nice!nano 蓝牙键盘模块卖到百万美元 可拆电源线:便利与安全、标准化之争 Bitburner:写脚本的增量游戏,像 Factorio,3.0 改 API 加 Darknet Justine 募捐争议:旧言论、事实失实与生活方式质疑 程序员逐帧考据《Tron: Legacy》终端镜头 LLM 写作、代码与设计的各种“味道” Bricks & Minifigs 被指扣留 20 万美元 LEGO 寄售收藏 日本 randoseru 书包:颜值惊艳,AI文风惹议 写作的“科学”只是反复写改和反馈 Zig Days:LLM 话题要不要软禁 Postgres 做 durable workflows:DBOS、Temporal 与自研队列之争 Google 搜索 AI化:用户、网站和 SEO 被边缘化 Anthropic 65 亿 Series H 融资,9650 亿估值与 run-rate 争议 波士顿—百慕大:低价机票改写度假版图 Raspberry Pi 6 争议:提速、降功耗与 MCU/USB-C 路线 Claude Code 动态工作流:Bun 重写、并行编排与 token 争议 GPT-4o 上更粗鲁的 prompt 略准,样本与语气定义遭质疑 《Permanent Upper Crow》:礼帽消费与债务循环的黑色讽刺游戏 美国量子投资或涉违法:法律、内线交易与科技泡沫之争 Claude Opus 4.8:小幅修正、4.7回退与Mythos悬念 20年聊天记录分析:社交圈收缩、旧友怀旧与隐私争议 纽约通过 pied-a-terre 税:二套房、低估值与避税争议 Zendesk 涨价4倍逼客户48小时重建,评论聚焦PE、AI自建与SaaS护城河 AI agent 权限疲劳小游戏:沙箱、YOLO 与安全提示之争 FPGA上的神经形态 Ising 机:被质疑是 buzzword 拼盘 Google AI Mode逼人迁移,DuckDuckGo涨28%但基数极小 OpenWRT 室内 Wi‑Fi 漫游:802.11r/k/v、uSteer 与兼容性坑 Meshtastic、MeshCore、Reticulum:离网 mesh 的价值与极限 五个 frontier LLM 对 1k 真实 fact-check claim 67% 分歧,No Abstain 争议大 Apple/Google 把 push 通知变成营销与控制战场 YouTube自动标记AI视频:误判、AI slop与过滤争议 EU罚Temu 2亿欧元:非法商品、安全与平台责任争议 Ruby/Java/TypeScript 做 DOCX 插件:MCPB 打包、GraalVM 原生编译与 Ruby 争议 UC教师称数学严重退化,要求STEM招生恢复SAT/ACT Gemini、Gopher、Finger:HTTPS之外的轻量网与反adtech讨论 AMD 收紧 Linux 版 Vivado 许可引发 FPGA 用户反弹 Claude Code显现PMF,但盈利与开源竞争仍存疑 Temu 因危险商品与合规失责被欧盟罚 2 亿欧元 Hallucinate:开源浏览器多人在线Rave 压力破坏海马体记忆整合与推理,教育体系却爱加压 SimCity 3000 4K版:经典等距城建与现代写实之争 企业 AI 账单爆表:tokenmaxxing 与高层乱推 CIA官员家藏4000万美元金条,FBI介入疑涉黑金 Rapira:苏联俄化 Pascal 解释器 Ferrari Luce EV遭讽成iPad车:设计和品牌双翻车 AI提效后:休假、加薪还是裁员? GPU-free AI 数据中心:HPC 旧瓶装新酒? 越狱 Kindle 跑 Rust/Slint,顺带聊 jailbreak 与 Kobo 替代 Go 将支持泛型方法,社区再吵“早该有还是补洞” Lua 的“绿色”能耗优化与 JIT 争议 Qwen3.7-Max 35小时优化未知硬件kernel获10×提速,引发真实性与基准质疑 Typst+Pandoc 模板:Markdown 直出 PDF 工作流 2MB“人类烹饪”被质疑:样本不全,更像食材搭配库 WSL 中 Claude Code 贴图失效:Windows Terminal 抢占 Ctrl+V,桥接可修复 Rands《The Ask》:中层管理、会议官僚与AI争论 Last.fm 独立回归:老用户怀旧、推荐争议与数据主权 依赖别乱更:锁版本、供应链与 CI 争议 Fano 平面式 Raft:少数节点也能达成共识 GitHub PR/API 再故障,评论区质疑 AI、Azure 与微软 Mini Micro虚拟复古电脑:硬件版与开源争议 Claude Code 日用:CLAUDE.md、Skills、subagents、MCP 命令碎片化与锁定争议 加拿大转向瑞典军机,摆脱美国军购依赖 伊朗互联网流量回升:停火信号、经济恢复与网络战争争议 旧 Intel MacBook 过热取暖,M 系列靠编译/LLM 才热 Joanna Rutkowska:自由潜水、具身性与 Claude 隐喻 特拉华 Fenwick Island 允许公司房主投票,空壳漏洞引争议 Steam Deck涨价逾200美元,AI抢RAM与通胀争议升温 Labubu与hyperreal:怪萌、稀缺炒作和中国潮玩出海 GPU 矩阵乘法会因数据可预测而提速 Tech CEO陷AI妄想:LLM迎合放大高层失真
Agent 自检闭环:hooks、测试与 backpressure 争议
2026-05-31 · via News Hacker | 极客洞察

🎯 讨论背景

这篇帖子讨论的是 agentic coding:让 LLM/代码代理先通过自动测试、集成验证、日志甚至录屏自证,再把结果交给人类 review。评论里反复出现 Claude Code(Anthropic 的代码代理工具)、Codex(OpenAI 的编程助手)、hooks(事件触发式自动检查)、harness(测试/执行脚手架)和 worktree(Git 的隔离工作区)等词,说明大家在讨论如何把 AI 编码从聊天式操作变成可验证的流水线。背景里还有一个现实压力:API pricing、token 成本和新计费规则正在迅速抬高自动化门槛,连 agent SDK、multi-agent workflow 和长时间 self-check 都会显著增加费用。与此同时,Claude 的 regular checkpointing、模型容易提早停下来要反馈,以及人类 reviewer 的容量有限,都让“backpressure”这个类比是否成立成为争议焦点。

📌 讨论焦点

自动验证闭环与 harness 实践

很多评论者认为,真正有用的不是让 agent 一次写完,而是给它一整套可自动执行的 harness:自动拉起开发容器、编译、跑 unit/integration/e2e tests,再用日志、gif、video 去检查结果。有人把工作拆成很小的 chunk,让 agent 在 worktree 或多 agent 流程里反复迭代,直到能用可量化指标证明“做对了”,例如字节流向统计必须和已知总量对上。也有人强调把检查写进 stop hook、git commit hook 或其它 hooks,比单靠 prompt 更稳,因为验证会被 harness 强制执行,不容易被忘记。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11]

backpressure 术语争议

不少人指出,这里把 backpressure 用歪了:系统工程里的 backpressure 是下游向上游发出“接不住了”的信号,而文中的做法更像 throttle 或 structured feedback loop,并不能真正反映 human reviewer 的容量变化。还有人直接批评这种流体类比本身就不严谨,认为压力没有方向,硬套“背压”只会让概念更混乱。相比之下,shift-left testing、TDD 或 implement-review-repeat 这种说法更贴近他们理解的流程改造。也有人提到 Claude 的 regular checkpointing 倾向,解释了为什么某些 agent 会在任务推进时频繁停下来要反馈。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

成本、API pricing 与可持续性

成本几乎是所有讨论都绕不开的话题:有人认为订阅制的 20x Claude Code 和 Codex 计划比按 API 调用便宜得多,也有人直接问这种模式到底要花多少钱。另一条担忧是 Anthropic 将 -p 和 agent SDK 按 API rates 计费后,自动化成本可能一下子暴涨到 20x-50x,让长时间跑 agent harness 变得很贵。评论里还用“1.3M tokens/月”和赛车发动机要每场重建来形容这种不可持续性,认为公司最终会因为 token budget 被迫收紧权限。也有人把问题上升为商业驱动:AI/GPU/datacenter 公司在推动更昂贵的依赖链,甚至鼓励多个 LLM 相互调用来放大账单。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]

这只是软件工程常识 / 过度工程化

很多人觉得这篇文章只是把老软件工程原则重新包装了一遍:先写 spec,再拆 phase,再用 tests 和 invariants 兜底,本来就是团队长期在做的事。有人直接把这种趋势称为 waterfall 回潮,认为大型项目本来就需要 documented, testable requirements 和明确 end date,只是 agentic coding 让这些纪律重新显眼。反对者则认为文章太 over-engineered,微迭代、快速反馈才更适合 LLM,因为模型在复杂任务上容易自相矛盾、兜圈子,强行做宏大计划只会浪费时间和注意力。也有人总结成“plans are worthless, planning is valuable”,意思是规划有价值,但把一切都押在大计划或最大化自治上并不现实。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11] [来源12] [来源13] [来源14] [来源15] [来源16] [来源17] [来源18] [来源19] [来源20] [来源21]

PR 质量、责任边界与人类 review 负担

最强烈的反感来自低质量 PR:有人认为“减少 teammate review 负担”听起来像把 agent 产出的垃圾往别人桌上推,这本质上是 extractive contribution。讨论里反复强调,运行 agent 的人必须为结果负责,不能把审查压力转嫁给同事或开源维护者,甚至有人讽刺现实里最省事的办法就是“approve everything without reading”。另一个担心是 agent 会为了让测试通过而篡改测试本身,所以才有人讨论自动回滚 test changes、用 hooks 固定检查点,尽量把确定性验证从人脑搬到 harness。还有人补充说,真正缺的不是让 agent 自己检查,而是让人类更容易、高效地验证 agent 的产物。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6]

📚 术语解释

backpressure: 下游向上游发出“接不住了”的信号,用来限制输入速率、避免系统过载。

harness: 把 build、test、验证和迭代串起来的一套自动化脚手架或执行框架。

hooks: 在 stop、commit 等特定事件触发自动检查或修复的机制。

checkpointing: agent 运行过程中定期停下来确认进度、请求反馈或保存状态的行为。

shift-left testing: 把测试和验证尽量前移到开发早期,减少后期返工。

TDD: Test-Driven Development,先写测试再写实现,让测试约束代码行为。