惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Cisco Talos Blog
Cisco Talos Blog
K
Kaspersky official blog
T
The Exploit Database - CXSecurity.com
NISL@THU
NISL@THU
AWS News Blog
AWS News Blog
V2EX - 技术
V2EX - 技术
Google DeepMind News
Google DeepMind News
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
S
Security @ Cisco Blogs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Recent Commits to openclaw:main
Recent Commits to openclaw:main
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
Attack and Defense Labs
Attack and Defense Labs
Jina AI
Jina AI
The Last Watchdog
The Last Watchdog
W
WeLiveSecurity
H
Help Net Security
V
Visual Studio Blog
宝玉的分享
宝玉的分享
C
Cybersecurity and Infrastructure Security Agency CISA
T
Threat Research - Cisco Blogs
IT之家
IT之家
Hugging Face - Blog
Hugging Face - Blog
Latest news
Latest news
T
Tor Project blog
I
Intezer
美团技术团队
GbyAI
GbyAI
T
Tailwind CSS Blog
Last Week in AI
Last Week in AI
博客园 - 三生石上(FineUI控件)
Google DeepMind News
Google DeepMind News
Scott Helme
Scott Helme
Y
Y Combinator Blog
博客园 - 司徒正美
T
Tenable Blog
O
OpenAI News
N
News and Events Feed by Topic
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
V
Vulnerabilities – Threatpost
P
Palo Alto Networks Blog
博客园 - 聂微东
酷 壳 – CoolShell
酷 壳 – CoolShell
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Threatpost
Google Online Security Blog
Google Online Security Blog
Apple Machine Learning Research
Apple Machine Learning Research
云风的 BLOG
云风的 BLOG
Help Net Security
Help Net Security

宝玉的分享

tsshd v0.1.9 已经发布,低延迟的 ssh - OSCHINA - 开源 × AI · 开发者生态社区 一文看懂ChatGPT、Codex、Work 的差别 从零开始玩转循环 (Getting started with loops) 为啥 Codex 还不推出类似 Codex Design 的产品? DeepSeek 的 10 万亿美元大战略 来自 Codex 官方团队的分享:如何把 Codex 用到极致 为什么我不“凭感觉编程” 创始人手册:打造 AI 原生初创公司 Forward Deployed Engineer:AI 时代的新宠岗位,到底干什么? AI 时代到底该怎么管一个工程团队 为什么资深开发者讲不清自己的专业能力 Codex 的野心,MCP 和 Skill 的下一步 裁员潮将持续,直到我们学会发掘 AI 的商业价值 机器人的终局:英伟达 Jim Fan 宣告 VLA 时代结束,WAM 登场 深度拆解:AI Agent Harness 的构造 使用 Claude Code:HTML 难以置信的奇效 Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 最新对话:Claude 为什么一直限速? Boris Cherny:Claude Code 之后,写代码正在变成“管理 Agent” 大多数公司根本没有为 AI 做好准备 Demis Hassabis:AGI 还缺什么,智能体到底行不行,下一个科学突破长什么样 深度拆解 Hermes Agent 的记忆系统:它如何修正 OpenClaw 的误区 Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering AI 的经济账根本算不通 为 Agent 设计产品 Cat Wu 面试了几百个 PM 候选人,几乎没人答对一个问题:AI 产品经理到底应该干什么? 两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制? 设计圈的 Claude Code 时刻来了 使用 Claude Code:会话管理与 100 万 上下文 Vibe Coding 是中年男人的钓鱼 为什么你的"AI 优先"战略可能大错特错? “多智能体协作指南:五种主流模式怎么选、怎么用?” 访谈|Codex 团队如何用自己的产品构建产品——整个 Spec 只有 10 个要点 Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对 编程智能体的核心组件【译】 Claude Code 源码泄漏了,但我不打算写源码分析分析文章 OpenAI 总裁 Greg Brockman:AI 自我改进、Super App 豪赌、通往 AGI 之路、算力扩张 Notion 联合创始人 Simon Last:我从去年夏天起就没写过一行代码了 飞书 CLI 开源了,为什么 AI Agent 时代,大家都在做命令行工具? 在中国 AI 生态圈摸底了两周,我学到了什么 AI 发展太快跟不上?一张四象限图帮你做减法 被美国遣返、禁止入境 5 年,他在温哥华的卧室里做出了日处理 400 万工作流的 AI 平台 构建 Claude Code 的经验:我们如何使用 Skills 智能体工程的 8 个等级 编程 Agent 如何重塑工程、产品和设计 当 AI 写了几乎所有代码,软件工程会怎样? 品牌时代 我用 AI 翻译的三个阶段:提示词时代 → 推理模型时代 → Agent 时代 多稿合并:从手动比稿到一键 Skill 陶哲轩最新演讲:AI 不是来抢数学家蛋糕的,是来把蛋糕做大的 设计流程已死:Anthropic 设计负责人 Jenny Wen 谈 AI 时代的设计变革 Greg Brockman(OpenAI 联合创始人)把“那场宫斗”讲完整了:董事会、请愿书、马斯克与控制权 被封杀当晚,OpenAI 拿到了相同条款——Amodei 首次专访揭开 Anthropic 与五角大楼冲突内幕 从写代码到管 Agent:斯坦福首门 AI 软件开发课的讲师说,大多数工程师还没准备好 Anthropic CEO Dario Amodei:海啸已在地平线上,但没人在看 驾驭工程:在「智能体优先」的世界里借力 Codex 92.6% 开发者每月使用 AI 编码助手,但每周节省时间只有 4 小时 同样的模型,为什么 Cursor 跑不过 Claude Code? Cursor 设计负责人:只会画按钮的设计师,有麻烦了 OpenAI Codex 产品负责人:代码不再由人类编写,但我们会有更多构建者(Builder) OpenAI 应用 CTO 和 Codex 负责人:AI 正在重塑构建软件的方式 Notion CEO:不能被 Agent 用的产品没有未来 提示词救不了平庸的 AI 写作 用 Claude Code 的 Hook + Skill,实现每次提交后自从 commit 提交变更 高中辍学生靠 ChatGPT 自学成才成了 OpenAI 的研究科学家 59% 用户投票选了更便宜的那个:Sonnet 4.6 全面解读 Jeff Dean 深度访谈:一页纸备忘录促成 Gemini 的诞生,Google AI 的反击与 10,000 Token 的未来 快不等于好:Anthropic 和 OpenAI 的快速模式藏着什么 别再用提示词去 AI 味了,方向就是错的 Anthropic CEO Dario Amodei 访谈:我们正在接近指数的终点 只有 30 个工程师的 X,是怎么重新杀回 App Store 第二的 马斯克说今年编程就要死了,你信吗? OpenAI 智能体工程指南:10 条实战技巧和 3 种构建模式 我们真的变成巫师了:OpenAI API 负责人谈 AI 如何重塑软件工程 xAI 全员大会实录:递归自我改进、5000 万视频/天、月球上的质量驱动器 PC 软件为手机重做了一遍,现在轮到 Agent 了 2026 编程巨变:Anthropic 报告揭示 Agent 编程八大趋势 既然 AI 越来越聪明,那么学习提示词不是浪费时间吗? 【访谈对话】造过 Codex 的人,为什么每天用 Claude Code 深度解析:Claude Code /insights 命令的运作机制 马斯克三小时访谈实录:36 个月后,太空是训练和运行 AI 最便宜的地方 Claude Code 团队的 10 个内部技巧,但你不一定都要学
Coding Agent 有个甜蜜点,多数人直接跳过了
宝玉 · 2026-02-25 · via 宝玉的分享

有两个 Vibe Coding 项目让我印象很深。

一个是 Simon Willison(Django 框架的联合创始人),他一边陪家人装饰圣诞树、看电影,一边用 Codex CLI + GPT-5.2,把 Emil Stenström 的 JustHTML(一个纯 Python 的 HTML 解析库)迁移成了纯 JS、零依赖的版本,跑过了 9200 多个 html5lib-tests 用例,产出大约 9000 行代码43 次提交。整个过程他自己只发了 8 条左右的提示词

《I ported JustHTML from Python to JavaScript with Codex CLI and GPT-5.2 in 4.5 hours》https://simonwillison.net/2025/Dec/15/porting-justhtml/

另一个是 Cloudflare,一个工程经理带着 AI,用不到一周时间,在 Vite 上重新实现了 Next.js 的 API,做出了 vinext 这个项目。1700 多个单元测试、380 个端到端测试、覆盖 Next.js 94% 的 API,已经有客户跑在生产环境了。总花费大约 1100 美元的 Token。

《How we rebuilt Next.js with AI in one week》https://blog.cloudflare.com/vinext/

两个 Coding Agent 成功项目对比

这两个项目的规模和复杂度都不低,但 Coding Agent 的完成质量出奇地好。为什么?

因为它们都精准命中了 Coding Agent 的舒适区——或者说甜蜜点。

有明确的参照物:让 Agent“翻译”而不是“创造”

大语言模型最擅长的事情之一是“翻译”,无论是自然语言还是编程语言。给它一个明确的参照物,它能做到又快又好。

Simon 的项目就是典型的翻译型任务。已经有一个写好的 Python 版 HTML 解析库,API 设计是现成的,代码逻辑是现成的,Agent 要做的就是把这些“翻译”成 JavaScript。不需要凭空设计架构,不需要做产品决策,照着画就行。

Cloudflare 的 vinext 项目看起来更复杂,但底层逻辑一样。Next.js 的 API 是公开的、文档极其完善,Stack Overflow 上积累了海量问答,这些内容早就进了大模型的训练数据。Cloudflare 团队不是让 AI 发明一个新框架,而是让它照着 Next.js 的规格说明书,在 Vite 上重新实现一遍。

第一个条件:给 Agent 一个明确的参照物。 不管是一个已有的开源项目、一份 API 文档、还是你之前写过的旧版本代码,都可以当参照物。让 Agent 做翻译而不是创造,成功率会高很多。

在你自己的工作中,动手之前先问一句:有没有现成的东西可以参考?一个开源实现、一段竞品代码、甚至一份伪代码,都能让 Agent 的表现跨一个台阶。

翻译 vs 创造:Agent 的两种工作模式

有自动化验证:让 Agent 能自己验证对不对

Coding Agent 和人类程序员一样,写完代码需要验证。区别在于:如果验证必须靠人工,效率就会断崖式下降;但如果 Agent 能自己跑测试、自己看结果、自己修 bug,它就能进入一个高速循环,不知疲倦地迭代下去。

Simon 的项目能成功,很大程度上因为 HTML5 标准有一套叫 html5lib-tests 的测试集,9200 多个用例,输入是 HTML,输出是正确的解析结构。Agent 不需要你告诉它哪里写错了,它跑一遍测试就知道。Simon 把 GitHub Actions 配好之后,Agent 就进入了这个循环,用了 140 多万个 Token,提交了 43 次,直到所有测试亮绿灯。

Simon 把这个过程叫做 “设计智能体闭环”(Designing the Agentic Loop),他认为这是释放 AI 编程潜力的关键技能。

Cloudflare 那边也一样。Next.js 仓库里有几千个端到端测试,团队直接把这些测试搬过来当验收标准。工作流程就是:定义任务,让 AI 写代码和测试,跑测试,过了就合并,没过就把报错扔回给 AI 让它改。几乎全自动的反馈闭环。

你可能会说:我的项目哪有这么完美的测试套件。确实,大多数项目没有。但你可以往这个方向靠:

  • 先写测试再让 Agent 写实现(测试驱动开发和 Agent 是天然搭配)
  • 配好 Lint 和类型检查
  • 给它接上浏览器开发工具让它能看到运行结果
  • 哪怕只是让 Agent 能自动跑一个 npm test,都比你自己肉眼审代码强得多

给 Agent 的自动验证工具越多,它能自我修复的能力就越强。

智能体闭环:自动化验证反馈循环

有架构蓝图:让 Agent”填空”而不是”作文”

Agent 受上下文窗口的限制,一次任务能处理的信息量是有上限的。你把一个复杂项目的整个代码库扔给它,它消化不了。你让它从头到尾一口气做完一个大功能,它做到后面就忘了前面。

所以架构设计特别重要。把大任务按架构拆成小任务,每个任务刚好在 Agent 的上下文窗口内能完成,这是高手和新手使用 Agent 最大的区别之一。

Simon 的做法很聪明。他的第一条提示词不是让 AI 写代码,而是让它读完 Python 项目后写一份 JavaScript 版本的设计文档spec.md)。这份文档包含了 API 设计、实现步骤和验收标准。然后他让 Agent 从最简单的冒烟测试开始,一步步按计划推进。架构是现成的(参照 Python 版),路线图也规划好了,Agent 只需要按部就班地“填空”。

Cloudflare 团队的做法更系统。工程经理先花了几个小时和 Claude 反复讨论架构方案,定好整体蓝图,然后按模块拆任务。每个任务的边界清晰,AI 写完一个模块就能独立测试,不用等整个项目做完才能验证。

你不需要是架构大师才能做这件事。哪怕是花 10 到 30 分钟和 AI 聊一下你打算怎么做,让它帮你列个实现计划,再按计划分步执行,效果都会好很多。先设计再实现,这个道理对人类程序员适用,对 Agent 同样适用,甚至更适用。

架构蓝图:让 Agent 填空而不是作文

有人把控方向:Agent 执行,人来决策

Cloudflare 的博客里有一句话:

给 AI 好的方向、好的上下文、好的护栏,它就能高产;但方向盘必须在人手里。

AI 有一个让人头疼的特点:它经常写出看起来完全正确、但实际行为不对的代码。语法没问题,逻辑看着也通顺,跑起来就是不对。识别这种“高置信度的错误”,目前还是需要人来做。

Simon 让 Agent“commit and push often”(频繁提交代码),这样他在手机上刷 GitHub 提交记录就能追踪进度。Cloudflare 团队把代码审查也交给了 AI Agent,但架构决策、优先级判断、识别 AI 走偏了,这些仍然由人来把控。

这两个项目的操作者都不是新手。Simon 是 Django 的联合创始人,Cloudflare 那位是工程经理。他们知道怎么把一个大问题拆成 AI 能消化的小问题,知道什么时候该介入,什么时候该放手。

你不需要是他们那样的高手,不需要盯着 Agent 写的每一行代码,但也需要在关键节点检查方向对不对。给 Agent 一个太大的任务然后自己走开,通常不会有好结果。小步快跑、阶段性验收,是目前最靠谱的协作方式。

Agent 执行,人来决策


这四个条件不是什么高深的理论,回头看都是常识:有参考、能自测、有规划、有人管。但正是因为它们太像常识,很多人在使用 Agent 时直接跳过了。

Cloudflare 团队自己说,几个月前这事还做不了,不完全是因为模型变强了多少,而是他们找到了正确的方法。

既然知道了 Coding Agent 的舒适区在哪,就可以有意识地把自己的项目往这个方向靠:

  • 先看看有没有参考项目/代码再动手。 别急着让 Agent 从零开始写。看看有没有类似的开源实现、有没有现成的 API 规范、有没有可以参考的代码库。给 Agent 一个参照物,比给它一段需求描述有效得多。
  • 给 Agent 配上自动验证的能力。 手动测试是 Agent 效率的最大瓶颈。尽量把验证环节自动化:单元测试、集成测试、Lint、类型检查,甚至浏览器自动化测试。让 Agent 能自己跑、自己看结果、自己改。Cloudflare 用了 agent-browser 来验证浏览器端的渲染和交互,这种思路很值得借鉴。
  • 先设计后实现。 在让 Agent 动手之前,先把架构想清楚、任务拆好。每个任务的范围要小到 Agent 的上下文窗口能装下,大到足够产出一个有意义的模块。这个拆分能力本身就是高手和新手的分水岭。
  • 建立反馈闭环。 Simon 的做法很典型:配好 CI,每次提交自动跑测试。Agent 写代码、提交、CI 报错、Agent 读日志、修复、再提交。人只需要在关键节点介入。这个闭环跑起来之后,Agent 的产出效率会远超你坐在那里一行行审代码。
  • 知道什么时候 Agent 不行。 不是所有项目都在舒适区里。没有明确规范的探索性项目、需要大量领域知识的业务逻辑、涉及复杂人际沟通的需求梳理,这些 Agent 做不好。识别边界和利用优势同样重要。