



























"I actually think vibe coding is a slur. I always tell people I do agentic engineering, and then maybe after 3:00 AM, I switch to vibe coding, and then I have regrets on the next day."
其实我觉得 'Vibe Coding' 是个贬义词。我总是告诉别人我在做 'Agentic Engineering'。可能只有到了凌晨三点神志不清时,我才会切换到 Vibe Coding 模式——然后第二天醒来追悔莫及。
这是OpenClaw 的作者 Peter Steinberger 在 Lex Fridman 的播客里说过一段耐人寻味的话。
他将开发划分为两个世界:Agentic Engineering 是严谨、可靠、有规范的构建,而Vibe Coding 则是随兴所至、缺乏约束的狂欢。
一个新的趋势在发生,在代码实现变得前所未有容易的今天,工程能力和对设计优劣的判断力,反而成了更稀缺的资源。
这也是为什么作为一个非研发,我要拆解和理解OpenClaw的工程实现。
从25年开始,Agent逐渐占据了科技圈的舞台中央。Claude Code、Manus等产品接踵而至,有人说Agent将取代 App,重塑人机交互的范式。在这股浪潮中,OpenClaw凭借 72 小时 GitHub 涨星 6 万的战绩,成为了2026 年初最火的 AI 项目。
我最近在本地和云端彻底跑通了 OpenClaw,使用体验只有两个字:顺滑。
在这篇文章,我们从 OpenClaw 的架构中,理解通用的Agent设计,同时提炼出好 Agent 的设计答案。
Agent = AI + 工具 + 记忆。
这三者构成了它的本体:
我们可以把当下的 Agent 产品看作不同进化路径的尝试:
Manus代表了全托管的终极形态。给它一个模糊的目标,比如调研竞品,它会独自完成拆解、搜索、整理、撰写。它的哲学是端到端——用户发令,Manus交付。
Claude Code是嵌入式的编程伙伴。它不只给建议,而是直接潜入你的文件系统,理解结构,定位 Bug,并亲手修改代码。它的逻辑很直接,打破 AI 与本地环境的隔阂。
Cursor则选择了流式融合。它将 Agent 缝合在编辑器里,你选中代码,它即刻重构。它的目标是让你在心流中无缝调用 AI,而不是在窗口间反复横跳。
AutoGPT是先驱,也是烈士。作为 2023 年的爆款,它展示了自主循环的魅力,也暴露了早期 Agent 的问题——极易失控。它往往在子任务的泥潭里越陷越深,或者被一个死链卡住动弹不得。它证明了Demo 可以很炫,但落地全是深坑。
剥去外壳,几乎所有 Agent 都在遵循同一个心跳节奏:
观察 → 思考 → 行动 → 观察 → 循环。
比如我们让 Agent 整理桌面文件,它的实现流程是这样:
这个循环听起来只是一个简单的 while 循环。但问题来了:为什么大多数 Agent 跑着跑着就卡死了?答案藏在那些被视为繁文缛节的工程细节里。
OpenClaw 在通用设计之上,搭建了一套精密的脚手架。这些看似冗余的结构,恰恰是它稳定运行的基石。

当你向 OpenClaw 发送一条指令时,它的内部发生了一场精密的接力:
究竟什么是好的 Agent 设计?OpenClaw 给出了四个衡量标准。
为了提升效率,很多Agent痴迷于并发,但在 AI 的世界里,不可预测性是最大的敌人。并发会导致状态的疯狂打架,一边读文件,一边删文件,日志乱成一团乱麻。一旦出错,你甚至无法复现案发现场。OpenClaw 选择了Lane Queue。它强制串行,一个做完再做下一个。这种设计看似笨拙、复古,却保证了确定性。 在 AI 尚不可控的当下,确定性比速度更昂贵。
原则:稳定性 > 速度。宁可慢一点,也不要失控。
让 AI 理解网页,最笨的办法是截图。一张图几 MB,Token 消耗惊人,且 AI 极易被广告和弹窗带偏。 OpenClaw 采用了Semantic Snapshots(语义快照)。它不看皮囊,只看骨相——解析网页的无障碍树(Accessibility Tree)。这是浏览器为盲人准备的结构化数据,去掉了所有视觉装饰,只保留核心内容。结果是惊人的,文件体积缩小百倍,Token 成本骤降,且 AI 再也不会被网页上的花哨图片干扰。
原则:结构化 > 视觉还原。AI 不需要像人一样看,它需要像机器一样读。
Agent 的记忆是个两难选择。纯语义搜索(Vector Search)模糊而发散,容易把「登录问题」联想到「认证 Bug」。纯关键词搜索板而教条,错一个字就查无此人。OpenClaw 的解法是Hybrid Memory(双轨召回)。它同时运用向量搜索理解你的言外之意,利用 SQLite FTS5 捕捉你的精准词汇。这就像一个成熟的搜索引擎,既懂你的模糊描述,也能精准定位关键词。
原则:精准 > 覆盖。宁可少一点,也不要给 AI 灌输噪音。
让 Agent 接管电脑,风险堪比把家门钥匙交给陌生人。我们现在还能是不是看到一些Agent执行 rm -rf 误删整个项目目录的信息。OpenClaw 构建了多层防御:白名单放行 grep 等无害命令;沙箱隔离危险操作;确认机制则在敏感操作前强制请求人类许可。 这套机制的核心是克制,赋予 AI 能力,但必须把刹车握在手里。
原则:可控 > 自主。AI 可以跑得快,但必须能随时停下。
OpenClaw 拥有 40 万行代码,香港大学数据智能实验室用来复现openclaw核心逻辑的产品Nanobot 只有 4000 行。
直觉可能会问,这多出来的 39.6 万行,是不是一种过度工程?
理解了这个数量级的差异,就理解了什么是真正的「产品级 Agent」。
Nanobot 展示了 Agent 的原理——它告诉你,核心逻辑确实只是一个 while 循环。如果你想学习 Agent 怎么跑起来,看它就够了。但 OpenClaw 展示了 Agent 的工程——那些看似冗余的代码,处理的是进程管理、文件锁、快照恢复、权限控制。正是这些代码,决定了 Agent 是能稳定运行 24 小时的助手,还是跑两步就报错的玩具。
这 40 万行代码的重量,就是 Agent 的护城河。Peter Steinberger 把 Agent 当作操作系统来写,这是十几年 PDF SDK 开发经验留下的烙印。
当代码生成变得唾手可得,工程审美和设计判断才是一个产品经理真正的核心竞争力。你不必亲自写代码,但你必须懂得什么是好的代码。
好的 Agent 设计,不在于功能有多花哨,而在于有多“稳”。稳、省、准、安全——这四个词,就是这一代 AI 产品的工程标尺。
如果 Agent 真的进化到了如此稳定的地步,传统的 App 将何去何从? 下周,我们聊聊这个话题:App 的消融:孤岛、边界与流动的意图
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。