惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Last Week in AI
Last Week in AI
罗磊的独立博客
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 【当耐特】
T
Tailwind CSS Blog
美团技术团队
Y
Y Combinator Blog
I
InfoQ
C
Check Point Blog
Microsoft Security Blog
Microsoft Security Blog
G
Google Developers Blog
Google DeepMind News
Google DeepMind News
博客园 - Franky
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
G
GRAHAM CLULEY
爱范儿
爱范儿
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Google DeepMind News
Google DeepMind News
F
Fortinet All Blogs
A
Arctic Wolf
Hugging Face - Blog
Hugging Face - Blog
S
Security Affairs
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
小众软件
小众软件
云风的 BLOG
云风的 BLOG
酷 壳 – CoolShell
酷 壳 – CoolShell
Recent Announcements
Recent Announcements
H
Heimdal Security Blog
博客园 - 司徒正美
Latest news
Latest news
H
Hacker News: Front Page
H
Help Net Security
Know Your Adversary
Know Your Adversary
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
S
Secure Thoughts
AWS News Blog
AWS News Blog
V
Vulnerabilities – Threatpost
NISL@THU
NISL@THU
C
Cyber Attacks, Cyber Crime and Cyber Security
L
LangChain Blog
The GitHub Blog
The GitHub Blog
有赞技术团队
有赞技术团队
The Cloudflare Blog
I
Intezer
N
News and Events Feed by Topic

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux - V2EX [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 新电脑 brew install node 之后,一个小设置可以提升对供应链投毒的防御 - V2EX GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? - V2EX 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? - V2EX gemini cli 貌似挂了,一直返回 403 - V2EX 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 - V2EX 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 - V2EX 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 - V2EX 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 - V2EX 只有我一个人觉得 codex 不好用? 做了个 AI + 真人专家监督的广告投放平台 Auxora, 7 个品牌跑出 6x ROAS 如何走出至亲的离世 Claude Web 端貌似 claude-opus-4-7 偷偷上了? 现在 Apple 开发者帳號應該是用哪个地区会更好? - V2EX 用回测筛选因子的一点经验分享 给女儿 vibe 了一个故事类的 app,做完发现,这类应用似乎上线难度极大? - V2EX 手机格式化 bitget 钱包没了,里面开通的银行卡还有机会拿到吗 - V2EX [送码] TransVoice - 我的第一款 App 上架啦!实时转写+翻译+字幕,会议听课好助手! PictureHub 高清摄影作品的画廊 Planet 的第一个使用 macOS 26 SDK 构建的 Insider 版本 20260416-1 - V2EX 成都二手房是不是在涨价,有点坐不住了 - V2EX claude 生态(skill mcp plugin)等 Studio Display XDR VESA 适配器脱落 有在用印度区 applestore 的大哥嘛,请教一下礼品卡去哪里买呢 - V2EX 我好像知道京东家政爆火的原因了 - V2EX 薅了公司的 a 家 api key,用机场 ip 做代理容易被封吗 如何在初期就识别 HR 在刷 KPI,没打算招你? [分享]精心打造一个 AI 编程知识库(算法/设计模式/提示词/Skills),助力程序员转型 港版 iPhone 在国内支持联通 5GA 吗?在广东用 想办港卡 AI 对 it 行业影响太大了 我做了个把照片变成 iOS 小组件贴纸的 App ChatGPT Pro 5x 套餐 量真的很足! I have found a method to directly generate advertising video materials using scripts 在小城市开个店,给人写软件,有前途吗 chrome 最新的 147 版直接卡爆炸了 - V2EX 为什么厂家不在 skill/mcp 这类的工具中塞广告呢?这样不是可以大赚嘛? minimax 真是脸都不要了,工作日下午 14:00 定时开启 529,脸都不要了。训练模型居然占用用户使用时间 外资非核心部门 vs 另一家外资的核心部门,该跳吗? iTad 标签 扩展 加小动作 ? - V2EX 去年 H200 能买,不让买是代替快出来了? - V2EX AI 赛事通 - 2026 年 4 月中国区新增 AI 竞赛和黑客松汇总 - V2EX V2EX › 登录 现在安卓开发都在做啥 - V2EX 浏览器插件 沉浸式翻译 是不支持自定义模型了吗? - V2EX Codex 里的 GPT5.4 也能降智?上午让它改两个问题,改了一个小时了, plus 额度用了一半了还是没改好,和前几天用的体感完全不一样。要它改的问题也不复杂。服了。 目前有使用 claude code 的收到人脸认证的吗 - V2EX 分享一个自己做的 Nginx 管理工具,实时请求动态预览!(无奈市面上实在找不到好用的,自己撸了个) - V2EX claude code 崩了么? 今天在反重力上用 claude 一点都不丝滑,有同样的感受吗? opencode 消息周知插件 今天 claude opus 和前两天比,质的飞跃 - V2EX 999 包月价? - V2EX 一个版本, 50 项更新:我们几乎重做了整个播放页 本地大模型多大显存够用? GOGDNS 一款简易的私人 DNS 服务器 - V2EX API key (GLM) 怎么使用 claude code desktop ? Claude 这样订阅有问题吗 - V2EX 帮我爸找回了一篇赛博兰亭集序 求推荐稳定、高性价比使用 Claude Opus 4.6 的渠道/平台 搞个云端 claude code 防止 封号 - V2EX 用 Claude 要实名了,内地用户怎么办? OpenAI Plus 和 Team 都缩水了吗 海外 Android 手机有什么好用的国内第三方应用市场推荐吗 - V2EX 把电脑伪装成电视,用 DLNA 投屏拿到视频号直播流地址 - V2EX claude 认证莫慌 北京互联网法院有什么攻略么?起诉北京智谱华章科技股份有限公司退款可行么? - V2EX Claude 开始引入身份验证 求 vscode 做笔记软件的插件推荐 - V2EX 讯飞星辰的 Coding Plan 如何? Anthropic 宣布在 Claude 平台推行身份验证机制 科普一下低价 gpt 是怎么来的 有没有长期关注 Claude 的朋友,我建了一个 Channel 自动抓取 Claude Team 的推文 啃了那篇 54 页的 Agent Harness 综述, 给大伙讲个省流版 现在那家的 coding plan 还能买到 是不是最近会有什么更聪明的大模型要发布了呀? 用多了 AI 后,有没有觉得 AI 生成的文章有很强的既视感? 如何 实践 Harness 工程? 今日份 GPT 5.4 笑话 如何建一个自己的号池,让 cursor 真正实现 token 自由 写了三个月 Agent Harness,我终于敢让 Claude Code 全自动写代码了
从对齐到执行: grill-me + goal, AI 编码的完整工作流
JustW · 2026-05-21 · via V2EX

ChatGPT Image 2026 年 5 月 19 日 20_08_44

先想清楚,再放手让 agent 跑

上一篇文章聊了 Matt Pocock 的 grill-me skill——用三句话让 agent 像一个严格的 reviewer 一样,把你的方案逐个分支追问到底。它解决的是 AI 编码最核心的问题:对齐

但对齐只是第一步。你花了半小时被灵魂拷问、做完了决策、写好了 PRD ,然后呢?还是得一句一句地跟 agent 说"接下来做这个"、"继续"、"跑一下测试"、"再改改"。

这就像你跟一个新同事把需求讲得清清楚楚,然后每十分钟去他工位上说一句"干完了吗"。

最近 Codex 和 Claude Code 填上了这个缺口,请更新到最新版。 它们同时推出了 /goal 命令——你给 agent 一个明确的目标,它自己循环执行,直到完成或碰到需要你决策的阻塞点。

Grill-me 让你想清楚,/goal 让你放手。这两件事串起来,才是 AI 编码的完整工作流。

下面可以看到,我的一个任务跑了 50 多分钟,我的这些 CLI 都是运行在服务器上的,意味着以后我只需要每天设置好任务,就可以让 AI 24 小时帮我去干活了!

image-20260519200719752

一句话:**/goal 是一个持久化的执行目标,agent 会自主循环工作直到目标达成。**

以前的交互模式是:

你:帮我修复搜索功能的 bug
agent:找到问题了,是 XX 的原因,我改了 YY
你:跑一下测试
agent:测试通过了
你:再检查一下性能有没有退化
...

每一步都要你盯着、你推着。agent 做完一件事就停下来等你指示。

/goal 改变了这个模式:

/goal 修复搜索功能的 bug ,直到所有测试通过且性能不退化
agent:(自主循环:分析 → 修复 → 测试 → 验证 → 调优 → 再验证...)
agent:目标达成。改了 3 个文件,跑了 12 轮测试,最终延迟从 340ms 降到 89ms

它不是"让 agent 在后台跑"那么简单。它有完整的生命周期管理:

  • 状态机:pursuing → paused / achieved / unmet / budget-limited
  • 预算控制:token 预算耗尽时优雅退出,不会乱花钱
  • 证据审计:agent 不能自己说"搞定了"就搞定,必须基于实际的测试结果、代码变更等证据
  • 暂停/恢复/goal pause 暂停,/goal resume 继续,不丢失上下文

两个平台如何开启?

Codex 的 /goal

Codex CLI 0.128.0 首先推出了 /goal,背后是一个叫 "Ralph loop" 的模式——agent 在紧密的循环中工作,每次迭代读取当前状态、执行一个有界的动作、写下结果、退出,然后运行时检查是否继续。

启用方式(目前需要手动开启 feature flag ):

# ~/.codex/config.toml
[features]
goals = true

用法:

# 设定目标
/goal 修复 flaky 的 auth 测试,直到连续跑 10 次全部通过

# 管理生命周期
/goal          # 查看当前目标状态
/goal pause    # 暂停
/goal resume   # 恢复
/goal clear    # 清除

Codex 的实现有一个关键设计:completion 必须基于证据。agent 不能因为"我觉得差不多了"就标记完成。它必须对比目标和实际的文件变更、测试输出、benchmark 结果等具体证据,才能宣布达成。

Claude Code 的 /goal

Claude Code 2.1.139 紧随其后加入了 /goal,功能几乎对齐:

  • 交互模式:直接在 CLI 里用 /goal
  • -p 模式:脚本化调用,适合 CI/CD
  • Remote Control:远程会话中使用

Claude Code 的 /goal 还集成了 token 用量的实时显示——你可以看到 agent 跑了多少 token 、花了多长时间、进行了几轮迭代。如果发现 token 在烧但没进展,说明 agent 陷入了循环,该手动介入了。

怎么写一个好的 Goal

不是所有任务都适合 /goal。OpenAI 的官方指南给了一个清晰的判断标准:

适合 /goal 的:下一步取决于当前学到了什么的任务。比如 debug 、性能优化、依赖迁移、flaky test 调查——你不知道具体要跑几步,但你知道什么时候算完成。

不适合 /goal 的:一步就能搞定的事。改个变量名、加个注释、读一段代码——直接用普通 prompt 就行。

一个好的 Goal 应该包含六件事:

  1. 目标:什么状态算完成
  2. 验证方式:用什么证据来证明完成
  3. 约束:什么东西不能退化
  4. 边界:只能动哪些文件/工具
  5. 迭代策略:下一步怎么选
  6. 阻塞处理:卡住了怎么办

对比一下:

弱的 Goal:

/goal 修复搜索的 bug

( agent 不知道"修复"的定义是什么,不知道怎么验证,可能改了代码但没跑测试就宣布成功)

强的 Goal:

/goal 修复搜索功能中中文分词返回空结果的问题,验证标准是所有搜索相关测试通过且
中文搜索"机器学习"返回至少 3 条结果。只改搜索服务相关代码,不动其他模块。
如果改了核心分词逻辑,必须跑完整回归测试。如果卡在第三方库问题上,停止并报告
依赖版本信息。

( agent 知道什么算成功、怎么验证、不能动什么、卡住了怎么办)

串起来:从对齐到执行的完整流程

这是我觉得最有价值的部分。grill-me 和 /goal 不是两个独立的工具,它们是同一个工作流的两个阶段。

第一步:用 grill-me 想清楚

/grill-me 我想给搜索功能加上模糊匹配能力

agent 会开始追问:

  • 模糊匹配的容错级别是什么?一个字的错别字还是整个词?
  • 用什么算法? Levenshtein ? Jaccard ?还是 Elasticsearch 的 fuzzy query ?
  • 响应时间要求是多少?
  • 中文和英文的处理方式一样吗?
  • 是在现有搜索结果上加一层,还是作为独立的搜索模式?
  • 需要高亮匹配部分吗?

每个问题都给出推荐答案,你只需要确认或调整。跑完一遍之后,你对要做的事情有了清晰的、完整的认知。

第二步:用 /goal 自动执行

grill-me 跑完之后,你已经知道所有答案了。直接写 Goal:

/goal 给搜索功能加上模糊匹配能力。具体要求:
1. 使用 Levenshtein 距离算法,容错 1 个字符
2. 中英文分别处理,中文按字符匹配,英文按词匹配
3. 响应时间不超过 200ms
4. 在现有搜索结果上叠加模糊匹配结果
5. 高亮匹配部分
6. 验证标准:所有搜索相关测试通过,新增模糊匹配测试覆盖中英文各 5 个 case
7. 只改搜索服务模块,不动其他服务

然后就放手让 agent 跑。它会自己分析代码、设计方案、写代码、跑测试、修复问题、再测试,直到全部通过。

完整流程对比

以前:

  1. 想个大概的方案
  2. 直接让 agent 写
  3. 看到结果不对,告诉 agent 改
  4. 来回折腾 10 轮
  5. 最后勉强能用,但很多细节是妥协的结果

现在:

  1. grill-me 被追问 20 个问题,想清楚每个细节
  2. /goal 设定明确目标和验证标准
  3. agent 自己跑,你去做别的事
  4. 回来看结果,跑通了就收货

注意事项

token 消耗会更大。 /goal 的本质是让 agent 多跑很多轮,每轮都有 token 开销。特别是复杂任务,几百 K token 很正常。设好预算,盯着用量。

不是所有 agent 都适合自主循环。 如果你的项目很乱、测试覆盖很差、没有明确的验证手段,/goal 可能会跑偏。先把这些基础设施补上。

grill-me 的价值在于它强迫你精确。 很多人觉得"我大概知道要做什么"就够了,但 agent 需要的是精确的、无歧义的目标。grill-me 帮你把"大概"变成"确定"。

写在最后

2026 年的 AI 编码工具越来越像一个完整的工程系统,而不只是"帮我写代码"的自动化。grill-me 和 /goal 代表了两个方向:对齐的深度执行的自主性

把这两个指令组合起来,你得到的不是"更快的代码生成",而是一个真正能独立完成工程任务的 agent 。你负责决策,它负责执行。

这可能才是 AI 编码该有的样子。