惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
G
Google Developers Blog
H
Help Net Security
月光博客
月光博客
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog RSS Feed
爱范儿
爱范儿
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
大猫的无限游戏
大猫的无限游戏
人人都是产品经理
人人都是产品经理
GbyAI
GbyAI
D
Docker
Hugging Face - Blog
Hugging Face - Blog
I
InfoQ
博客园 - 司徒正美
Last Week in AI
Last Week in AI
Microsoft Security Blog
Microsoft Security Blog
美团技术团队
Stack Overflow Blog
Stack Overflow Blog
M
MIT News - Artificial intelligence

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
Ultra-Goal: 解放注意力,一句话让 Agent 跑完超长程任务的 S...
Azure99 · 2026-06-09 · via V2EX

仓库:https://github.com/Azure99/ultra-goal

superpowers/gsd 这类由 sdd 驱动的工具做严肃需求很好用。但是,如果要做一些超长程/需要调研再实施的任务,还是有一些痛点的:

  • 决策阶段的注意力依旧没办法解放,因为你要定一个又一个的偏好,即使它本身有最佳实践。如果你的脑子里没有太多想法,只是想搓个原型看看什么样,agent 给你罗列的方案只会造成信息过载。
  • 在真正实施之前往往很难想清所有细节,特别是长任务,如果 spec/plan 实施到一半,才发现设计有缺陷,非常容易越做越偏,甚至需要推倒重来。大规模一些的重构,或者是需要调研再实施的任务,非常容易出现这种情况。

从 ultra goal 的名字就能看出,它是以目标驱动的,只需要给定一个清晰的目标,但不需要具体实现细节,agent 会在执行时动态调整。(核心提示词只有 1000 tokens 出头,比 readme 都少)

接收到用户目标后,会先在工作环境中探索,然后动态拆解出按阶段划分的 roadmap 。

每执行一个阶段,都有规划、实施、验收、提交四个步骤。主 agent 只做协调,避免频繁的上下文压缩,子 agent 推进工作,并把工作文档落盘。

  • 规划:协调两个子 agent ,先独立的设计实施方案,再由主 agent 交叉复审定 plan(这是最核心的,如果只让一个 agent 来定方案,非常容易有疏漏,superpowers 这类工具会不断的让你定决策。然而,如果让两个子 agent 各出一版再交给主 agent 仲裁,大部分决策其实完全不需要人参与)
  • 实施:没什么特别的,就是一个子 agent 照着 plan 去改代码、自测。
  • 验收:同样会开多个子 agent ,分不同视角 review ,然后交叉看各自的报告,主 agent 定级、去重,如果有必修问题就会打回重改。

每做完一个阶段,主 agent 都会根据当前状态,看看是否要修改 roadmap ,比如发现某个方案实际是不可实施的,就可以调整,一切以达成目标为主。


当然,它的缺点一样很大,执行时间长,会巨烧 token ,如果你的目标定的大,一次跑两天都是有可能的(烧掉你十几亿 tokens )。最好在 codex 中使用 gpt 5.5 xhigh 当主 agent ,不差钱子 agent 就继续用 5.5 ,差钱子 agent 就用 5.4mini xhigh 。但主 agent 不能差,实测下来超长程的任务,claude 系还是稍微差点意思,国产模型差距会更大。

最适合的场景就是搓原型/调研+实现,以及做可行性验证。--yolo 跑上就可以去睡觉了,小修小补没必要用,严肃线上需求还是要谨慎放手(当然也可以先做一版、确保跑通 人再仔细 review )。

直接安装

npx skills add Azure99/ultra-goal

SKILL 需要手动触发(为了防止模型自己抽风调用)。描述目标时,不需要描述具体的实现细节,但要仅你最大所能提供端到端的验收方式,比如做 Web 应用,就给它 playwright-cli ,让它跑交互/视觉验收,而不是只跑单测。