惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
G
Google Developers Blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 【当耐特】
S
SegmentFault 最新的问题
宝玉的分享
宝玉的分享
博客园 - Franky
博客园_首页
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
WordPress大学
WordPress大学
有赞技术团队
有赞技术团队
月光博客
月光博客
博客园 - 聂微东
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
小众软件
小众软件
Microsoft Security Blog
Microsoft Security Blog
Last Week in AI
Last Week in AI
Vercel News
Vercel News
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
爱范儿
爱范儿
J
Java Code Geeks
博客园 - 叶小钗
Engineering at Meta
Engineering at Meta
阮一峰的网络日志
阮一峰的网络日志

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
分析了 347 条 AI Agent 执行轨迹后,我们给 Agent 做了个"基...
dengsidi4ai · 2026-04-06 · via V2EX

最近在做 DunCrew (一个本地运行的 AI Agent 系统)的时候,积攒了 347 条真实的任务执行记录。本来想看看 Token 成本怎么优化,结果挖出来一些有意思的东西,顺手写了篇论文发了 arXiv 。核心思路: 类比 DNA 测序。把 Agent 每一步操作编码成四种"碱基"——X (探索:读文件、搜索)、E (执行:写文件、跑命令)、P (规划:思考、反思)、V (验证:检查结果)。一个任务就变成一条碱基序列,比如 X-X-P-E-E-V-E ,然后用 n-gram 、马尔可夫转移矩阵这些经典方法去分析。几个硬数据:
P-X-P 振荡是唯一显著的高危三元组:规划→探索→又规划,命中这个模式的任务成功率下降 10.4%。Agent 在"想做什么"和"去看看情况"之间反复横跳,就是不动手。
E→V 转移概率只有 2.1%:Agent 执行完操作后几乎不验证结果。写完文件不检查、跑完命令不看输出,这是系统性缺陷。
P-ratio 是最强的失败预测因子( r=-0.256, p<0.0001 ):一条序列里"规划"占比越高,任务越可能失败。Agent 过度思考约等于原地踏步。
然后我们做了个东西叫 Governor:基于上面的发现做了一个序列级的"熔断器",不调用 LLM 、零额外成本,纯粹看碱基模式来干预。比如检测到连续探索就强制刹车,检测到执行后没验证就注入提示。部署前后对比( 101 条 vs 246 条):
成功率:88.1% → 94.3%(+6.2%)
平均 Token 消耗:275K → 154K (-44%)
触发了规则的任务成功率反而最高( 96.4%),说明干预是正向的
跨系统验证:为了排除"只在自己系统上有效"的疑虑,我们拿了 2000 条 SWE-agent 在 SWE-bench 上的公开轨迹,用同样的 XEPV 编码分析。结果:探索螺旋和 E→V 验证缺失这两个核心模式在 SWE-agent 上也复现了。
论文和分析工具都会开源:
论文:arXiv (链接待补充)
工具包:github.com/FatBy/base-sequence-toolkit
官网:duncrew.com
做 Agent 的兄弟们有没有遇到过类似的问题?特别是 Agent 在死循环里烧 Token 的情况,有什么好的处理策略?