惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Last Week in AI
Last Week in AI
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
爱范儿
爱范儿
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 叶小钗
博客园_首页
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
V
V2EX
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Apple Machine Learning Research
Apple Machine Learning Research
美团技术团队

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
把 Agent 效果从 “感觉” 变成 “可验证”
AaronLin · 2026-06-16 · via 博客园_首页

TLDR:用 A/B 盲测和独立评估,让约束迭代可验证

问题

约束迭代最大的问题,是写了不代表有效。很多时候我们只是觉得 Agent 变好了,但缺少稳定的验证方法

做法

我的流程分为四步:

  1. 修改约束文档,形成改后版本

  2. 按官方最佳实践 review,先排除明显不合理的写法

  3. 派 Subagent 做 A/B 对照测试,比较改前和改后的效果

  4. 再由 review 汇总结果,评估这次约束改动是否真的有效

对照方式

  1. 准备同一份需求设计,分别交给使用改前约束和改后约束的两个 Subagent,两者都不参考实际代码,只根据需求盲写解决方案
  2. 盲写完成后,派独立 Evaluator 进行盲评。Evaluator 可以参考实际代码,但不知道 A/B 分别对应哪版约束
  3. 由主 Agent 汇总评估结果,对比两组方案表现,判断约束改进是否有效

注意点

Claude Code 在同一个会话中修改 CLAUDE.md 后,本次会话派发的 Subagent 看不到最新改动。它读取的是主会话启动时的 CLAUDE.md 快照

一个真实案例

Subagent 同时评测同一份需求设计时,改后版本的 Token 使用量下降,优化占比约 11.7%

⏺ 2 agents finished (ctrl+o to expand)
├ 盲写 writer 改后臂 · 15 tool uses · 135.8k tokens
│ ⎿ Done
└ 盲写 writer 改前臂 · 18 tool uses · 153.8k tokens
⎿ Done

发现

A/B 测试还发现了一个有意思的现象:如果在 CLAUDE.md 中定义约束文档本身的规则,比如“读代码就能搞清的东西不写”,Agent 会将这类规则泛化到代码注释中。原本容易出现的重复描述会减少,注释会更关注代码意图、设计原因和关键约束,从而提升整体注释质量