惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

F
Fortinet All Blogs
爱范儿
爱范儿
P
Proofpoint News Feed
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
T
Tailwind CSS Blog
J
Java Code Geeks
宝玉的分享
宝玉的分享
Jina AI
Jina AI
B
Blog
N
Netflix TechBlog - Medium
Recent Announcements
Recent Announcements
aimingoo的专栏
aimingoo的专栏
腾讯CDC
C
Check Point Blog
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - Franky
罗磊的独立博客
B
Blog RSS Feed
WordPress大学
WordPress大学
小众软件
小众软件
博客园 - 叶小钗
M
MIT News - Artificial intelligence
GbyAI
GbyAI

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解
把 Agent 效果从 “感觉” 变成 “可验证”
AaronLin · 2026-06-16 · via 博客园_首页

TLDR:用 A/B 盲测和独立评估,让约束迭代可验证

问题

约束迭代最大的问题,是写了不代表有效。很多时候我们只是觉得 Agent 变好了,但缺少稳定的验证方法

做法

我的流程分为四步:

  1. 修改约束文档,形成改后版本

  2. 按官方最佳实践 review,先排除明显不合理的写法

  3. 派 Subagent 做 A/B 对照测试,比较改前和改后的效果

  4. 再由 review 汇总结果,评估这次约束改动是否真的有效

对照方式

  1. 准备同一份需求设计,分别交给使用改前约束和改后约束的两个 Subagent,两者都不参考实际代码,只根据需求盲写解决方案
  2. 盲写完成后,派独立 Evaluator 进行盲评。Evaluator 可以参考实际代码,但不知道 A/B 分别对应哪版约束
  3. 由主 Agent 汇总评估结果,对比两组方案表现,判断约束改进是否有效

注意点

Claude Code 在同一个会话中修改 CLAUDE.md 后,本次会话派发的 Subagent 看不到最新改动。它读取的是主会话启动时的 CLAUDE.md 快照

一个真实案例

Subagent 同时评测同一份需求设计时,改后版本的 Token 使用量下降,优化占比约 11.7%

⏺ 2 agents finished (ctrl+o to expand)
├ 盲写 writer 改后臂 · 15 tool uses · 135.8k tokens
│ ⎿ Done
└ 盲写 writer 改前臂 · 18 tool uses · 153.8k tokens
⎿ Done

发现

A/B 测试还发现了一个有意思的现象:如果在 CLAUDE.md 中定义约束文档本身的规则,比如“读代码就能搞清的东西不写”,Agent 会将这类规则泛化到代码注释中。原本容易出现的重复描述会减少,注释会更关注代码意图、设计原因和关键约束,从而提升整体注释质量