惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The Register - Security
The Register - Security
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
MyScale Blog
MyScale Blog
V
Visual Studio Blog
云风的 BLOG
云风的 BLOG
aimingoo的专栏
aimingoo的专栏
C
Check Point Blog
J
Java Code Geeks
大猫的无限游戏
大猫的无限游戏
L
LangChain Blog
Vercel News
Vercel News
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
Security @ Cisco Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
人人都是产品经理
人人都是产品经理
H
Hacker News: Front Page
L
Lohrmann on Cybersecurity
T
Troy Hunt's Blog
T
Threat Research - Cisco Blogs
A
About on SuperTechFans
T
Threatpost
AWS News Blog
AWS News Blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
T
Tor Project blog
Google Online Security Blog
Google Online Security Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
Tenable Blog
W
WeLiveSecurity
博客园 - 叶小钗
K
Kaspersky official blog
Y
Y Combinator Blog
T
The Blog of Author Tim Ferriss
Hugging Face - Blog
Hugging Face - Blog
M
MIT News - Artificial intelligence
Hacker News - Newest:
Hacker News - Newest: "LLM"
Engineering at Meta
Engineering at Meta
有赞技术团队
有赞技术团队
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
S
Secure Thoughts
小众软件
小众软件
D
Docker
爱范儿
爱范儿
C
Cyber Attacks, Cyber Crime and Cyber Security
N
News and Events Feed by Topic
S
Schneier on Security
博客园 - 三生石上(FineUI控件)
D
DataBreaches.Net

博客园 - iTech

7万星的AI交易框架:让大模型模拟投行多空辩论,自动做交易决策 71000颗星的AI交易团队:让大模型模拟投行分工,自动做交易决策 13400颗星的开源项目:输入一句话,AI全自动帮你做短视频 102颗星的沙盒:当AI学会自己写代码、跑测试、做部署 AI 技术日报 - 2026-05-08 29k 星的 PageIndex:不用向量数据库,靠推理就能做 RAG 每天花两小时刷信息?这个开源项目帮你全自动搞定 读源码像读小说?试了 DeepWiki 和 Zread,我再也不想裸读 GitHub 了 Matt Pocock 开源的这套 .claude 技能,为什么让工程师集体上头? Cursor Team Kit:Cursor 官方团队在用的 17 个 AI 工作流 AI 技术日报 - 2026-05-07 AI 技术日报 - 2026-05-06 AI 技术日报 - 2026-05-05 Anthropic CEO 说 12 个月内程序员要失业,我扒完他的底牌,发现事情没那么简单 把工程师的肌肉记忆装进 Claude Code,这个 4300 Star 的项目我后悔没早用 AI 技术日报 - 2026-05-04 AI 技术日报 - 2026-05-03 AI 技术日报 - 2026-05-02 六大 Agent 框架横评:谁支持 Skills?谁能自动创建 Agent?MCP 呢? Wechatsync:一个 Chrome 插件,一键把文章同步到 31 个平台 LangChain 开源了 Open SWE:Stripe、Ramp、Coinbase 内部都在造的编程 Agent Cockpit:把 Claude Code 从终端里搬出来,装进浏览器 Cursor 把自家的 AI Agent 开放了:写几行 TypeScript 就能调 Cursor 干活 AI 技术日报 - 2026-05-01 AI 写代码每次结果都不一样?Archon 用 YAML 工作流把 AI 编程变成流水线 AI 写代码比你快了,但你还是得学编程——只不过学法得换 腾讯的龙虾特工队:4 个 AI Agent 同日更新,全家桶正式成型 Agno 不做更聪明的 Agent,它要把所有 Agent 框架包进同一个操作系统 Hermes Agent 终于有了像样的 Web 界面,而且还支持远程访问 Datawhale 出了一套 29 学科知识地图,把 AI 的底牌全掀了 Hermes Agent 在聊天框里就能用的 20 种高级功能 一份 AGENTS.md 能顶一次模型升级?Augment Code 用数据说了算 NVIDIA 开源了一个「AI 沙箱」,20K Star,让 Agent 跑代码不再裸奔 60ms 冷启动、5MB 内存:腾讯开源的这个沙箱让 Docker 安全隔离像笑话 AI 技术日报 - 2026-04-30 AI 技术日报 - 2026-04-29 AI 技术日报 - 2026-04-28 Goose:Linux 基金会亲儿子,能撼动 Claude Code 和 OpenCode 吗? AI 技术日报 - 2026-04-27 AI 技术日报 - 2026-04-26 Google 把价值20美元/月的东西免费了,102K人已经抢到了 OpenClaw 和 Claude Code 网络搜索配置指南 AI 技术日报 - 2026-04-25 Anthropic 为什么遥遥领先:从 Cat Wu 专访看AI霸主的底层逻辑 Mac 本地跑大模型完全指南:你的苹果电脑就是 AI 工作站 同样 70B 参数,为什么 MoE 只激活 13B 就能打平 Dense? DeepSeek-V4 技术报告里藏着一条线:华为昇腾 NPU 已完成推理验证 DeepSeek-V4 深夜炸场:1M 上下文、384K 输出、双模型,API 定价直接卷到底 MacBook Air 跑大模型实测:Ollama、llama.cpp、LM Studio 谁才是本地推理之王? AI 技术日报 - 2026-04-24 OpenCode:Claude Code 的最佳平替 2026 开源大模型五国杀:Qwen 3.6 vs Gemma 4 vs Llama 4 vs GLM-5.1 vs DeepSeek V4 MCP 与 Skills 的你死我活:Anthropic 的 Agent 生态野心与开发者的站队困境 给 AI Agent 配搜索,国内能用的搜索 API 实测对比 AI 技术日报 - 2026-04-23 CC Switch:49K Star 的 Claude Code 登录绕过神器,还能管 Codex 和 Gemini CLI NVIDIA 开出 32 万美元年薪招 AI Agent 工程师,JD 里藏着这些信号 fast-mirror-skill 技术拆解:一个小而完整的 Claude Skill 是怎么设计的 Cursor 值 600 亿美元?马斯克这次赌的不是技术,是入口 AI 技术日报 - 2026-04-22 别再问 AI 能不能赚钱了:3 个上班族亲测有效的副业方法(2026 最新版) 10 分钟从零搞定 Hermes Agent:飞书微信双通道丝滑上线 AI 技术日报 - 2026-04-21 Anthropic 实战总结:AI Agent 的 3 种工作流模式,选错代价很大 安装 openclaw,hermes 慢的想发疯,fast-mirror-skill 来救了 Claude Routines:你下班睡觉了,Agent 还在为你干活 微信飞书里敲一个斜杠就能干活:Hermes Quick Command 到底多省事 AI 正在疯狂吃电:算力尽头是电力,谁能解这道题? AI 技术日报 - 2026-04-20 3K 行代码造一个越用越聪明的 AI Agent:GenericAgent 登顶 GitHub Trending 高德途途封神机器人半马,背后的 ABot-Claw 到底是什么 人们希望 AI 能干啥?Anthropic 调查:第一名不是赚钱,是变强 AI 时代人们在担心什么?Anthropic 的 13 条焦虑排行榜 OpenAI 官方 Agent SDK 来了:22k Star,支持 100+ 模型,Python 10 行代码上手 AI 技术日报 - 2026-04-19 OpenAgents Workspace:让 Claude Code 和 Codex 在同一个群里干活 Claude 是要干掉整个软件行业吗? Claude 官方推荐多 Agents 设计模式 多 Agent 系统的 5 种协调模式:选错了模式,再强的 Agent 也白搭 AI 技术日报 - 2026-04-18 AI 技术日报 - 2026-04-17 Better-Harness:让AI Agent自己优化自己的革命性框架 OpenClaw Workspace 完全指南:我的AI编程工作流 DeepSeek内蒙草原高薪招聘:AI时代的数字牧民梦,还是营销噱头? 2 核 2G 的阿里云 ECS 能跑 OpenClaw 吗?能,但有点折腾 AI 技术日报 - 2026-04-16 OpenCLI:一个命令行搞定 16+ 内容平台的神器 从零到精通:OpenClaw CLI 命令完全指南 AI 技术日报 - 2026-04-15 AI Agent 如何自我进化?Hermes Agent Self-Evolution 深度解析 AI 技术日报 - 2026-04-14 为什么你的飞书 Bot 总是连不上?OpenClaw Gateway 架构深度解析 OpenClaw 连接飞书的原理:Gateway、Channel 与消息流转 国内安装 Hermes Agent 踩坑全记录:从 GitHub 超时到正常跑起来的每一步 35 万 Star 的 OpenClaw:5 分钟部署你的私人 AI 助手,直连飞书 AI 技术日报 - 2026-04-13 公司用 AI 筛简历,这个开源项目让候选人用 AI 反选公司 为什么 Google ADK 可能是你下一个 Agent 框架——7 个改变游戏规则的特性 Microsoft Agent Framework 深度解析:架构设计与实战落地 AI 技术日报 - 2026-04-11
写好 AGENTS.md 相当于白嫖一次模型升级(写错了还不如不写)
iTech · 2026-05-12 · via 博客园 - iTech

写好 AGENTS.md 相当于白嫖一次模型升级(写错了还不如不写)

最近 Augment Code 团队发了一篇非常扎实的研究文章。他们从自己的 monorepo 中抽取了几十个 AGENTS.md 文件,用内部评测框架 AuggieBench 逐一测量对代码生成质量的影响。

结论很炸裂:最好的 AGENTS.md 让 Agent 输出质量的提升,相当于从 Haiku 升级到 Opus;最差的 AGENTS.md 反而让结果比没有任何文档更糟。

我读完之后觉得这些发现太实用了,不仅适用于 Augment Code 的 Agent,对 Claude Code、Cursor、Copilot 等所有 AI 编码工具都适用。下面把核心要点整理出来。

本文提纲

  1. 同一个文件,不同任务效果天差地别
  2. 7 个经过验证的有效模式
  3. 最大的坑:过度探索导致上下文腐烂
  4. Agent 到底怎么发现你的文档
  5. 实操:如何迁移现有文档

同一个文件,不同任务效果天差地别

研究中最让我意外的发现是:同一个 AGENTS.md 文件,在不同任务上的效果可以完全相反。

一个案例:某个 AGENTS.md 在修复常规 bug 时,让 best_practices 提升了 25%。但同一个文件在处理复杂 feature 任务时,completeness 下降了 30%。

原因很有意思。这个文件里有一个决策表,帮助 Agent 在两种数据获取方案之间做选择。修 bug 时这个表格很好用,Agent 直接选对了方案。但做 feature 时,Agent 被引导着读了参考文档,打开了十几个 markdown 文件试图验证自己的方案,结果创造了不必要的抽象层,方案反而做不完整。

教训:AGENTS.md 不是越全越好,不同内容块对不同任务有完全不同的影响。

7 个经过验证的有效模式

1. 渐进式披露 > 大而全

把 AGENTS.md 当成一个索引,控制在 100–150 行以内。常见的工作流和规则放在主文件里,详细内容放到被引用的参考文档中。

实测数据:100-150 行的 AGENTS.md + 几个聚焦的参考文档,在约 100 个核心文件的中型模块上,跨指标提升 10-15%。超过这个长度,收益开始反转。

2. 流程式工作流:从做不出来到一次做对

这是测量中效果最强的模式。把复杂任务描述成带编号的多步骤流程。

一个真实案例:6 步部署新集成的流程。Agent 按步骤执行,缺少接线文件的 PR 从 40% 降到 10%。Correctness 提升 25%,Completeness 提升 20%。

## 部署新集成的工作流

1.`integrations/` 目录创建新的配置文件
2.`lib/registry.ts` 注册新集成
3. 添加对应的单元测试到 `tests/integrations/`
4. 更新 `docs/supported-integrations.md`
5. 运行 `npm run validate-integrations` 确认无报错
6. 提交 PR,标题格式:`feat(integration): add <name>`

3. 决策表:在写代码之前消除歧义

当项目有两种以上合理方案时,决策表能强制 Agent 先做选择,再动手。这是最能提升代码规范遵守度的模式。

## 状态管理选择

| 问题 | React Query | Zustand |
|------|:-----------:|:-------:|
| 服务器是唯一数据源? | ✅ | |
| 多个代码路径会修改这个状态? | | ✅ |
| 需要乐观更新混合本地状态? | | ✅ |

用了决策表的 PR,best_practices 提升了 25%。

4. 真实代码示例提升代码复用

从生产代码中复制 3-10 行的片段作为模板。别太多,超过几个 Agent 会匹配到错误的模式。

// ✅ 好的示例:Redux Toolkit createSlice 模板
const counterSlice = createSlice({
  name: 'counter',
  initialState: { value: 0 } as CounterState,
  reducers: {
    increment: (state) => { state.value += 1; },
  },
});

实测:code_reuse 提升 20%。

5. 领域规则要具体可执行

# ✅ 好的规则(具体可执行)
所有金额计算使用 Decimal 类型,禁止使用 float。

# ❌ 差的规则(太泛)
注意数值精度问题。

具体且可执行的规则能提升 best_practices,但堆叠几十条就适得其反。

6. 每个「不要」都配一个「要」

只写「不要」的文档效果很差。Agent 会变得过度谨慎、过度探索。

# ❌ 只有禁止
不要直接实例化 HTTP 客户端。

# ✅ 禁止 + 替代方案
不要直接实例化 HTTP 客户端。使用 `lib/http` 中的共享 `apiClient`,
它自带重试中间件。

有 15+ 条连续「不要」但没有「要」的 AGENTS.md,会导致 Agent 过度探索、过于保守、产出更少。

7. 模块化代码配模块化文档

最佳效果的 AGENTS.md 都对应相对独立的子模块。约 100 个核心文件的中型模块 + 100-150 行的 AGENTS.md + 几个参考文档 = 10-15% 跨指标提升。

放在 repo 根目录的大一统 AGENTS.md,效果不如模块级别的。

最大的坑:过度探索导致上下文腐烂

这是研究中最常见的失败模式,本质是上下文腐烂

坑 1:架构描述太多

一个 AGENTS.md 包含了完整的服务拓扑:事件总线、消息队列、API 网关路由、共享中间件层……而任务只是改两行配置。Agent 读了 12 个文档文件,加载了约 80K token 无关上下文,搞不清哪个服务拥有这个配置,产出了不完整的修复。completeness 下降 25%。

修复方法:架构描述要简洁且隔离。模糊的组件职责描述会把 Agent 推入探索模式。突出边界,关注「是什么」而非「为什么」。

坑 2:警告太多

30+ 条「不要」规则覆盖数据库迁移、API 版本、部署安全、认证边界……而任务只是写个 CRUD 接口。Agent 逐条检查每条警告的相关性,探索了根本不需要碰的代码。PR 耗时翻倍,完整度下降 20%。

修复方法:核心陷阱放主文件,大部分移到参考文档。每条「不要」都配「要」。

坑 3:周围文档太多

一个模块有 37 个相关文档共 50 万字符。另一个有 226 个文档超过 2MB。即使删掉 AGENTS.md,Agent 行为几乎不变——因为它会自己找到并阅读周围那一堆文档。

如果你的 AGENTS.md 写得很好,但模块周围有 50 万字的规范文档,那 Agent 读的正是这些文档。解决文档环境,而不只是入口。

Agent 到底怎么发现你的文档

研究追踪了数百次会话的文档发现行为,数据很有指导意义:

文档类型 发现率
AGENTS.md 100% 自动发现
AGENTS.md 中引用的文档 90%+ 按需加载
当前目录的 README.md 80%+ 会读取
子目录的 README.md ~40%
_docs/ 中的孤立文档 <10%

一个服务有 30K 详细的协议设计、限流规则、安全文档放在 _docs/ 目录。Agent 在数十次会话中从未打开过其中大多数文件。

AGENTS.md 是唯一有可靠发现率的文档位置。 需要被看到的内容,要么放在那里,要么从那里直接引用。

实操:如何迁移现有文档

大部分人已经有散落在 repo 各处的 README、架构文档、设计规范。怎么把这些变成 Agent 真正能用的东西?

能不能直接把 README.md 改名为 AGENTS.md?

可以,但要大刀阔斧地删。Agent 现在对代码库摘要的能力已经够强了,很多给人看的铺垫性内容 Agent 不需要。保留短小精悍的结构,按上面的模式组织,砍掉所有「给人扫一眼」的段落。

保持聚焦

  • 一个 AGENTS.md 中引用不超过 10-15 个参考文档
  • 审计周围环境:如果模块周围有几十个架构文档和规范文件,Agent 会找到并阅读它们,不管你有没有引用
  • 一个 150 行的精炼 AGENTS.md 放在 50 万字的规范堆上,救不了 Agent

AGENTS.md 不是唯一路径

Agent 也能通过 grep 和语义搜索找到参考资料。研究中约一半的搜索结果来自这些工具,而非 AGENTS.md 引用。如果你保留旧文档,确保里面包含可搜索的代码示例和描述性文本。


作者: itech001
来源: 公众号:AI人工智能时代
主页: https://www.theaiera.cn,每日分享最前沿的AI新闻和技术。

本文首发于 AI人工智能时代,转载请注明出处。