惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

F
Fortinet All Blogs
爱范儿
爱范儿
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
B
Blog
WordPress大学
WordPress大学
Jina AI
Jina AI
GbyAI
GbyAI
aimingoo的专栏
aimingoo的专栏
N
Netflix TechBlog - Medium
腾讯CDC
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
阮一峰的网络日志
阮一峰的网络日志
The GitHub Blog
The GitHub Blog
V
Visual Studio Blog
Google DeepMind News
Google DeepMind News
月光博客
月光博客
博客园 - Franky
Y
Y Combinator Blog
MyScale Blog
MyScale Blog
大猫的无限游戏
大猫的无限游戏
Martin Fowler
Martin Fowler
雷峰网
雷峰网
小众软件
小众软件
H
Hackread – Cybersecurity News, Data Breaches, AI and More

暗无天日

读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 browser-harness:让 AI 直接接管你的浏览器 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 读 — Prompt Caching 省钱指南 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日
读:EvoForge——用群体进化优化 AI Agent - 暗无天日
2026-05-04 · via 暗无天日

优化 AI Agent 的时候,你是在手动调 prompt 和参数吗?如果答案是"是",那你的优化方式可能已经落后了。

有一组反直觉的数据:在一个叫 EvoForge 的开源系统上,GPT-5-nano(一个相对轻量的模型)跑出了 Codex CLI 2 倍的性能,是对照 baseline 的 10 倍。靠的是更聪明的优化流程,而不是更强的模型。

这说明真正的瓶颈不在模型本身,在"如何组织优化过程"。

(本文基于 jdon.com 上关于 EvoForge 的介绍,提取通用原则。原文篇幅较长,我从 EvoForge 的设计中看到了几个对任何 AI 开发者都有启发的思路。)

手动调参的陷阱

手动优化单 agent 有两个很难绕开的坑。

局部最优。 改一个 prompt、调一个参数,效果好了就留下来,但你可能只是在附近的小坡上反复横跳。真正的更优解在别处,手动搜索效率太低,很难跳出去。

重复踩坑。 你修好了一个 bug,过几周又犯了同样的错。没有系统性的机制把"失败经验"沉淀下来,每一轮都在重复交学费。

这两个问题的根因是同一个:手动优化本质上是单点搜索,没有结构化的探索和记忆机制。

EvoForge 的思路:群体进化

EvoForge 的策略很简单:一个人反复刷题不如一整个班同时刷题、互相抄作业、总结错题、再进化下一轮。

具体来说,每一代会做以下几件事:

  1. 变异 :在当前最佳 agent 的基础上,生成多个变体(population)
  2. 并行测试 :每个变体独立跑 benchmark,输出 0.0 到 1.0 的分数
  3. 失败分析 :对每个变体的行为轨迹做语义分析,定位具体的失败点
  4. 知识共享 :汇总所有变体的失败模式,提取共性问题,写入共享知识库
  5. 继承 :下一代 agent 继承这些知识,避免重复同样的错误

这五步形成一个闭环,不断重复。

关键突破不在"进化"这个词本身,而在"知识在群体中传播"。每一代不是从零开始,而是带着前一代的经验继续前进。

反向直觉的设计:没有 agent 被淘汰

很多人以为进化算法就是"强者留下,弱者淘汰"。但 EvoForge 做了一个相反的设计:没有 agent 被抛弃,整个群体一起变强。

这是怎么做到的?

每一轮结束后,系统不是只保留最优 agent,而是汇总所有 agent 的失败模式,统一归纳错误类型,给出修复方向,写入共享知识库。下一代所有 agent 继承这些经验。

结果就是:哪怕某个 agent 本身很弱,它也不会一直弱,因为它继承了集体智慧。

这和单点优化形成了鲜明对比。单 agent 的问题是:你犯过的错,下次还可能再犯。而 EvoForge 的逻辑是:一个人踩坑,全体绕坑。

三层分离的设计哲学

EvoForge 还有一个设计:它把"代码逻辑"和"进化策略"彻底分开了。

系统核心由三个文件驱动:

  • evolve.md :定义进化规则(群体规模、选择策略、变异方式)
  • program.md :定义 meta-agent,它负责修改 agent 本身
  • agent.py :真正被优化的 agent 对象

人类不直接写 agent,而是写"如何进化 agent"。这个抽象层级比普通 prompt engineering 已经高了一层。

语义可观测性:知道为什么失败

AI 优化中最难的地方是:你根本不知道 agent 为什么失败。

EvoForge 引入了 Semantic Observability(语义可观测性),强制做"失败解剖":

  1. 分阶段分析 agent 行为
  2. 找出具体的错误决策点
  3. 解释为什么失败
  4. 输出结构化的分析结果

这一步把"感觉不行"变成了"具体哪里不行"。没有这一步,进化就变成了盲目试错。

对 AI 开发者的启示

EvoForge 是一个具体的工具,但它的设计思路对所有 AI 开发者都有参考价值。

手动调 prompt 最大的问题是不可追溯、不可复现。如果你能把自己的优化过程拆成"生成变体→测试→分析→总结→迭代"的循环,哪怕不用 EvoForge,效率也会提升。

修好一个 bug 不叫优化,把 bug 的分析结果写进"共享知识库"才叫优化。对我来说,这意味着在 Claude Code 的使用中,每次失败的对话都应该被记录和分析,而不是用完就丢。

还有一点:GPT-5-nano + EvoForge 能跑赢 Codex CLI,说明流程的优化空间可能比模型升级更大。在追求更强模型之前,先问问自己:优化流程本身是不是已经最优了?

总结

EvoForge 不是在优化 agent,而是在优化"如何产生 agent"。它用群体进化代替手动调参,用语义分析代替盲目试错,用知识共享代替重复踩坑。真正的突破不在模型,而在流程设计。